Model sunumunu ölçeklendirmek: Aynı donanımdan kaç kat fazla verim alınır
Temel fikir, aynı anda gelen çok sayıda isteği tek bir donanımda verimli şekilde işlemek. Bunu sağlayan iki ana teknik var: dikkat mekanizmasının bellekte tutulan ara sonuçlarını sayfalama yöntemiyle yönetmek ve gelen istekleri sürekli akan bir yığın halinde işlemek.
Pratik sonucu, aynı ekran kartından çok daha fazla eşzamanlı kullanıcıya hizmet verebilmek. Tek kullanıcı için fark hissedilmiyor ama onlarca eşzamanlı istek olduğunda aradaki fark ciddi.
Belgelerde yer alan konular: kurulum ve model yükleme, bellek yönetimi ayarları, nicemlenmiş model çalıştırma, birden fazla ekran kartına dağıtma ve standart bir API arayüzü sunma.
Standart API uyumluluğu özellikle pratik. Mevcut kodunuzu değiştirmeden sağlayıcı adresini kendi sunucunuza çevirebiliyorsunuz.
Kurumsal ortamda veri dışarı çıkmadan model kullanmak isteyenler için, yerel çalıştırmadan bir sonraki adım burası.

@sametay