State of AI 2026 raporu çıktı: kurumsal tarafta bana en çok dokunan iki bulgu
Genel çerçeve tahmin edilebilir: öncü modellerde yarış üç laboratuvar arasında sıkışmış, ajanlar gerçek işte değer üretmeye başlamış, çıkarım maliyeti hızla düşüyor. Epoch AI'ın tahminine göre sabit bir benchmark skorunu elde etmenin maliyeti 2023'ten beri her çeyrek yüzde 47 düşmüş, yıllık bazda kabaca 13 kata denk geliyor. Bütçe planlarken bu rakamı akılda tutmak lazım, bugün pahalı görünen bir kullanım senaryosu bir yıl sonra bambaşka bir hesap.
Bana en çok dokunan bulgu kontrollü bir çalışma. GLM-5.1 modelinin ağırlıklarına hiç dokunmadan, sadece araçlar, bağlam ve geri bildirim değiştirilerek 100 SWE-bench Verified görevinde başarı yüzde 52,5'ten yüzde 65,5'e çıkmış. Otomotiv tedarik zincirinde yaptığımız her pilotta ilk tartışma hangi model olacağı oluyor. Bu rakam modelin etrafındaki düzenin en az model kadar önemli olduğunu gösteriyor ve yönetime anlatması kolay bir veri.
İkinci bulgu tahminler kısmında. Gelecek 12 ay için yaptıkları dokuz tahminden biri, bir ajanın model yükseltmesi olmadan bir ay müşteri işinde çalıştıktan sonra yeni görevlerdeki hata oranını yarıya indirmesi. Gerçekleşir mi bilmem ama yön bence doğru: kurum içi verinin ve geri bildirim döngüsünün değeri artıyor. Benaich'in benimsemenin önündeki engeli teknoloji değil insan becerisi sorunu olarak tanımlaması da bizim fabrikalarda gördüğümüzle örtüşüyor.
Geçen yılın tahmin karnesini açıkça yayımlamaları da hoşuma gidiyor: iki isabet, beş kısmi, üç ıska. Kendi tahminlerini puanlayan rapor az. Rapor uzun, hepsini okumaya vakti olmayanlar için keşfet bölümü iyi bir giriş.



@beyazyakali