Daha iyi bir Türkiye mümkün! Türkiye'nin girişimcilik ve inovasyon topluluğu·2018'den beri

Yapay Zeka (ai)

/yapayzeka

Bu toplulukta yapay zekâ ile ilgili yeni araçlar, kullanım senaryoları, proje fikirleri, etik tartışmalar, iş dünyasındaki uygulamalar, eğitimde AI kullanımı ve Türkiye’de yapay zekânın gelişimine katkı sunabilecek çalışmalar paylaşılabilir.

#yapay zeka (ai) akışına dön
@endof · 5 gün önce huggingface.co ↗

Ajan 'tamamlandı' diyor, veritabanı başka bir şey söylüyor: ThinkingBox çalışması

Otomasyon ajansında müşterilere ajan kurarken en çok canımızı yakan şey modelin hata yapması değil, hatayı bitti diye raporlaması. Microsoft'un Copilot Studio ekibiyle Hugging Face'in birlikte yayımladığı bu yazı tam bu konuyu ölçmüş.

ThinkingBox adında bir sandbox ve 507 durumlu iş akışından oluşan bir test seti kurmuşlar. Her görevde bir başlangıç veritabanı, bir kullanıcı hedefi, MCP araçları ve şirket politikası var. Değerlendirme modelin ne dediğine değil, iş bittikten sonra veritabanında neyin değiştiğine bakıyor. Yanlış alan, eksik değişiklik ya da fazladan yapılan bir işlem varsa görev başarısız. Yazıdaki örnek çok tanıdık: kargo istisnasında kalmış bir sipariş, ajan dokuz düzgün araç çağrısı yapıyor, politikayı doğru okuyor ve talebi çözüldü diye kapatıyor. Oysa doğru son durum beklemeye almaktı.

Beni en çok düşündüren kısım tutarlılık. Her görev her modelle 20 kere çalıştırılmış. Kimi-K3 görevlerin yüzde 93,89'unu en az bir kere çözmüş ama sadece yüzde 13,41'ini yirmide yirmi geçmiş. Claude Opus 5'te bu oranlar yüzde 79,09 ve yüzde 47,53. Yani demoda bir kere çalışan ajan, sahada her gün çalışan ajan değil. Başarısız denemelerin üçte ikisinden fazlası da temiz bitmiş, durum değiştiren bir araç çağırmış ve hiçbir hata vermemiş. Loglara bakan biri her şeyi yolunda sanır.

Maliyette de güzel bir ayrım yapmışlar: başarılı deneme başına maliyet ile yirmide yirmi geçen görev başına maliyet farklı sıralamalar veriyor. Başarı başına en ucuz model, güvenilir görev hesabında daha pahalıya geliyor. Rakamların liste fiyatlarından tahmin olduğunu, gerçek fatura olmadığını da belirtiyorlar.

Önerileri bizim sahada öğrendiklerimizle örtüşüyor: işlemi kaydetmeden önce son durumu kontrol etmek, hataları sınıflandırıp sadece kurtarılabilir olanları tekrar denemek, araç sayısını azaltmak ve geri alınması zor işlemlerde insan onayı istemek. Görevlerin sentetik olduğunu da not edeyim, gerçek müşteri verisi yok. Yine de kendi ajanınızı aynı mantıkla test etmek için iyi bir şablon.
5 5 yorum
Yorumlar (5)
@noway · 5 gün önce 0
Kargo istisnası örneği beni benden aldı. E-ticarette tam bu oluyor: müşteriye 'iadeniz onaylandı' mesajı gidiyor, depo sisteminde kayıt açılmamış. Bizde bunu ajan değil iki sistem arasındaki zayıf bir entegrasyon yapıyordu ama sonuç aynıydı. Ajan kuracaksam ilk işim son durum kontrolünü ayrı bir adım yapmak olur.
@madda · 5 gün önce 0
Değerlendirme tarafından bakınca en değerli kısım yirmide yirmi metriği. Biz müşterilere hâlâ tek koşu sonucu raporluyoruz çünkü 20 koşu pahalı. Ama tutarlılığı ölçmeden verilen başarı oranı neredeyse anlamsız. Bunu okuduktan sonra en azından önemli görevlerde 5 koşuyu standart yapmayı önereceğim.
@mean · 4 gün önce 0
Küçük bir itirazım var: seti bir ürün ekibi hazırlamış, sıralamaya o gözle bakmak lazım. Yöntem sağlam görünüyor, son durumu karşılaştırmaları güzel. Ama sentetik görevlerdeki sıralamayı kendi işinize taşımadan önce kendi 30 40 görevinizle aynı testi yapın derim.
@endof · 4 gün önce 3
Haklısın, sıralamayı ben de çok ciddiye almıyorum, zaten alana göre fark çok büyük. Yazıda aynı modelin perakende görevlerinde yüzde 68 civarı, kasko görevlerinde yüzde 8 civarı aldığı bir örnek var. Benim için değerli olan hata türü dağılımı: başarısızlıkların büyük kısmı araç kullanımı ve hatadan toparlanma, akıl yürütme değil. Bu da düzeltilebilir bir şey.
@damon · 4 gün önce 5
Geri alınması zor işlemlerde insan onayı kısmını kliniklere kurduğum sistemde baştan beri uyguluyorum, randevu iptali ve ödeme iadesi otomatik gitmiyor. Müşteriler ilk başta her şey otomatik olsun diyor, bir kere yanlış iptal yaşanınca fikir değiştiriyorlar. Bu yazıyı onlara göstermek için kaydettim.