Ajan 'tamamlandı' diyor, veritabanı başka bir şey söylüyor: ThinkingBox çalışması
ThinkingBox adında bir sandbox ve 507 durumlu iş akışından oluşan bir test seti kurmuşlar. Her görevde bir başlangıç veritabanı, bir kullanıcı hedefi, MCP araçları ve şirket politikası var. Değerlendirme modelin ne dediğine değil, iş bittikten sonra veritabanında neyin değiştiğine bakıyor. Yanlış alan, eksik değişiklik ya da fazladan yapılan bir işlem varsa görev başarısız. Yazıdaki örnek çok tanıdık: kargo istisnasında kalmış bir sipariş, ajan dokuz düzgün araç çağrısı yapıyor, politikayı doğru okuyor ve talebi çözüldü diye kapatıyor. Oysa doğru son durum beklemeye almaktı.
Beni en çok düşündüren kısım tutarlılık. Her görev her modelle 20 kere çalıştırılmış. Kimi-K3 görevlerin yüzde 93,89'unu en az bir kere çözmüş ama sadece yüzde 13,41'ini yirmide yirmi geçmiş. Claude Opus 5'te bu oranlar yüzde 79,09 ve yüzde 47,53. Yani demoda bir kere çalışan ajan, sahada her gün çalışan ajan değil. Başarısız denemelerin üçte ikisinden fazlası da temiz bitmiş, durum değiştiren bir araç çağırmış ve hiçbir hata vermemiş. Loglara bakan biri her şeyi yolunda sanır.
Maliyette de güzel bir ayrım yapmışlar: başarılı deneme başına maliyet ile yirmide yirmi geçen görev başına maliyet farklı sıralamalar veriyor. Başarı başına en ucuz model, güvenilir görev hesabında daha pahalıya geliyor. Rakamların liste fiyatlarından tahmin olduğunu, gerçek fatura olmadığını da belirtiyorlar.
Önerileri bizim sahada öğrendiklerimizle örtüşüyor: işlemi kaydetmeden önce son durumu kontrol etmek, hataları sınıflandırıp sadece kurtarılabilir olanları tekrar denemek, araç sayısını azaltmak ve geri alınması zor işlemlerde insan onayı istemek. Görevlerin sentetik olduğunu da not edeyim, gerçek müşteri verisi yok. Yine de kendi ajanınızı aynı mantıkla test etmek için iyi bir şablon.



@endof