Türkçe cevapları hakem modele puanlattık, insan etiketçilerle uyum beklediğimizden düşük çıktı
400 cevaplık bir set hazırladık. Her cevabı üç insan etiketçi 1 ile 5 arasında puanladı: doğruluk, nezaket ve politikaya uygunluk. Aynı seti iki farklı büyük modele hakem olarak verdik, puanlama yönergesi insanlarınkiyle birebir aynıydı.
Doğrulukta uyum fena değildi, insan ortalamasıyla bir puan farkı içinde kalan cevaplar yüzde 80'in üstündeydi. Nezaket tarafında işler karıştı. Hakem modeller uzun, bol özür dileyen, resmi cevaplara sürekli yüksek puan verdi. İnsan etiketçiler ise bunların bir kısmını robot gibi bulup düşük puanladı. Türkçede 'sayın müşterimiz, yaşadığınız olumsuzluk için tekrar tekrar özür dileriz' gibi kalıplar insanlara samimiyetsiz geliyor, model bunu fark etmiyor. İki hakemden biri de kendi yazım tarzına benzeyen cevapları belirgin şekilde kayırdı. Bunu ancak cevapları uzunluk ve üslup grubuna göre ayırınca gördük.
Politikaya uygunlukta en büyük sorun eksik bilgiydi. İnsan etiketçi 'bu cevapta iade süresi yanlış' diye yakaladı, hakem model iade süresini bilmediği için cevap kendinden emin göründüğü sürece geçirdi. Politika metnini hakeme verince bu kısım ciddi şekilde düzeldi.
Müşteriye karma bir kurulum önerdik. Doğruluk ve politika için hakem model, yanında politika belgesiyle. Nezaket ve ton için haftada 100 cevaplık insan örneklemi. Her ay hakemle insanların uyumunu yeniden ölçüyoruz, çünkü model sürümü değişince puanlama alışkanlığı da değişebiliyor. Hakem model kullanmayın demiyorum, ama Türkçede ton gibi kültürel bir şeyi ona bırakmadan önce mutlaka kendi verinizle kıyaslayın.



@madda