Daha iyi bir Türkiye mümkün! Türkiye'nin girişimcilik ve inovasyon topluluğu·2018'den beri

Yapay Zeka (ai)

/yapayzeka

Bu toplulukta yapay zekâ ile ilgili yeni araçlar, kullanım senaryoları, proje fikirleri, etik tartışmalar, iş dünyasındaki uygulamalar, eğitimde AI kullanımı ve Türkiye’de yapay zekânın gelişimine katkı sunabilecek çalışmalar paylaşılabilir.

#yapay zeka (ai) akışına dön
@madda · 2 gün önce

Türkçe cevapları hakem modele puanlattık, insan etiketçilerle uyum beklediğimizden düşük çıktı

Veri etiketleme ve model değerlendirme işi yapıyorum. Son projede bir müşterinin Türkçe müşteri hizmetleri asistanının cevaplarını değerlendiriyorduk. Müşteri her hafta binlerce cevabı insanlara puanlatmak yerine bir hakem modele puanlatmak istedi, maliyet yüzünden. Biz de önce bunun güvenilir olup olmadığını ölçmeyi önerdik.

400 cevaplık bir set hazırladık. Her cevabı üç insan etiketçi 1 ile 5 arasında puanladı: doğruluk, nezaket ve politikaya uygunluk. Aynı seti iki farklı büyük modele hakem olarak verdik, puanlama yönergesi insanlarınkiyle birebir aynıydı.

Doğrulukta uyum fena değildi, insan ortalamasıyla bir puan farkı içinde kalan cevaplar yüzde 80'in üstündeydi. Nezaket tarafında işler karıştı. Hakem modeller uzun, bol özür dileyen, resmi cevaplara sürekli yüksek puan verdi. İnsan etiketçiler ise bunların bir kısmını robot gibi bulup düşük puanladı. Türkçede 'sayın müşterimiz, yaşadığınız olumsuzluk için tekrar tekrar özür dileriz' gibi kalıplar insanlara samimiyetsiz geliyor, model bunu fark etmiyor. İki hakemden biri de kendi yazım tarzına benzeyen cevapları belirgin şekilde kayırdı. Bunu ancak cevapları uzunluk ve üslup grubuna göre ayırınca gördük.

Politikaya uygunlukta en büyük sorun eksik bilgiydi. İnsan etiketçi 'bu cevapta iade süresi yanlış' diye yakaladı, hakem model iade süresini bilmediği için cevap kendinden emin göründüğü sürece geçirdi. Politika metnini hakeme verince bu kısım ciddi şekilde düzeldi.

Müşteriye karma bir kurulum önerdik. Doğruluk ve politika için hakem model, yanında politika belgesiyle. Nezaket ve ton için haftada 100 cevaplık insan örneklemi. Her ay hakemle insanların uyumunu yeniden ölçüyoruz, çünkü model sürümü değişince puanlama alışkanlığı da değişebiliyor. Hakem model kullanmayın demiyorum, ama Türkçede ton gibi kültürel bir şeyi ona bırakmadan önce mutlaka kendi verinizle kıyaslayın.
10 2 yorum
Yorumlar (2)
@menamen · 2 gün önce 0
Nezaket kısmı çevirmen olarak çok tanıdık. Modellerin Türkçe resmiyet algısı çoğu zaman İngilizceden çevrilmiş gibi, bir kademe fazla resmi ve fazla özür dileyen. Hakem modele birkaç iyi ve kötü Türkçe örnek vermeyi denediniz mi? Çeviri kalitesini puanlatırken örnekli yönerge bizde uyumu gözle görülür artırmıştı.
@madda · 2 gün önce 2
Denedik, her puan seviyesi için iki örnek koyduk. Nezaketteki uyum biraz arttı ama insan seviyesine yaklaşmadı. Asıl fark örnekleri gerçek müşteri şikayetlerinden seçince oldu, sentetik örneklerin etkisi azdı. Bu arada üslup kayırmasını azaltmak için cevapları hakeme göstermeden önce imza ve selamlama kısımlarını kırpmak da işe yaradı.