Türkiye'nin en büyük inovasyon ve girişimcilik bültenine katılın
Kanallar İlham Uygulamalar SSS Sözlük Giriş Üye Ol

Yapay Zeka (ai)

/yapayzeka · 8.YIL

Bu toplulukta yapay zekâ ile ilgili yeni araçlar, kullanım senaryoları, proje fikirleri, etik tartışmalar, iş dünyasındaki uygulamalar, eğitimde AI kullanımı ve Türkiye’de yapay zekânın gelişimine katkı sunabilecek çalışmalar paylaşılabilir.

94 içerik Katıl
#yapay zeka (ai) akışına dön
@sourdiesel · 10 gün önce

Türkçe için yapay zekâ: Neden İngilizce kadar iyi çalışmıyor ve ne yapılabilir

Modellerin Türkçe performansı son yıllarda çok gelişti ama İngilizce ile arada hâlâ bir fark var. Sebeplerini bilmek, pratikte daha iyi sonuç almanızı sağlıyor.

Birinci sebep veri hacmi. Eğitim verisinin büyük kısmı İngilizce. Türkçe içerik oranı çok daha küçük ve bu doğrudan performansa yansıyor.

İkinci sebep dil yapısı. Türkçe eklemeli bir dil ve tek bir kelime, başka dillerde cümleyle ifade edilen anlamı taşıyabiliyor. Modellerin metni parçalara ayırma yöntemi çoğunlukla İngilizce yapısına göre optimize edilmiş durumda. Sonuç olarak aynı anlamı taşıyan Türkçe metin daha fazla parçaya bölünüyor.

Bunun pratik sonuçları: aynı metin Türkçede daha pahalıya geliyor, bağlam penceresine daha az metin sığıyor ve bazı kelimelerde anlam parçalanması yaşanıyor.

Üçüncü sebep kültürel bağlam. Deyimler, atasözleri, resmi yazışma üslubu ve alan terminolojisi konusunda modeller zayıf kalabiliyor. Özellikle hukuk ve kamu yazışması dilinde bu fark belirgin.

Pratikte daha iyi sonuç almak için:

Talimatı İngilizce, içeriği ve çıktıyı Türkçe tutmak bazı modellerde daha iyi sonuç veriyor. Denemeye değer.

Örnek vermek Türkçede daha çok fark yaratıyor. İstediğiniz üslubu iki üç örnekle göstermek, tarif etmekten etkili.

Terminoloji sözlüğü eklemek. Alan terimlerinin doğru karşılıklarını isteme koymak, yanlış çeviri sorununu büyük ölçüde çözüyor.

Çıktıyı kontrol etmek. Özellikle özel isimler, sayılar ve tarihlerde hata oranı Türkçede biraz daha yüksek.

Türkçe açısından asıl katkı alanı kaliteli veri derlemek. Açık Türkçe veri kümeleri, değerlendirme setleri ve alan sözlükleri üretmek, bu farkı kapatmanın en doğrudan yolu ve üniversiteler için gerçek bir fırsat.
0 2 yorum
Yorumlar (2)
@gokhancetin · 9 gün önce 1
Terminoloji sözlüğü tavsiyesini uyguladım ve fark gerçekten büyük.

Teknik bir alanda çalışıyoruz ve model terimleri genel Türkçeye çeviriyordu, sektörde kullanılan karşılıkları değil. İsteme kısa bir terim listesi eklediğimizde sorun neredeyse tamamen çözüldü.

Listeyi uzun tutmaya gerek yok, en çok geçen yirmi terim yeterli oluyor.

Bir de şu işe yarıyor: kurum içinde daha önce yazılmış iyi bir metni örnek olarak vermek. Model üslubu oradan alıyor ve çıktı kuruma ait gibi duruyor.

Bu iki müdahale toplamda yarım saatlik iş ve her çıktıda karşılığını veriyor.
@newday · 8 gün önce 6
Veri derleme konusundaki fırsat vurgusuna katılıyorum, buna somut bir örnek ekleyeyim.

Türkçe için en çok eksik olan şey değerlendirme setleri. Yani bir modelin Türkçede ne kadar iyi olduğunu ölçecek, üzerinde uzlaşılmış test kümeleri.

Bu setler olmadan herkes kendi izlenimiyle konuşuyor ve tartışma ilerlemiyor. Bir üniversite grubu iyi hazırlanmış bir Türkçe değerlendirme seti yayımlasa, alana ciddi katkı olur ve uluslararası görünürlük de getirir.

Benzer şekilde alan bazlı Türkçe derlemler de değerli. Hukuk, tıp, mühendislik metinlerinden oluşan temiz veri kümeleri hem araştırmaya hem uygulamaya hizmet ediyor.

Bu tür işler büyük bütçe gerektirmiyor, emek ve süreklilik gerektiriyor.