Türkçe metinlerde API faturası neden İngilizcenin neredeyse iki katı çıkıyor, nasıl bütçeliyorsunuz?
Merak edip ölçtüm. Yaklaşık 2.000 kelimelik bir İngilizce makaleyi ve onun benim yaptığım Türkçe çevirisini aynı modelin token sayacından geçirdim. İngilizce metin 2.700 civarı token tuttu, Türkçesi 4.600 civarı. Üstelik kelime sayısı olarak Türkçe daha kısa. Eklerden kaynaklandığını tahmin ediyorum, 'çalıştırabileceklerimizden' gibi bir kelime parça parça bölünüyor. Sağlayıcıya göre oran değişiyor, birinde 1,4 kat, birinde 1,8 kat gördüm.
Bu benim için iki yerden can yakıyor. Çıktı tokenı girdiden pahalı ve ben Türkçe çıktı aldığım için en pahalı kısım en çok şişen kısım oluyor. Bir de bağlam penceresi var: uzun bir sözleşmeyi tek seferde verdiğimde Türkçe hali sınıra çok daha çabuk dayanıyor.
Talimatları İngilizce yazmayı denedim, sistem mesajı kısaldı ama asıl metin zaten Türkçe olduğu için etkisi sınırlı kaldı. Terimce listesini her istekte göndermek yerine önbelleğe aldım, bu gerçekten işe yaradı, girdi tarafında ciddi düşüş oldu. Küçük modelle ilk taslak alıp sadece zor paragrafları büyük modele göndermeyi de denedim ama kalite düştü, devrik cümlelerde küçük model saçmalıyor.
Sorum şu: Türkçe ağırlıklı iş yapanlar maliyeti nasıl hesaplıyor? Teklif verirken kelime başına mı düşünüyorsunuz, token başına mı? Türkçeyi daha verimli bölen bir model ya da sağlayıcı fark ettiyseniz onu da duymak isterim. Tokenizer'ı Türkçeye daha uygun bir model, kalitesi biraz düşük olsa bile toplamda kârlı çıkabilir diye düşünüyorum.



@menamen