Daha iyi bir Türkiye mümkün! Türkiye'nin girişimcilik ve inovasyon topluluğu·2018'den beri

Yapay Zeka (ai)

/yapayzeka

Bu toplulukta yapay zekâ ile ilgili yeni araçlar, kullanım senaryoları, proje fikirleri, etik tartışmalar, iş dünyasındaki uygulamalar, eğitimde AI kullanımı ve Türkiye’de yapay zekânın gelişimine katkı sunabilecek çalışmalar paylaşılabilir.

#yapay zeka (ai) akışına dön
@menamen · 11 gün önce

Türkçe metinlerde API faturası neden İngilizcenin neredeyse iki katı çıkıyor, nasıl bütçeliyorsunuz?

Haftalık bir bülten çıkarıyorum, bir de yan iş olarak teknik çeviri yapıyorum. Son altı aydır çevirilerin ilk taslağını bir API üzerinden alıp kendim düzeltiyorum. Ay sonunda faturayı açınca bir şey dikkatimi çekti: aynı uzunlukta İngilizce ve Türkçe metinlerde Türkçe taraf belirgin şekilde pahalı.

Merak edip ölçtüm. Yaklaşık 2.000 kelimelik bir İngilizce makaleyi ve onun benim yaptığım Türkçe çevirisini aynı modelin token sayacından geçirdim. İngilizce metin 2.700 civarı token tuttu, Türkçesi 4.600 civarı. Üstelik kelime sayısı olarak Türkçe daha kısa. Eklerden kaynaklandığını tahmin ediyorum, 'çalıştırabileceklerimizden' gibi bir kelime parça parça bölünüyor. Sağlayıcıya göre oran değişiyor, birinde 1,4 kat, birinde 1,8 kat gördüm.

Bu benim için iki yerden can yakıyor. Çıktı tokenı girdiden pahalı ve ben Türkçe çıktı aldığım için en pahalı kısım en çok şişen kısım oluyor. Bir de bağlam penceresi var: uzun bir sözleşmeyi tek seferde verdiğimde Türkçe hali sınıra çok daha çabuk dayanıyor.

Talimatları İngilizce yazmayı denedim, sistem mesajı kısaldı ama asıl metin zaten Türkçe olduğu için etkisi sınırlı kaldı. Terimce listesini her istekte göndermek yerine önbelleğe aldım, bu gerçekten işe yaradı, girdi tarafında ciddi düşüş oldu. Küçük modelle ilk taslak alıp sadece zor paragrafları büyük modele göndermeyi de denedim ama kalite düştü, devrik cümlelerde küçük model saçmalıyor.

Sorum şu: Türkçe ağırlıklı iş yapanlar maliyeti nasıl hesaplıyor? Teklif verirken kelime başına mı düşünüyorsunuz, token başına mı? Türkçeyi daha verimli bölen bir model ya da sağlayıcı fark ettiyseniz onu da duymak isterim. Tokenizer'ı Türkçeye daha uygun bir model, kalitesi biraz düşük olsa bile toplamda kârlı çıkabilir diye düşünüyorum.
7 5 yorum
Yorumlar (5)
@madda · 11 gün önce 2
Ölçümün tutarlı, değerlendirme projelerinde benzer oranlar görüyoruz. Bir ek: aynı model ailesinin yeni sürümlerinde tokenizer değişebiliyor, yani geçen ayki oranın bu ay da geçerli olduğunu varsayma. Biz her model değişikliğinde 50 metinlik sabit bir Türkçe set üzerinden oranı yeniden çıkarıyoruz, yarım saatlik iş.
@ideefixe · 11 gün önce 4
Ben içerik tarafında kelime başı fiyat veriyorum, token müşterinin derdi değil. İç hesabımda Türkçe için 1,7 çarpanı kullanıyorum, biraz pay kalsın diye. Çeviri ve SEO metinlerinde asıl maliyet zaten benim düzeltme sürem, API faturası toplamın küçük bir kısmı. Sende de oran böyle olabilir, bir bak derim.
@menamen · 11 gün önce 0
Kaba bir hesap yaptım, haklısın. Aylık API tutarı düzeltmeye harcadığım saatlerin yanında küçük kalıyor. Beni asıl rahatsız eden bağlam penceresi kısmı. Uzun sözleşmeleri bölmek zorunda kalınca tutarlılık bozuluyor, aynı terim iki bölümde farklı çevriliyor.
@endof · 11 gün önce 3
Bağlam sorunu için şunu dene: metni bölmeden önce modele bir terim listesi ve bir paragraflık üslup notu çıkart, sonra her bölüme bunu sabit önek olarak ver. Önek önbelleğe girdiği için girdi maliyeti de çok artmıyor. Bir müşteride 80 sayfalık teknik şartnameyi böyle çevirdik, terim tutarsızlığı elle düzeltilebilecek seviyeye indi.
@amokachi · 10 gün önce 1
Tokenizer konusunu hiç bilmiyordum, okuyunca merak edip kendi ödevimi saydırdım. Gerçekten Türkçe kısım çok daha fazla tutuyor. Yeni başlayan biri olarak şunu sorayım, bu sayaçları nereden kullanıyorsunuz, her sağlayıcının kendi aracı mı var?