Açık kaynak kodlama asistanı Aider'ın tuttuğu model sıralaması; kod düzenleme görevlerinde başarı ve maliyet. Pratik kod işi için model seçerken en çok bakılan tablolardan. aider.chat/docs/leaderboards
inovanadolu Sözlük, içeriği kullanıcılar tarafından oluşturulan, inovasyon, girişimcilik, teknoloji vb. konularda başlıkların oluşturulduğu ve tanımlandığı, kategorisindeki en büyük Türkçe kaynaktır.
Açık kaynak kodlama asistanı Aider'ın tuttuğu model sıralaması; kod düzenleme görevlerinde başarı ve maliyet. Pratik kod işi için model seçerken en çok bakılan tablolardan. aider.chat/docs/leaderboards
Arena'nın web arayüzü üretimi için özel liderlik tablosu; iki modele aynı sayfayı yaptırıp kullanıcılar oyluyor. Arayüz kodlamada hangi model önde sorusu için. arena.ai/leaderboard/code/webdev
Kodlama modellerinin referans ölçütü; modele gerçek GitHub sorunlarını verip düzeltme yamasını yazmasını istiyor, testler geçerse başarılı sayılıyor. Princeton kaynaklı. Kodlama yeteneği iddialarının kanıtı bu tablo. sw
Kodlama modellerini gerçek yazılım mühendisliği görevlerinde ölçen liderlik tablosu; kodu GitHub'da. deepswe.datacurve.ai
Modellerin Minecraft içinde yapı üretme becerisini ölçen benchmark; uzamsal düşünme ve talimat takibinin sıra dışı bir testi. voxelbench.ai
Dil modellerini birbirine karşı satranç oynatıp sıralayan platform; hamle geçerliliği ve kazanma oranı ölçülüyor. Akıl yürütme testinin eğlenceli hali. chessarena.ai
Yanlış öncüllü soruları modelin fark edip edemediğini ölçen test; "Einstein 1990'da hangi ödülü aldı" gibi tuzaklara kapılıyor mu. Halüsinasyon eğiliminin pratik ölçümü. petergpt.github.io/bullshit-benchmark
Modellerin hangi konularda cevap vermeyi reddettiğini ölçen benchmark; sansür ve içerik politikası karşılaştırması. Kodu GitHub'da. Hangi model neyi konuşmuyor sorusunun veriye dayalı cevabı. speechmap.ai
İnsanların kolayca çözdüğü ama modellerin zorlandığı sağduyu ve tuzak sorulardan oluşan benchmark. İnsan ortalaması yüzde doksan civarı, en iyi modeller altında kalıyor. Modellerin nerede hâlâ zayıf olduğunu gösteren nad
Finans, vergi, hukuk ve kodlama gibi mesleki alanlarda model doğruluğunu ölçen benchmark platformu. Genel sohbet değil, uzman işi yapabiliyor mu sorusuna odaklanıyor. Kurumsal alıcılar için değerli. vals.ai
Modelleri yeni yayınlanan matematik yarışması sorularıyla test eden benchmark; sorular modelin eğitim verisinde olamayacağı için ezber ihtimalini eliyor. Matematik yeteneğinin en dürüst ölçümlerinden. matharena.ai
Modellerin üniversite düzeyi matematik sorularındaki başarısını ölçen benchmark ve liderlik tablosu. pellaml.github.io/iumb
Modellerin duygusal zekâsını ve yaratıcı yazım kalitesini ölçen benchmark; teknik benchmark'ların kaçırdığı boyutu ölçüyor. Kodu GitHub'da. Hikâye yazımı için model seçerken bakılacak yer. eqbench.com
Görsel anlayan modellerin (VLM) benchmark toplayıcısı; hangi model görseli daha iyi okuyor, OCR ve grafik anlamada kim önde. Hugging Face üzerinde. huggingface.co/spaces/opencompass/open_vlm_leaderboard
Yapay zeka gelişimini eğitim hesaplama gücü, veri ve benchmark'lar üzerinden takip eden araştırma kuruluşu; ECI endeksi birden fazla benchmark'ı tek sayıda birleştiriyor. Yapay zeka trendlerini rakamla konuşmak isteyenle
Wolfram'ın dil modellerini matematiksel doğruluk ve hesaplama sorularında test eden projesi. Modellerin gerçekten hesap yapıp yapamadığını görmek için. wolfram.com/llm-benchmarking-project
Sohbet botu liderlik tablosu; Arena verilerini ve diğer benchmark'ları bir araya getiriyor. openlm.ai/chatbot-arena
Model istatistikleri, benchmark skorları ve karşılaştırma tabloları; yeni model çıktığında hızlı güncelleniyor. llm-stats.com
Modellerin genel yetenek sıralaması; birden fazla benchmark'ı birleştiriyor. rankedagi.com
Modellerin uzun bağlam performansını ölçen benchmark; yüz binlerce token içinde bilgiyi bulup kullanabiliyor mu sorusunun cevabı. Uzun doküman işi yapanlar için kritik. contextarena.ai
inovanadolu Sözlük, üyelerin katkısıyla 8 yıldır büyüyen bir inovasyon ve girişimcilik sözlüğü. Başlık açmak üç adım:
AraHakkında başlık açacağın kişi, girişim ya da kavramı önce ara; belki başlık zaten vardır, tanımını oraya yazarsın.
OluşturAradığın başlık sözlükte hiç yoksa, aynı sayfada kategori seçip ilk tanımı yazarak başlığı açarsın.
İçerikİlk tanım bilgi içermeli; yalnızca kişisel bir değerlendirme olmamalı. Kaynak göster, gerekirse başka başlıklara bağlantı ver.
Öncesinde Sözlük Kuralları'nı okumanı öneririz.