afkfatih/turkish-llm-leaderboard
Türkçe LLM Liderlik Tablosu
Açık kaynak dil modellerinin Türkçe performansını karşılaştırmalı olarak ölçen bir değerlendirme tablosu.
Her model altı standart görevde — Belebele, XCOPA, XNLI, XQuAD, TurkishMMLU ve EXAMS — aynı değerlendirme kodu ve görev başına özdeş istem şablonlarıyla, sabit tohum altında ve tüm modeller için aynı örnek kümesiyle değerlendirilir. Sonuçlar üç kategoride toplanır: dil anlama, bilgi ve soru cevap.
Puanlar 0–100 aralığındadır ve yüksek değer daha iyi performansı gösterir. Model adının yanındaki etiket, ölçümün yapıldığı nicemleme düzeyini belirtir.
Kapsam ve sınırlar
Güncel ölçümler her görevin tam test kümesi üzerinde yapılır — Belebele 900, XCOPA 500, XNLI 5.010, XQuAD 1.190, TurkishMMLU 900, EXAMS 977; toplam 9.477 soru. Küçük bir alt küme üzerinde ölçülen satırlar derece (°) işaretiyle gösterilir. Ölçümler ağırlıklı olarak 4-bit nicemlenmiş GGUF sürümleriyle ve sıfır-atışlı yapılır.
Veri
Tüm ölçüm sonuçları `data.json` dosyasında tutulur; index.html bu dosyayı çalışma anında okur. Space herkese açıktır, dolayısıyla hem sayfa kaynağı hem de sonuç dosyası herkes tarafından görüntülenebilir — ölçüm sonuçları zaten yayımlanmak üzere üretilmiştir.
Veri kümeleri
Her veri kümesinin lisansı ve kullanım koşulları kendi sayfasında geçerlidir. Bu Space yalnızca ölçüm sonuçlarını yayımlar; Apache-2.0 lisansı sayfanın kendi kaynak koduna aittir.
Katkı
Eklenmesini istediğiniz bir model varsa Community sekmesinden bildirebilirsiniz.
