CoolFace
Apppublic

afkfatih/turkish-llm-leaderboard

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes
App README

Türkçe LLM Liderlik Tablosu

Açık kaynak dil modellerinin Türkçe performansını karşılaştırmalı olarak ölçen bir değerlendirme tablosu.

Her model altı standart görevde — Belebele, XCOPA, XNLI, XQuAD, TurkishMMLU ve EXAMS — aynı değerlendirme kodu ve görev başına özdeş istem şablonlarıyla, sabit tohum altında ve tüm modeller için aynı örnek kümesiyle değerlendirilir. Sonuçlar üç kategoride toplanır: dil anlama, bilgi ve soru cevap.

Puanlar 0–100 aralığındadır ve yüksek değer daha iyi performansı gösterir. Model adının yanındaki etiket, ölçümün yapıldığı nicemleme düzeyini belirtir.

Kapsam ve sınırlar

Güncel ölçümler her görevin tam test kümesi üzerinde yapılır — Belebele 900, XCOPA 500, XNLI 5.010, XQuAD 1.190, TurkishMMLU 900, EXAMS 977; toplam 9.477 soru. Küçük bir alt küme üzerinde ölçülen satırlar derece (°) işaretiyle gösterilir. Ölçümler ağırlıklı olarak 4-bit nicemlenmiş GGUF sürümleriyle ve sıfır-atışlı yapılır.

Veri

Tüm ölçüm sonuçları `data.json` dosyasında tutulur; index.html bu dosyayı çalışma anında okur. Space herkese açıktır, dolayısıyla hem sayfa kaynağı hem de sonuç dosyası herkes tarafından görüntülenebilir — ölçüm sonuçları zaten yayımlanmak üzere üretilmiştir.

Veri kümeleri

GörevKaynakBölüm
Belebelefacebook/belebeletur_Latn / test
XCOPAxcopatr / test
XNLIxnlitr / test
XQuADgoogle/xquadxquad.tr / validation
TurkishMMLUAYueksel/TurkishMMLUtest
EXAMSmhardalov/examsmultilingual / test, Türkçe

Her veri kümesinin lisansı ve kullanım koşulları kendi sayfasında geçerlidir. Bu Space yalnızca ölçüm sonuçlarını yayımlar; Apache-2.0 lisansı sayfanın kendi kaynak koduna aittir.

Katkı

Eklenmesini istediğiniz bir model varsa Community sekmesinden bildirebilirsiniz.