YusufSimsek/turkce-atasozleri-coktan-secmeli-benchmark
Türkçe Atasözleri Çoktan Seçmeli Benchmark Türkçe atasözlerinin anlamını ölçmek amacıyla hazırlanmış 100 soruluk çoktan seçmeli bir benchmark veri setidir. Her soruda dört seçenek bulunur. Doğru cevaplar dengeli dağıtılmıştır: A: 25 B: 25 C: 25 D: 25 Rastgele tahmin seviyesi: %25 Sorular, YusufSimsek/turkce-atasozleri-dataset veri setindeki 100 benzersiz atasözünden türetilmiştir. Veri alanları Alan Açıklama id Sorunun benzersiz kimliği proverb… See the full description on the dataset page: https://huggingface.co/datasets/YusufSimsek/turkce-atasozleri-coktan-secmeli-benchmark.
Türkçe Atasözleri Çoktan Seçmeli Benchmark
Türkçe atasözlerinin anlamını ölçmek amacıyla hazırlanmış 100 soruluk çoktan seçmeli bir benchmark veri setidir.
Her soruda dört seçenek bulunur. Doğru cevaplar dengeli dağıtılmıştır:
- A: 25
- B: 25
- C: 25
- D: 25
- Rastgele tahmin seviyesi: %25
Sorular, YusufSimsek/turkce-atasozleri-dataset veri setindeki 100 benzersiz atasözünden türetilmiştir.
Veri alanları
Kullanım
from datasets import load_dataset
dataset = load_dataset(
"YusufSimsek/turkce-atasozleri-coktan-secmeli-benchmark"
)
print(dataset["test"][0])Önerilen prompt
Aşağıdaki çoktan seçmeli Türkçe atasözü sorusunu cevapla.
Yalnızca doğru seçeneğin harfini yaz: A, B, C veya D.
{question}
A) {A}
B) {B}
C) {C}
D) {D}
Cevap:Önerilen üretim ayarları:
do_sample = False
max_new_tokens = 8Benchmark sonuçları
Sonuçlar accuracy metriğiyle hesaplanmıştır.
Hız değerleri farklı donanımlarda ölçüldüğü için tabloya eklenmemiştir.
Değerlendirme yöntemi
Tüm modeller aynı 100 soru, aynı seçenek sıralaması ve aynı istem şablonu kullanılarak değerlendirilmiştir.
Üretim sırasında rastgelelik kapatılmıştır:
do_sample = False
max_new_tokens = 8Modelden yalnızca A, B, C veya D harflerinden birini üretmesi istenmiştir. Sonuç metriği olarak accuracy kullanılmıştır:
Accuracy = Doğru cevap sayısı / Toplam soru sayısıDört seçenek bulunduğu için rastgele tahmin seviyesi %25tir.
Sonuçların kısa değerlendirmesi
Qwen/Qwen3.5-4B, 72 doğru cevap ve %72 başarı oranıyla test edilen modeller arasında en yüksek sonucu elde etmiştir.
meta-llama/Llama-3.1-8B-Instruct %68, mistralai/Ministral-3-3B-Instruct-2512 ise %66 başarı göstermiştir.
Temel google/gemma-3-4b-it modeli %63 başarı elde ederken, atasözü veri setiyle özelleştirilen YusufSimsek/gemma_3_lora modeli %58 başarı göstermiştir.
Bu sonuçlara göre özelleştirilmiş Gemma modeli, bu benchmark üzerinde temel Gemma modelinin 5 yüzde puan gerisinde kalmıştır. Bu durum fine-tune işleminin mevcut çoktan seçmeli değerlendirme biçiminde performans artışı sağlamadığını göstermektedir.
Rastgele tahmine göre fark
Karşılaştırma notları
Başarı oranları aynı soru seti ve aynı cevap formatı kullanılarak hesaplanmıştır.
Çalışma süresi ve VRAM değerleri bazı modellerde farklı GPU ve çalışma ortamlarında ölçüldüğü için doğrudan karşılaştırılmamıştır.
Benchmark yalnızca 100 soru içerdiğinden, modeller arasındaki küçük skor farkları kesin bir üstünlük kanıtı olarak değerlendirilmemelidir.
Ayrıca sorular, özelleştirilmiş Gemma modelinin eğitiminde kullanılan veri setindeki atasözlerinden türetilmiştir. Bu nedenle test, görülmemiş atasözlerine genellemeden çok eğitim alanı içindeki bilgi ve anlam eşleştirme başarısını ölçmektedir.
Dosyalar
data/test.csv: Ana test verisiextras/test.jsonl: JSONL sürümüextras/questions_only.jsonl: Cevapları çıkarılmış sorularextras/answer_key.json: Cevap anahtarıbenchmark_results.csv: Model sonuçları
Sınırlamalar
Bu benchmark eğitim veri setinde bulunan atasözlerinden hazırlanmıştır. Görülmemiş atasözlerine genelleme performansını ölçmez.
category alanı yardımcı analiz amacıyla eklenmiştir ve resmî bir dilbilimsel sınıflandırma değildir.
Kaynak
YusufSimsek/turkce-atasozleri-dataset
Lisans
Bu türetilmiş veri seti CC BY-SA 4.0 lisansı altında paylaşılmaktadır.
