CoolFace
Datasetpublic

YusufSimsek/turkce-atasozleri-coktan-secmeli-benchmark

Türkçe Atasözleri Çoktan Seçmeli Benchmark Türkçe atasözlerinin anlamını ölçmek amacıyla hazırlanmış 100 soruluk çoktan seçmeli bir benchmark veri setidir. Her soruda dört seçenek bulunur. Doğru cevaplar dengeli dağıtılmıştır: A: 25 B: 25 C: 25 D: 25 Rastgele tahmin seviyesi: %25 Sorular, YusufSimsek/turkce-atasozleri-dataset veri setindeki 100 benzersiz atasözünden türetilmiştir. Veri alanları Alan Açıklama id Sorunun benzersiz kimliği proverb… See the full description on the dataset page: https://huggingface.co/datasets/YusufSimsek/turkce-atasozleri-coktan-secmeli-benchmark.

sourceHugging Facecc-by-sa-4.0updated 2mo agoView on Hugging Face
0likes18downloads
Dataset Card

Türkçe Atasözleri Çoktan Seçmeli Benchmark

Türkçe atasözlerinin anlamını ölçmek amacıyla hazırlanmış 100 soruluk çoktan seçmeli bir benchmark veri setidir.

Her soruda dört seçenek bulunur. Doğru cevaplar dengeli dağıtılmıştır:

  • —A: 25
  • —B: 25
  • —C: 25
  • —D: 25
  • —Rastgele tahmin seviyesi: %25

Sorular, YusufSimsek/turkce-atasozleri-dataset veri setindeki 100 benzersiz atasözünden türetilmiştir.

Veri alanları

AlanAçıklama
idSorunun benzersiz kimliği
proverbAtasözü
questionÇoktan seçmeli soru
A, B, C, DCevap seçenekleri
answerDoğru cevap harfi
categoryYardımcı konu etiketi

Kullanım

python
from datasets import load_dataset

dataset = load_dataset(
    "YusufSimsek/turkce-atasozleri-coktan-secmeli-benchmark"
)

print(dataset["test"][0])

Önerilen prompt

text
Aşağıdaki çoktan seçmeli Türkçe atasözü sorusunu cevapla.
Yalnızca doğru seçeneğin harfini yaz: A, B, C veya D.

{question}
A) {A}
B) {B}
C) {C}
D) {D}

Cevap:

Önerilen üretim ayarları:

python
do_sample = False
max_new_tokens = 8

Benchmark sonuçları

SıraModelDoğruBaşarı
1Qwen/Qwen3.5-4B72/100%72
2meta-llama/Llama-3.1-8B-Instruct68/100%68
3mistralai/Ministral-3-3B-Instruct-251266/100%66
4google/gemma-3-4b-it63/100%63
5YusufSimsek/gemma_3_lora58/100%58

Sonuçlar accuracy metriğiyle hesaplanmıştır.

Hız değerleri farklı donanımlarda ölçüldüğü için tabloya eklenmemiştir.

Değerlendirme yöntemi

Tüm modeller aynı 100 soru, aynı seçenek sıralaması ve aynı istem şablonu kullanılarak değerlendirilmiştir.

Üretim sırasında rastgelelik kapatılmıştır:

python
do_sample = False
max_new_tokens = 8

Modelden yalnızca A, B, C veya D harflerinden birini üretmesi istenmiştir. Sonuç metriği olarak accuracy kullanılmıştır:

text
Accuracy = Doğru cevap sayısı / Toplam soru sayısı

Dört seçenek bulunduğu için rastgele tahmin seviyesi %25tir.

Sonuçların kısa değerlendirmesi

Qwen/Qwen3.5-4B, 72 doğru cevap ve %72 başarı oranıyla test edilen modeller arasında en yüksek sonucu elde etmiştir.

meta-llama/Llama-3.1-8B-Instruct %68, mistralai/Ministral-3-3B-Instruct-2512 ise %66 başarı göstermiştir.

Temel google/gemma-3-4b-it modeli %63 başarı elde ederken, atasözü veri setiyle özelleştirilen YusufSimsek/gemma_3_lora modeli %58 başarı göstermiştir.

Bu sonuçlara göre özelleştirilmiş Gemma modeli, bu benchmark üzerinde temel Gemma modelinin 5 yüzde puan gerisinde kalmıştır. Bu durum fine-tune işleminin mevcut çoktan seçmeli değerlendirme biçiminde performans artışı sağlamadığını göstermektedir.

Rastgele tahmine göre fark

ModelBaşarıRastgele tahmine göre fark
Qwen/Qwen3.5-4B%72+47 puan
meta-llama/Llama-3.1-8B-Instruct%68+43 puan
mistralai/Ministral-3-3B-Instruct-2512%66+41 puan
google/gemma-3-4b-it%63+38 puan
YusufSimsek/gemma_3_lora%58+33 puan

Karşılaştırma notları

Başarı oranları aynı soru seti ve aynı cevap formatı kullanılarak hesaplanmıştır.

Çalışma süresi ve VRAM değerleri bazı modellerde farklı GPU ve çalışma ortamlarında ölçüldüğü için doğrudan karşılaştırılmamıştır.

Benchmark yalnızca 100 soru içerdiğinden, modeller arasındaki küçük skor farkları kesin bir üstünlük kanıtı olarak değerlendirilmemelidir.

Ayrıca sorular, özelleştirilmiş Gemma modelinin eğitiminde kullanılan veri setindeki atasözlerinden türetilmiştir. Bu nedenle test, görülmemiş atasözlerine genellemeden çok eğitim alanı içindeki bilgi ve anlam eşleştirme başarısını ölçmektedir.

Dosyalar

  • —data/test.csv: Ana test verisi
  • —extras/test.jsonl: JSONL sürümü
  • —extras/questions_only.jsonl: Cevapları çıkarılmış sorular
  • —extras/answer_key.json: Cevap anahtarı
  • —benchmark_results.csv: Model sonuçları

Sınırlamalar

Bu benchmark eğitim veri setinde bulunan atasözlerinden hazırlanmıştır. Görülmemiş atasözlerine genelleme performansını ölçmez.

category alanı yardımcı analiz amacıyla eklenmiştir ve resmî bir dilbilimsel sınıflandırma değildir.

Kaynak

YusufSimsek/turkce-atasozleri-dataset

Lisans

Bu türetilmiş veri seti CC BY-SA 4.0 lisansı altında paylaşılmaktadır.