CoolFace
Datasetpublic

enes1863/turkish-foreigners-labor-law-benchmark

Turkish Foreigners and Labor Law Benchmark Turkish Foreigners and Labor Law Benchmark, Türkiye'deki yabancılar ve uluslararası işgücü hukuku alanında büyük dil modellerini ölçmek için hazırlanmış 200 soruluk Türkçe çoktan seçmeli test setidir. SFT yapılandırması sft yapılandırması, benchmark'tan ayrı tutulan 2.400 chat örneği içerir: train: 2.280 örnek validation: 120 örnek %35 yabancılar hukuku, %35 uluslararası işgücü, %12 iş hukuku, %8 TBK hizmet sözleşmeleri… See the full description on the dataset page: https://huggingface.co/datasets/enes1863/turkish-foreigners-labor-law-benchmark.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes38downloads
Dataset Card

Turkish Foreigners and Labor Law Benchmark

Turkish Foreigners and Labor Law Benchmark, Türkiye'deki yabancılar ve uluslararası işgücü hukuku alanında büyük dil modellerini ölçmek için hazırlanmış 200 soruluk Türkçe çoktan seçmeli test setidir.

SFT yapılandırması

sft yapılandırması, benchmark'tan ayrı tutulan 2.400 chat örneği içerir:

  • —train: 2.280 örnek
  • —validation: 120 örnek
  • —%35 yabancılar hukuku, %35 uluslararası işgücü, %12 iş hukuku, %8 TBK hizmet sözleşmeleri, %10 İYUK

Kayıtlar Hugging Face messages şemasındadır. Aynı maddeye dayanan örnekler train ve validation arasında bölünmez. Benchmark soruları, seçenekleri ve açıklamaları exact-match kontrolüyle SFT dışında tutulur.

Benchmark iki bağımsız yapılandırmadan oluşur:

  • —bilgi: Mevzuat bilgisi, süreler, yetkiler, şartlar ve istisnalar
  • —vaka: Kısa somut olaylarda uygulanacak kuralın ve hukuki sonucun belirlenmesi

Her yapılandırma yalnız test split'i içerir. Veri, model eğitimi için değil değerlendirme için tasarlanmıştır.

Dataset yapısı

YapılandırmaSoruSeçenekKolayOrtaZor
bilgi1004205030
vaka1004205030
Toplam2004010060

Her yapılandırmada doğru cevaplar dengelidir: A, B, C ve D seçeneklerinin her biri 25 kez doğru cevaptır.

Hukuk alanı dağılımı

Her yapılandırma aynı dağılımı kullanır:

Birincil alanSoruOran
Yabancılar ve uluslararası koruma hukuku35%35
Uluslararası işgücü hukuku35%35
İş hukuku12%12
İdari yargılama usulü10%10
Borçlar hukuku8%8

Soruların %70'i doğrudan yabancılar ve uluslararası işgücü hukukuna odaklanır. Diğer alanlar çalışma ilişkisi, hizmet sözleşmesi ve idari uyuşmazlık boyutlarını tamamlar.

Kapsanan temel mevzuat

  • —6458 sayılı Yabancılar ve Uluslararası Koruma Kanunu
  • —6735 sayılı Uluslararası İşgücü Kanunu
  • —Geçici Koruma Sağlanan Yabancıların Çalışma İzinlerine Dair Yönetmelik
  • —4857 sayılı İş Kanunu
  • —6098 sayılı Türk Borçlar Kanunu
  • —2577 sayılı İdari Yargılama Usulü Kanunu

Mevzuat kesim ve erişim tarihi 28 Temmuz 2026'dır. Her kayıtta resmî kaynak URL'si ve madde numarası bulunur.

Veri alanları

json
{
  "id": "BIL-001",
  "benchmark": "bilgi",
  "question": "Soru metni",
  "options": {
    "A": "Seçenek A",
    "B": "Seçenek B",
    "C": "Seçenek C",
    "D": "Seçenek D"
  },
  "answer": "B",
  "explanation": "Kısa hukuki gerekçe",
  "primary_domain": "uluslararasi_isgucu",
  "secondary_domains": [],
  "difficulty": "easy",
  "source_type": "kanun",
  "source_name": "6735 sayılı Uluslararası İşgücü Kanunu",
  "article": "7/3",
  "source_url": "https://www.mevzuat.gov.tr/...",
  "accessed_at": "2026-07-28",
  "authoring": "human_ai_coauthored",
  "review_status": "approved"
}

Hazırlama yöntemi

Her yapılandırmadaki:

  • —20 soru insan–AI ortak hazırlama sürecinde tek tek kontrol edilip onaylandı.
  • —80 soru, resmî mevzuattan çıkarılan doğrulanmış hukuk kurallarından kontrollü olarak sentetik üretildi.

Sentetik kayıtlarda authoring: synthetic ve review_status: generated; ortak kontrol edilen kayıtlarda authoring: human_ai_coauthored ve review_status: approved kullanılır.

Sorular eğitim verisinden ayrılmış bağımsız test verisi olarak saklanmalıdır. Benchmark yayımlandıktan sonra bu veriyi eğitiminde kullanmış modellerle elde edilen sonuçlar olası veri sızıntısı belirtilmeden karşılaştırılmamalıdır.

Önerilen değerlendirme

  1. 1.Modele yalnız question ve A–D seçeneklerini verin.
  2. 2.Tek harf yanıt isteyin.
  3. 3.Tüm modellerde aynı prompt ve decoding ayarlarını kullanın.
  4. 4.Ana metrik olarak exact-match accuracy raporlayın.
  5. 5.Bilgi/vaka, hukuk alanı, zorluk ve hazırlama yöntemi kırılımlarını ayrıca gösterin.
  6. 6.Geçersiz veya birden fazla harf içeren yanıtları yanlış sayın.

Önerilen minimal prompt:

text
Aşağıdaki çoktan seçmeli hukuk sorusunu cevapla.
Yalnız doğru seçeneğin harfini yaz: A, B, C veya D.

Soru: {question}
A) {A}
B) {B}
C) {C}
D) {D}

Sınırlılıklar

  • —Benchmark yalnız Türkçe ve Türkiye mevzuatı kapsamındadır.
  • —Hukuki düzenlemeler değişebilir; sonuçlar mevzuat kesim tarihiyle birlikte yorumlanmalıdır.
  • —Sentetik bölümde aynı hukuk kuralını farklı biçimde ölçen soru çiftleri bulunabilir; bu nedenle maddeler tamamen bağımsız örnekler değildir.
  • —80 sentetik soru otomatik kalite kontrollerinden geçmiş, fakat tek tek uzman incelemesinden geçmemiştir.
  • —Benchmark hukuki görüş veya hukuki danışmanlık sağlamaz.

Dosyalar ve bütünlük

  • —data/benchmark_bilgi.jsonl — 100 bilgi sorusu
  • —data/benchmark_vaka.jsonl — 100 vaka sorusu
  • —data/benchmark_bilgi.csv — CSV kopyası
  • —data/benchmark_vaka.csv — CSV kopyası
  • —sources.json — kaynak manifesti
  • —SHA256SUMS — yayımlanan veri dosyalarının SHA-256 özetleri

Lisans

Benchmark soru ve açıklamaları CC BY 4.0 ile yayımlanır. Kaynak mevzuat metinleri bu veri setine kopyalanmamış; yalnız resmî bağlantılar ve madde atıfları verilmiştir.

Sürümleme

İlk yayın v1.0.0 olarak etiketlenmelidir. Mevzuat değişikliği veya cevap düzeltmesi yeni sürüm gerektirir; eski sürümler tekrarlanabilirlik için korunmalıdır.