CoolFace
Datasetpublic

bysismo/Turkish-instruction-3m_Soru_Cevap

🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/Turkish-instruction-3m_Soru_Cevap.

sourceHugging Facecc-by-nc-4.0updated 1mo agoView on Hugging Face
3likes122downloads
Dataset Card
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).

🇹🇷 Turkish 3M Rich QA & Morphology Instruction Dataset

2.98+ Milyon Türkçe Morfoloji, Sentaks ve Zengin Soru-Cevap Instruction Veri Seti

![License: CC BY-NC 4.0](https://creativecommons.org/licenses/by-nc/4.0/) ![Language: Turkish-red.svg)](#) ![Dataset Size](#) ![Author: bysismo-orange.svg)](https://huggingface.co/bysismo)


📌 1. Veri Seti Özeti & Mimari (About Dataset)

Turkish 3M Rich QA & Morphology Instruction Dataset, Türkçe büyük dil modellerine (LLM) sondan eklemeli Türkçe dil yapısının kurallarını, kök-ek ilişkilerini, heceleme mekanizmasını, sözcük türlerini (POS) ve morfolojik varyasyonları kazandırmak amacıyla üretilmiş 2.982.000+ örnekten oluşan devasa konsantre bir instruction veri setidir.

  • —Toplam Örnek Sayısı: ~2.982.000+ Zengin Soru-Cevap Çifti
  • —Format: JSONL (zengin_soru_cevaplar.jsonl - 590 MB)
  • —Kaynak: zurriyet_v6.0_dna Morfolojik Çekirdeği (98.100+ TDK temelli kelime kökünden türetilmiştir)
⚠️ Önemli Model Eğitim Tavsiyesi (Curriculum Learning): Bu veri seti son derece konsantre ve kuralcı bir dilbilgisi yapısına sahiptir. Modeli doğrudan bu veri setiyle eğitmeniz halinde modeliniz oldukça katı bir Türkçe hocasına dönüşür. Önerilen Eğitim Sırası: 1. İlk aşamada `bysismo/100k_Tdk_zurriyet_dna_v6.jsonl` ile temel sözcük dağarcığı ve morfoloji aşılanmalıdır. 2. İkinci aşamada bu 3M Soru-Cevap setiyle zengin varyasyonlu soru anlama ve yanıtlama instruction yetisi kazandırılmalıdır. 3. Üçüncü aşamada genel sohbet/kodlama gibi geniş kapsamlı veri setlerine geçilmelidir.

🎯 2. Dataset Hedefleri & Kazanımları

  1. 1.Soru Formundan Bağımsız Anlama: Aynı bilgiyi ve morfolojik özelliği onlarca farklı soru kalıbıyla doğru yanıtlamayı öğretir.
  2. 2.Morfolojik Tutarlılık (Morphological Consistency): Türkçe eklemeli yapısında hal, iyelik, zaman ve şahıs eklerinin doğru kullanımını pekiştirir.
  3. 3.Halüsinasyonu Azaltma: Sözcüklerin kök, gövde, hece sayısı ve türü gibi yapısal doğrularında model uydurmalarını (hallucination) engeller.
  4. 4.SFT & Instruction-Tuning Gücü: Açık kaynaklı LLM'lerin (Llama 3, Mistral, Qwen 2.5, Gemma 2) Türkçe soru-cevap doğruluğunu dramatik oranda artırır.

💻 3. Hızlı Başlangıç & Kullanım (Quickstart)

Veri seti büyük boyutta (590 MB) olduğu için Hugging Face datasets kütüphanesinin streaming desteğiyle belleği yormadan veya doğrudan indirerek kullanabilirsiniz:

A. Streaming ile Hızlı Okuma:

python
from datasets import load_dataset

# Bellek tüketmeden canlı stream et
dataset = load_dataset("bysismo/Turkish-instruction-3m_Soru_Cevap", split="train", streaming=True)

for i, example in enumerate(dataset):
    print(f"Soru: {example['soru']}")
    print(f"Cevap: {example['cevap']}")
    if i >= 4:
        break

B. Pandas ile Doğrudan Yükleme:

python
import pandas as pd

df = pd.read_json("hf://datasets/bysismo/Turkish-instruction-3m_Soru_Cevap/zengin_soru_cevaplar.jsonl", lines=True)
print(f"Toplam Yüklenen Örnek: {len(df):,}")
print(df.head())

📊 4. Veri Şeması (Data Schema)

Her satır bağımsız ve eksiksiz bir JSON kaydıdır:

json
{
  "soru": "dulda kelimesi kaç hecedir?",
  "cevap": "2 hecedir.",
  "kelime": "dulda",
  "kok": "dulda",
  "primary_pos": "Noun",
  "heceler": ["dul", "da"],
  "hece_sayisi": 2,
  "veri_kaynagi": "zurriyet_v6.0_dna"
}
Alan (Field)TipAçıklama
sorustringModele yöneltilen doğal Türkçe soru kalıbı
cevapstringTam, kurallı ve net Türkçe yanıt
kelimestringİlgili kök/türemiş hedef sözcük
kokstringSözcüğün morfolojik kökü
primary_posstringBirincil sözcük türü (Noun, Verb, Adjective, Adverb vb.)
hecelerlist[str]Sözcüğün fonetik hece ayrımı
hece_sayisiintegerToplam hece adedi
veri_kaynagistringMorfolojik DNA motor sürüm etiketi

🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)

Geliştirdiğimiz diğer açık kaynaklı dev Türkçe veri setlerimiz:

Veri Seti AdıÖrnek SayısıAlan / OdakBağlantı
🐍 Turkish Python Instruction 335K335.286 ÖrnekPython Kod Üretimi, OOP, Algoritmalar, Shell & DBHF Repo
🇹🇷 Turkish 5N1K Sentetik Veri Seti100.000+ Örnek5N1K Semantik Bilgi Çıkarımı ve Metin AyrıştırmaHF Repo
📖 Temel Cümle Analizi 2.7M2.76 Milyon ÖrnekSentaks, Gramer, Sentetik Cümle ÇözümlemeHF Repo
🧬 2K3N1D Temel Cümle Analizi284.000 ÖrnekTürkçe Morfoloji ve Sentaktik AyrıştırmaHF Repo
📚 100k TDK & Morfolojik DNA98.100 ÖrnekTürkçe Sözlük, Kök & Ek Morfolojik AnalizHF Repo
🔤 Turkish 675K Morfolojik Kelime67.800 ÖrnekKelime Tabanlı Morfoloji ve Fonetik YapıHF Repo
🏆 Kaggle: Turkish Python Expert 335K335.000 ÖrnekKaggle Topluluğu İçin Standart FormatKaggle Dataset

📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)

### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*

Ticari lisanslama, iş birliği ve kurumsal entegrasyon talepleri için Hugging Face profili veya GitHub üzerinden iletişime geçebilirsiniz.

Çalışmalarınızda bu veri setini referans vermek isterseniz:

bibtex
@misc{bysismo2026turkish3mqainstruction,
  author = {Tektakar, Hakan (bysismo)},
  title = {Turkish 3M Rich QA & Morphology Instruction Dataset},
  year = {2026},
  license = {CC BY-NC 4.0},
  publisher = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/bysismo/Turkish-instruction-3m_Soru_Cevap}}
}

👨‍💻 Geliştirici & İletişim