bysismo/Turkish-instruction-3m_Soru_Cevap
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/Turkish-instruction-3m_Soru_Cevap.
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).
🇹🇷 Turkish 3M Rich QA & Morphology Instruction Dataset
2.98+ Milyon Türkçe Morfoloji, Sentaks ve Zengin Soru-Cevap Instruction Veri Seti
   
📌 1. Veri Seti Özeti & Mimari (About Dataset)
Turkish 3M Rich QA & Morphology Instruction Dataset, Türkçe büyük dil modellerine (LLM) sondan eklemeli Türkçe dil yapısının kurallarını, kök-ek ilişkilerini, heceleme mekanizmasını, sözcük türlerini (POS) ve morfolojik varyasyonları kazandırmak amacıyla üretilmiş 2.982.000+ örnekten oluşan devasa konsantre bir instruction veri setidir.
- Toplam Örnek Sayısı:
~2.982.000+Zengin Soru-Cevap Çifti - Format: JSONL (
zengin_soru_cevaplar.jsonl- 590 MB) - Kaynak:
zurriyet_v6.0_dnaMorfolojik Çekirdeği (98.100+ TDK temelli kelime kökünden türetilmiştir)
⚠️ Önemli Model Eğitim Tavsiyesi (Curriculum Learning): Bu veri seti son derece konsantre ve kuralcı bir dilbilgisi yapısına sahiptir. Modeli doğrudan bu veri setiyle eğitmeniz halinde modeliniz oldukça katı bir Türkçe hocasına dönüşür. Önerilen Eğitim Sırası: 1. İlk aşamada `bysismo/100k_Tdk_zurriyet_dna_v6.jsonl` ile temel sözcük dağarcığı ve morfoloji aşılanmalıdır. 2. İkinci aşamada bu 3M Soru-Cevap setiyle zengin varyasyonlu soru anlama ve yanıtlama instruction yetisi kazandırılmalıdır. 3. Üçüncü aşamada genel sohbet/kodlama gibi geniş kapsamlı veri setlerine geçilmelidir.
🎯 2. Dataset Hedefleri & Kazanımları
- Soru Formundan Bağımsız Anlama: Aynı bilgiyi ve morfolojik özelliği onlarca farklı soru kalıbıyla doğru yanıtlamayı öğretir.
- Morfolojik Tutarlılık (Morphological Consistency): Türkçe eklemeli yapısında hal, iyelik, zaman ve şahıs eklerinin doğru kullanımını pekiştirir.
- Halüsinasyonu Azaltma: Sözcüklerin kök, gövde, hece sayısı ve türü gibi yapısal doğrularında model uydurmalarını (hallucination) engeller.
- SFT & Instruction-Tuning Gücü: Açık kaynaklı LLM'lerin (Llama 3, Mistral, Qwen 2.5, Gemma 2) Türkçe soru-cevap doğruluğunu dramatik oranda artırır.
💻 3. Hızlı Başlangıç & Kullanım (Quickstart)
Veri seti büyük boyutta (590 MB) olduğu için Hugging Face datasets kütüphanesinin streaming desteğiyle belleği yormadan veya doğrudan indirerek kullanabilirsiniz:
A. Streaming ile Hızlı Okuma:
from datasets import load_dataset
# Bellek tüketmeden canlı stream et
dataset = load_dataset("bysismo/Turkish-instruction-3m_Soru_Cevap", split="train", streaming=True)
for i, example in enumerate(dataset):
print(f"Soru: {example['soru']}")
print(f"Cevap: {example['cevap']}")
if i >= 4:
breakB. Pandas ile Doğrudan Yükleme:
import pandas as pd
df = pd.read_json("hf://datasets/bysismo/Turkish-instruction-3m_Soru_Cevap/zengin_soru_cevaplar.jsonl", lines=True)
print(f"Toplam Yüklenen Örnek: {len(df):,}")
print(df.head())📊 4. Veri Şeması (Data Schema)
Her satır bağımsız ve eksiksiz bir JSON kaydıdır:
{
"soru": "dulda kelimesi kaç hecedir?",
"cevap": "2 hecedir.",
"kelime": "dulda",
"kok": "dulda",
"primary_pos": "Noun",
"heceler": ["dul", "da"],
"hece_sayisi": 2,
"veri_kaynagi": "zurriyet_v6.0_dna"
}🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)
Geliştirdiğimiz diğer açık kaynaklı dev Türkçe veri setlerimiz:
📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)
### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*
Ticari lisanslama, iş birliği ve kurumsal entegrasyon talepleri için Hugging Face profili veya GitHub üzerinden iletişime geçebilirsiniz.
Çalışmalarınızda bu veri setini referans vermek isterseniz:
@misc{bysismo2026turkish3mqainstruction,
author = {Tektakar, Hakan (bysismo)},
title = {Turkish 3M Rich QA & Morphology Instruction Dataset},
year = {2026},
license = {CC BY-NC 4.0},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/datasets/bysismo/Turkish-instruction-3m_Soru_Cevap}}
}👨💻 Geliştirici & İletişim
- Hazırlayan: Hakan Tektakar (@bysismo)
- GitHub: bysismo
- Kaggle: hakanttkar
