bysismo/Temel-cumle-analizi-2.7M-instruction
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): -- Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/Temel-cumle-analizi-2.7M-instruction.
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): -- Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).
🇹🇷 2K3N1D-QA: Türkçe Temel Cümle Analizi ve Soru-Cevap Instruction Veri Seti (2.76M)
2.76+ Milyon Örnekten Oluşan Semantik Ayrıştırma, Duygu Analizi ve ChatML SFT Veri Seti
   
📌 1. Veri Seti Hakkında (About Dataset)
2K3N1D-QA, Türkçe temel cümle analizi verisinin modellerin talimat uyumunu (Instruction Tuning), JSON çıkarma (Structured Output) ve akıl yürütme (Reasoning) yeteneklerini en üst seviyeye çıkarmak amacıyla 2.764.497 adet yüksek kaliteli soru-cevap ve ChatML formatına dönüştürülmüş halidir.
Modelin tek tipe odaklanıp ezber yapmasını engellemek amacıyla, her bir temel cümle dinamik çapraz sorulara (Cross-Questioning) ve değişken sistem promptlarına dönüştürülmüştür.
🧾 Temel Semantik Mimari (2K3N + 1D)
- 👤 Kim: Eylemi gerçekleştiren özne
- 🤝 Kiminle: Birliktelik / Eşlik eden kişi
- 📍 Nerede: Mekan & Coğrafi konum (81 il, 720 ilçe, ~4000 mahalle)
- ⏰ Ne Zaman: Zaman ifadesi ve saat dilimi
- 🏃 Ne Yapıyor: Gerçekleşen eylem ve yüklem
- 🎭 1D (Duygu Analizi): Pozitif, Negatif, Nötr, Şaşkın, Üzgün, Mutlu, Heyecanlı
🚀 2. Kullanım Alanları (Use Cases)
- ChatML & SFT Eğitimi: Türkçe LLM'lerin (Llama 3, Mistral, Qwen, Gemma) doğal diyalog ve soru-cevap yeteneğini geliştirme.
- Yapılandırılmış Çıktı Üretimi (JSON Extraction): Metinlerden otomatik JSON şeması çıkarma.
- Semantik Rol Etiketleme (SRL) & NER: Varlık ve konum ilişkilendirme.
- Duygu Analizi (Sentiment Analysis): Cümle bağlamından duygu durumu tespiti.
💻 3. Hızlı Başlangıç & Kullanım (Quickstart)
Hugging Face datasets kütüphanesi ile veriyi tek satırda veya büyük boyut nedeniyle streaming ile yükleyebilirsiniz:
from datasets import load_dataset
# Streaming ile hızlı ve belleksiz yükleme
dataset = load_dataset("bysismo/Temel-cumle-analizi-2.7M-instruction", split="train", streaming=True)
for i, example in enumerate(dataset):
print(example)
if i >= 2:
breakAlternatif olarak doğrudan pandas ile JSONL dosyasını okumak için:
import pandas as pd
df = pd.read_json("hf://datasets/bysismo/Temel-cumle-analizi-2.7M-instruction/train.jsonl", lines=True)
print(f"Toplam Yüklenen Örnek: {len(df):,}")
print(df.head())📊 4. Veri Şeması & ChatML Örnekleri
Veri setinde 3 farklı soru formu harmanlanmıştır:
A. Evet/Hayır Doğrulaması (Boolean Verification):
{
"messages": [
{"role": "system", "content": "Sen yardımcı bir Türkçe yapay zeka asistanısın. Verilen cümleye göre soruyu cevapla."},
{"role": "user", "content": "Cümle: Uğurkaya Nimet ile Ankara Kızılcahamam Belpınar Mahallesinde sabah 09:30'da karşılaştı.\nSoru: Uğurkaya Nimet miydi?"},
{"role": "assistant", "content": "Evet"}
]
}B. Birliktelik + Konum Çapraz Sorusu:
{
"messages": [
{"role": "system", "content": "Verilen cümleyi/bağlamı analiz ederek sorulan soruyu yanıtla."},
{"role": "user", "content": "Cümle: Uğurkaya Nimet ile Ankara Kızılcahamam Belpınar Mahallesinde sabah 09:30'da karşılaştı.\nSoru: Nimet sabah 09:30'da neredeydi?"},
{"role": "assistant", "content": "Ankara Kızılcahamam Belpınar Mahallesinde"}
]
}C. Yapılandırılmış JSON Çıktısı (JSON Extraction):
{
"messages": [
{"role": "system", "content": "Sen yardımcı bir Türkçe yapay zeka asistanısın. Verilen cümleye göre soruyu cevapla."},
{"role": "user", "content": "Cümle: Uğurkaya Nimet ile Ankara Kızılcahamam Belpınar Mahallesinde sabah 09:30'da karşılaştı.\nSoru: Bu cümleyi 2K3N1D şemasına göre analiz et ve JSON formatında yaz."},
{"role": "assistant", "content": "{\"kim\": \"Uğurkaya\", \"kiminle\": \"Nimet\", \"nerede\": \"Ankara Kızılcahamam Belpınar Mahallesinde\", \"ne_zaman\": \"sabah 09:30'da\", \"ne_yapiyor\": \"karşılaştı\", \"Duygu_Analizi\": \"Nötr\"}"}
]
}🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)
Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:
📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)
### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*
Ticari lisanslama, iş birliği ve kurumsal izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.
Çalışmalarınızda bu veri setini referans vermek isterseniz:
@misc{bysismo2026temelcumleanalizi27m,
author = {Tektakar, Hakan (bysismo)},
title = {2K3N1D-QA: Turkish Sentence Analysis & ChatML Instruction Dataset (2.76M)},
year = {2026},
license = {CC BY-NC 4.0},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/datasets/bysismo/Temel-cumle-analizi-2.7M-instruction}}
}👨💻 Geliştirici & İletişim
- Hazırlayan: Hakan Tektakar (@bysismo)
- GitHub: bysismo
- Kaggle: hakanttkar
