CoolFace
Datasetpublic

bysismo/Temel-cumle-analizi-2.7M-instruction

🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): -- Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/Temel-cumle-analizi-2.7M-instruction.

sourceHugging Facecc-by-nc-4.0updated 1mo agoView on Hugging Face
2likes75downloads
Dataset Card
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): -- Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).

🇹🇷 2K3N1D-QA: Türkçe Temel Cümle Analizi ve Soru-Cevap Instruction Veri Seti (2.76M)

2.76+ Milyon Örnekten Oluşan Semantik Ayrıştırma, Duygu Analizi ve ChatML SFT Veri Seti

![License: CC BY-NC 4.0](https://creativecommons.org/licenses/by-nc/4.0/) ![Language: Turkish-red.svg)](#) ![Dataset Size](#) ![Author: bysismo-orange.svg)](https://huggingface.co/bysismo)


📌 1. Veri Seti Hakkında (About Dataset)

2K3N1D-QA, Türkçe temel cümle analizi verisinin modellerin talimat uyumunu (Instruction Tuning), JSON çıkarma (Structured Output) ve akıl yürütme (Reasoning) yeteneklerini en üst seviyeye çıkarmak amacıyla 2.764.497 adet yüksek kaliteli soru-cevap ve ChatML formatına dönüştürülmüş halidir.

Modelin tek tipe odaklanıp ezber yapmasını engellemek amacıyla, her bir temel cümle dinamik çapraz sorulara (Cross-Questioning) ve değişken sistem promptlarına dönüştürülmüştür.

🧾 Temel Semantik Mimari (2K3N + 1D)

  • —👤 Kim: Eylemi gerçekleştiren özne
  • —🤝 Kiminle: Birliktelik / Eşlik eden kişi
  • —📍 Nerede: Mekan & Coğrafi konum (81 il, 720 ilçe, ~4000 mahalle)
  • —⏰ Ne Zaman: Zaman ifadesi ve saat dilimi
  • —🏃 Ne Yapıyor: Gerçekleşen eylem ve yüklem
  • —🎭 1D (Duygu Analizi): Pozitif, Negatif, Nötr, Şaşkın, Üzgün, Mutlu, Heyecanlı

🚀 2. Kullanım Alanları (Use Cases)

  1. 1.ChatML & SFT Eğitimi: Türkçe LLM'lerin (Llama 3, Mistral, Qwen, Gemma) doğal diyalog ve soru-cevap yeteneğini geliştirme.
  2. 2.Yapılandırılmış Çıktı Üretimi (JSON Extraction): Metinlerden otomatik JSON şeması çıkarma.
  3. 3.Semantik Rol Etiketleme (SRL) & NER: Varlık ve konum ilişkilendirme.
  4. 4.Duygu Analizi (Sentiment Analysis): Cümle bağlamından duygu durumu tespiti.

💻 3. Hızlı Başlangıç & Kullanım (Quickstart)

Hugging Face datasets kütüphanesi ile veriyi tek satırda veya büyük boyut nedeniyle streaming ile yükleyebilirsiniz:

python
from datasets import load_dataset

# Streaming ile hızlı ve belleksiz yükleme
dataset = load_dataset("bysismo/Temel-cumle-analizi-2.7M-instruction", split="train", streaming=True)

for i, example in enumerate(dataset):
    print(example)
    if i >= 2:
        break

Alternatif olarak doğrudan pandas ile JSONL dosyasını okumak için:

python
import pandas as pd

df = pd.read_json("hf://datasets/bysismo/Temel-cumle-analizi-2.7M-instruction/train.jsonl", lines=True)
print(f"Toplam Yüklenen Örnek: {len(df):,}")
print(df.head())

📊 4. Veri Şeması & ChatML Örnekleri

Veri setinde 3 farklı soru formu harmanlanmıştır:

A. Evet/Hayır Doğrulaması (Boolean Verification):

json
{
  "messages": [
    {"role": "system", "content": "Sen yardımcı bir Türkçe yapay zeka asistanısın. Verilen cümleye göre soruyu cevapla."},
    {"role": "user", "content": "Cümle: Uğurkaya Nimet ile Ankara Kızılcahamam Belpınar Mahallesinde sabah 09:30'da karşılaştı.\nSoru: Uğurkaya Nimet miydi?"},
    {"role": "assistant", "content": "Evet"}
  ]
}

B. Birliktelik + Konum Çapraz Sorusu:

json
{
  "messages": [
    {"role": "system", "content": "Verilen cümleyi/bağlamı analiz ederek sorulan soruyu yanıtla."},
    {"role": "user", "content": "Cümle: Uğurkaya Nimet ile Ankara Kızılcahamam Belpınar Mahallesinde sabah 09:30'da karşılaştı.\nSoru: Nimet sabah 09:30'da neredeydi?"},
    {"role": "assistant", "content": "Ankara Kızılcahamam Belpınar Mahallesinde"}
  ]
}

C. Yapılandırılmış JSON Çıktısı (JSON Extraction):

json
{
  "messages": [
    {"role": "system", "content": "Sen yardımcı bir Türkçe yapay zeka asistanısın. Verilen cümleye göre soruyu cevapla."},
    {"role": "user", "content": "Cümle: Uğurkaya Nimet ile Ankara Kızılcahamam Belpınar Mahallesinde sabah 09:30'da karşılaştı.\nSoru: Bu cümleyi 2K3N1D şemasına göre analiz et ve JSON formatında yaz."},
    {"role": "assistant", "content": "{\"kim\": \"Uğurkaya\", \"kiminle\": \"Nimet\", \"nerede\": \"Ankara Kızılcahamam Belpınar Mahallesinde\", \"ne_zaman\": \"sabah 09:30'da\", \"ne_yapiyor\": \"karşılaştı\", \"Duygu_Analizi\": \"Nötr\"}"}
  ]
}

🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)

Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:

Veri Seti AdıÖrnek SayısıAlan / OdakBağlantı
🐍 Turkish Python Instruction 335K335.286 ÖrnekPython Kod Üretimi, OOP, Algoritmalar, Shell & DBHF Repo
🗣️ Turkish Instruction 3M Soru Cevap2.98 Milyon ÖrnekGenel Türkçe Diyalog, Soru-Cevap & InstructionHF Repo
🇹🇷 Turkish 5N1K Sentetik Veri Seti100.000+ Örnek5N1K Semantik Bilgi Çıkarımı ve Metin AyrıştırmaHF Repo
🧬 2K3N1D Temel Cümle Analizi284.000 ÖrnekTürkçe Morfoloji ve Sentaktik AyrıştırmaHF Repo
📚 100k TDK & Morfolojik DNA98.100 ÖrnekTürkçe Sözlük, Kök & Ek Morfolojik AnalizHF Repo
🔤 Turkish 675K Morfolojik Kelime67.800 ÖrnekKelime Tabanlı Morfoloji ve Fonetik YapıHF Repo
🏆 Kaggle: Turkish Python Expert 335K335.000 ÖrnekKaggle Topluluğu İçin Standart FormatKaggle Dataset

📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)

### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*

Ticari lisanslama, iş birliği ve kurumsal izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.

Çalışmalarınızda bu veri setini referans vermek isterseniz:

bibtex
@misc{bysismo2026temelcumleanalizi27m,
  author = {Tektakar, Hakan (bysismo)},
  title = {2K3N1D-QA: Turkish Sentence Analysis & ChatML Instruction Dataset (2.76M)},
  year = {2026},
  license = {CC BY-NC 4.0},
  publisher = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/bysismo/Temel-cumle-analizi-2.7M-instruction}}
}

👨‍💻 Geliştirici & İletişim