bysismo/100k_Tdk_zurriyet_dna_v6.jsonl
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/100k_Tdk_zurriyet_dna_v6.jsonl.
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).
🇹🇷 Zurriyet Turkish Morphological DNA Dataset v6.0
98.100+ TDK Kök Kelime, 463.000+ Çekim & Türetim Zinciri ve Morfolojik DNA Altyapısı
   
📌 1. Veri Seti Hakkında (About Dataset)
Zurriyet Turkish Morphological DNA Dataset v6.0, Türkçe'nin sondan eklemeli (agglutinative) yapısını morfem seviyesinde modelleyebilmek, yapay zekâ ve LLM sistemlerine Türkçe dil bilinci kazandırmak amacıyla geliştirilmiş yüksek çözünürlüklü bir morfolojik çekirdek veri setidir.
Türkçe; kök + ek zincirleriyle anlam üreten, ses uyumları ve biçimbilimsel kurallarla şekillenen bir dildir. Bu veri seti kelimeleri statik sözlük girdileri yerine Morfem Akış Grafiği (Morpheme Flow Graph) ve Morfem DNA Yapısı ile temsil eder.
- TDK Kök Kelime Kapsamı:
98.108Kelime Kökü - Genişletilmiş Çekim Formları:
463.759Türetilmiş/Çekimlenmiş Sözcük - Versiyon:
zurriyet_v6.0_dna
🧬 2. Morfolojik DNA Mimarisi (Morpheme DNA Approach)
Her kelime girdisi aşağıdaki derinlikli katmanları içerir:
- Kök (Root) & Gövde: Sözcüğün yalın ve morfolojik başlangıç formu.
- POS (Part of Speech): Birincil (Primary) ve ikincil (Secondary) sözcük türü etiketleri (Noun, Verb, Adjective vb.).
- Morfem Akış Zinciri: Kökten yüzey formuna kadar eklenen tüm morfemlerin kimlikleri ve sıralaması.
- Fonoloji & Ses Olayları: Büyük/küçük ünlü uyumu, ünsüz yumuşaması/sertleşmesi doğrulamaları.
- Hece Ayrımı: Fonetik kural tabanlı hece parçalama ve hece sayısı.
🚀 3. Kullanım Alanları (Use Cases)
- Hallucination-Resistant LLM Eğitimi: Modelin Türkçe çekim ve ek sıralama hataları yapmasını engelleme.
- Morfoloji-Farkındalıklı NLP: Lemmatization, Stemming ve Part-of-Speech Tagging modelleri geliştirme.
- Yazım Denetimi & İmla Motorları (Spell Check): Doğru kök-ek uyumu tespiti.
- Türkçe Tokenizer Optimizasyonu: Morfem temelli subword tokenization çalışmaları.
💻 4. Hızlı Başlangıç & Kullanım (Quickstart)
Hugging Face datasets kütüphanesi ile veriyi tek satırda yükleyebilirsiniz:
from datasets import load_dataset
# Veri setini yükle
dataset = load_dataset("bysismo/100k_Tdk_zurriyet_dna_v6.jsonl")
# İlk örneği görüntüle
print(dataset['train'][0])Alternatif olarak pandas ile okumak için:
import pandas as pd
df = pd.read_json("hf://datasets/bysismo/100k_Tdk_zurriyet_dna_v6.jsonl/100k_Tdk_zurriyet_dna_v6.jsonl", lines=True)
print(f"Toplam Kök Kelime: {len(df):,}")
print(df.head())🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)
Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:
📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)
### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*
Ticari lisanslama, iş birliği ve kurumsal izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.
Çalışmalarınızda bu veri setini referans vermek isterseniz:
@misc{bysismo2026tdkzurriyetdna,
author = {Tektakar, Hakan (bysismo)},
title = {Zurriyet Turkish Morphological DNA Dataset v6.0},
year = {2026},
license = {CC BY-NC 4.0},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/datasets/bysismo/100k_Tdk_zurriyet_dna_v6.jsonl}}
}👨💻 Geliştirici & İletişim
- Hazırlayan: Hakan Tektakar (@bysismo)
- GitHub: bysismo
- Kaggle: hakanttkar
