CoolFace
Datasetpublic

bysismo/100k_Tdk_zurriyet_dna_v6.jsonl

🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/100k_Tdk_zurriyet_dna_v6.jsonl.

sourceHugging Facecc-by-nc-4.0updated 1mo agoView on Hugging Face
1likes41downloads
Dataset Card
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).

🇹🇷 Zurriyet Turkish Morphological DNA Dataset v6.0

98.100+ TDK Kök Kelime, 463.000+ Çekim & Türetim Zinciri ve Morfolojik DNA Altyapısı

![License: CC BY-NC 4.0](https://creativecommons.org/licenses/by-nc/4.0/) ![Language: Turkish-red.svg)](#) ![Dataset Size-green.svg)](#) ![Author: bysismo-orange.svg)](https://huggingface.co/bysismo)


📌 1. Veri Seti Hakkında (About Dataset)

Zurriyet Turkish Morphological DNA Dataset v6.0, Türkçe'nin sondan eklemeli (agglutinative) yapısını morfem seviyesinde modelleyebilmek, yapay zekâ ve LLM sistemlerine Türkçe dil bilinci kazandırmak amacıyla geliştirilmiş yüksek çözünürlüklü bir morfolojik çekirdek veri setidir.

Türkçe; kök + ek zincirleriyle anlam üreten, ses uyumları ve biçimbilimsel kurallarla şekillenen bir dildir. Bu veri seti kelimeleri statik sözlük girdileri yerine Morfem Akış Grafiği (Morpheme Flow Graph) ve Morfem DNA Yapısı ile temsil eder.

  • —TDK Kök Kelime Kapsamı: 98.108 Kelime Kökü
  • —Genişletilmiş Çekim Formları: 463.759 Türetilmiş/Çekimlenmiş Sözcük
  • —Versiyon: zurriyet_v6.0_dna

🧬 2. Morfolojik DNA Mimarisi (Morpheme DNA Approach)

Her kelime girdisi aşağıdaki derinlikli katmanları içerir:

  • —Kök (Root) & Gövde: Sözcüğün yalın ve morfolojik başlangıç formu.
  • —POS (Part of Speech): Birincil (Primary) ve ikincil (Secondary) sözcük türü etiketleri (Noun, Verb, Adjective vb.).
  • —Morfem Akış Zinciri: Kökten yüzey formuna kadar eklenen tüm morfemlerin kimlikleri ve sıralaması.
  • —Fonoloji & Ses Olayları: Büyük/küçük ünlü uyumu, ünsüz yumuşaması/sertleşmesi doğrulamaları.
  • —Hece Ayrımı: Fonetik kural tabanlı hece parçalama ve hece sayısı.

🚀 3. Kullanım Alanları (Use Cases)

  1. 1.Hallucination-Resistant LLM Eğitimi: Modelin Türkçe çekim ve ek sıralama hataları yapmasını engelleme.
  2. 2.Morfoloji-Farkındalıklı NLP: Lemmatization, Stemming ve Part-of-Speech Tagging modelleri geliştirme.
  3. 3.Yazım Denetimi & İmla Motorları (Spell Check): Doğru kök-ek uyumu tespiti.
  4. 4.Türkçe Tokenizer Optimizasyonu: Morfem temelli subword tokenization çalışmaları.

💻 4. Hızlı Başlangıç & Kullanım (Quickstart)

Hugging Face datasets kütüphanesi ile veriyi tek satırda yükleyebilirsiniz:

python
from datasets import load_dataset

# Veri setini yükle
dataset = load_dataset("bysismo/100k_Tdk_zurriyet_dna_v6.jsonl")

# İlk örneği görüntüle
print(dataset['train'][0])

Alternatif olarak pandas ile okumak için:

python
import pandas as pd

df = pd.read_json("hf://datasets/bysismo/100k_Tdk_zurriyet_dna_v6.jsonl/100k_Tdk_zurriyet_dna_v6.jsonl", lines=True)
print(f"Toplam Kök Kelime: {len(df):,}")
print(df.head())

🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)

Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:

Veri Seti AdıÖrnek SayısıAlan / OdakBağlantı
🐍 Turkish Python Instruction 335K335.286 ÖrnekPython Kod Üretimi, OOP, Algoritmalar, Shell & DBHF Repo
🗣️ Turkish Instruction 3M Soru Cevap2.98 Milyon ÖrnekGenel Türkçe Diyalog, Soru-Cevap & InstructionHF Repo
🇹🇷 Turkish 5N1K Sentetik Veri Seti100.000+ Örnek5N1K Semantik Bilgi Çıkarımı ve Metin AyrıştırmaHF Repo
📖 Temel Cümle Analizi 2.7M2.76 Milyon ÖrnekSentaks, Gramer, Sentetik Cümle ÇözümlemeHF Repo
🧬 2K3N1D Temel Cümle Analizi284.000 ÖrnekTürkçe Morfoloji ve Sentaktik AyrıştırmaHF Repo
🔤 Turkish 675K Morfolojik Kelime67.800 ÖrnekKelime Tabanlı Morfoloji ve Fonetik YapıHF Repo
🏆 Kaggle: Turkish Python Expert 335K335.000 ÖrnekKaggle Topluluğu İçin Standart FormatKaggle Dataset

📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)

### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*

Ticari lisanslama, iş birliği ve kurumsal izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.

Çalışmalarınızda bu veri setini referans vermek isterseniz:

bibtex
@misc{bysismo2026tdkzurriyetdna,
  author = {Tektakar, Hakan (bysismo)},
  title = {Zurriyet Turkish Morphological DNA Dataset v6.0},
  year = {2026},
  license = {CC BY-NC 4.0},
  publisher = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/bysismo/100k_Tdk_zurriyet_dna_v6.jsonl}}
}

👨‍💻 Geliştirici & İletişim