CoolFace
Datasetpublic

puschinka/Gugager

🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/puschinka/Gugager.

sourceHugging Facecc-by-nc-4.0updated 27d agoView on Hugging Face
0likes50downloads
Dataset Card
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).

🇹🇷 Turkish 675K Morphological Word Segmentation Dataset

675.000 Türkçe Kelimenin Kök, Yapım ve Çekim Ekleri Seviyesinde Morfolojik Ayrıştırma Veri Seti

![License: CC BY-NC 4.0](https://creativecommons.org/licenses/by-nc/4.0/) ![Language: Turkish-red.svg)](#) ![Dataset Size](#) ![Author: bysismo-orange.svg)](https://huggingface.co/bysismo)


📌 1. Veri Seti Hakkında (About Dataset)

Turkish 675K Morphological Word Segmentation Dataset, Türkçe'nin sondan eklemeli (agglutinative) zengin yapısını çözümlemek için hazırlanmış 675.000 adet morfolojik olarak ayrıştırılmış kelime örneği sunar.

Her bir kelime; kök, yapım ekleri ve çekim ekleri seviyesinde morfemlerine ayrılmıştır (kelime \t kök+ek1+ek2+...).

  • Toplam Örnek Sayısı: 675.000 Morfolojik Yapı
  • Format: Tab-separated Düz Metin (.txt / .jsonl)

📊 2. Morfolojik Ayrıştırma Örnekleri (Format & Examples)

Kelime (Surface Form)Morfolojik Ayrışım (Morpheme Chain)
evlerimizdenev + ler + imiz + den
koşuyordukkoş + uyor + duk
güzelleştirildigüzel + leş + tir + il + di
bilgisayarcılıkbilgi + say + ar + cı + lık

🚀 3. Kullanım Alanları (Use Cases)

  1. 1.Subword & Tokenizer Eğitimi: Türkçe için BPE, WordPiece veya SentencePiece tokenization sözlüklerinin morfolojik kurallara göre eğitilmesi.
  2. 2.Kök-Ek Ayrıştırıcıları (Morphological Parsers): Türkçe kelimelerden doğru kök ve ek tespiti.
  3. 3.Morfolojik Embedding Üretimi: Kelimelerin morfolojik yapısına duyarlı vektör temsilleri (Morpheme-aware embeddings).
  4. 4.Yazım Denetimi & Düzeltme (Spell Checking): Hatalı ek sıralamalarının tespiti.

💻 4. Hızlı Başlangıç & Kullanım (Quickstart)

Hugging Face datasets kütüphanesi veya pandas ile doğrudan okuyabilirsiniz:

python
import pandas as pd

# Veriyi doğrudan oku
df = pd.read_csv("hf://datasets/bysismo/Turkish_675k_Morfolojik_Kelime/morfolojik_kelimeler.txt", sep="\t", names=["kelime", "morfem_ayrisimi"])
print(f"Toplam Örnek: {len(df):,}")
print(df.head())

🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)

Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:

Veri Seti AdıÖrnek SayısıAlan / OdakBağlantı
🐍 Turkish Python Instruction 335K335.286 ÖrnekPython Kod Üretimi, OOP, Algoritmalar, Shell & DBHF Repo
🗣️ Turkish Instruction 3M Soru Cevap2.98 Milyon ÖrnekGenel Türkçe Diyalog, Soru-Cevap & InstructionHF Repo
🇹🇷 Turkish 5N1K Sentetik Veri Seti100.000+ Örnek5N1K Semantik Bilgi Çıkarımı ve Metin AyrıştırmaHF Repo
📖 Temel Cümle Analizi 2.7M2.76 Milyon ÖrnekSentaks, Gramer, Sentetik Cümle ÇözümlemeHF Repo
🧬 2K3N1D Temel Cümle Analizi284.000 ÖrnekTürkçe Morfoloji ve Sentaktik AyrıştırmaHF Repo
📚 100k TDK & Morfolojik DNA98.100 ÖrnekTürkçe Sözlük, Kök & Ek Morfolojik AnalizHF Repo
🏆 Kaggle: Turkish Python Expert 335K335.000 ÖrnekKaggle Topluluğu İçin Standart FormatKaggle Dataset

📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)

### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*

Ticari lisanslama, iş birliği ve kurumsal izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.

Çalışmalarınızda bu veri setini referans vermek isterseniz:

bibtex
@misc{bysismo2026turkish675kmorfolojik,
  author = {Tektakar, Hakan (bysismo)},
  title = {Turkish 675K Morphological Word Segmentation Dataset},
  year = {2026},
  license = {CC BY-NC 4.0},
  publisher = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/bysismo/Turkish_675k_Morfolojik_Kelime}}
}

👨‍💻 Geliştirici & İletişim