CoolFace
Datasetpublic

bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset

🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset.

sourceHugging Facecc-by-nc-4.0updated 1mo agoView on Hugging Face
0likes22downloads
Dataset Card
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).

🇹🇷 Turkish 5N1K Structured Synthetic Dataset

Türkçe 5N1K (Ne, Nerede, Ne Zaman, Nasıl, Neden, Kim) Tabanlı Sentetik Semantik Bilgi Çıkarımı Veri Seti

![License: CC BY-NC 4.0](https://creativecommons.org/licenses/by-nc/4.0/) ![Language: Turkish-red.svg)](#) ![Dataset Size](#) ![Author: bysismo-orange.svg)](https://huggingface.co/bysismo)


📌 1. Veri Seti Hakkında (About Dataset)

Turkish 5N1K Structured Synthetic Dataset, Türkçe doğal dil işleme (NLP) modellerinin cümle yapısını, kuramsal ögeleri ve temel anlamsal bileşenleri kavramasını sağlamak amacıyla tasarlanmış yüksek kaliteli sentetik ve yapılandırılmış bir veri setidir.

Gazetecilik, metin anlama ve mantıksal çıkarımın temelini oluşturan 5N1K metodolojisi üzerine inşa edilmiştir:

  • —❓ Kim? (Who?) - Cümledeki özne, kişi veya fail
  • —❓ Ne? (What?) - Eylem, nesne veya gerçekleşen olay
  • —❓ Nerede? (Where?) - Mekan, yer ve konum bilgisi
  • —❓ Ne Zaman? (When?) - Zaman, tarih veya süre zarfı
  • —❓ Neden? (Why?) - Gerekçe, sebep ve nedensellik bağlamı
  • —❓ Nasıl? (How?) - Durum, yöntem veya eylemin gerçekleşme biçimi

🚀 2. Kullanım Alanları (Use Cases)

Bu veri seti özellikle aşağıdaki alanlarda Türkçe modelleri eğitmek (Fine-tuning) ve değerlendirmek için optimize edilmiştir:

  1. 1.Soru-Cevap (Question Answering & Extractive QA): Metinden hedeflenen 5N1K ögelerini tam isabetle çıkarma.
  2. 2.RAG & Bilgi Çıkarımı (Information Extraction): Vektör tabanlı aramalarda bağlam özetleme ve varlık ilişkilendirme.
  3. 3.Sentetik LLM Eğitimi (Instruction Tuning): Türkçe LLM'lerin (Llama, Mistral, Qwen, Gemma vb.) Türkçe sentaks ve gramer hâkimiyetini artırma.
  4. 4.Adlandırılmış Varlık Tanıma (NER) & Semantik Rol Etiketleme (SRL): Cümle ögelerinin ayrıştırılması.

💻 3. Hızlı Başlangıç & Kullanım (Quickstart)

Hugging Face datasets kütüphanesi ile veriyi tek satırda yükleyebilirsiniz:

python
from datasets import load_dataset

# Veri setini yükle
dataset = load_dataset("bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset")

# İlk örneği görüntüle
print(dataset['train'][0])

Alternatif olarak doğrudan pandas ile JSONL dosyasını okumak için:

python
import pandas as pd

df = pd.read_json("hf://datasets/bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset/cumleler.jsonl", lines=True)
print(df.head())

📊 4. Veri Şeması (Data Schema)

Veri seti cumleler.jsonl dosyasında JSON satırları halinde saklanmaktadır.

Alan (Field)TipAçıklama
cumle / textstringAnaliz edilen tam Türkçe cümle
kimstringEylemi gerçekleştiren özne/aktör
nestringGerçekleşen eylem veya nesne
neredestringEylemin gerçekleştiği mekan
ne_zamanstringEylemin gerçekleştiği zaman
nedenstringEylemin sebebi veya gerekçesi
nasilstringEylemin yapılma yöntemi veya tarzı

🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)

Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:

Veri Seti AdıÖrnek SayısıAlan / OdakBağlantı
🐍 Turkish Python Instruction 335K335.286 ÖrnekPython Kod Üretimi, OOP, Algoritmalar, Shell & DBHF Repo
🗣️ Turkish Instruction 3M Soru Cevap2.98 Milyon ÖrnekGenel Türkçe Diyalog, Soru-Cevap & InstructionHF Repo
📖 Temel Cümle Analizi 2.7M2.76 Milyon ÖrnekSentaks, Gramer, Sentetik Cümle ÇözümlemeHF Repo
🧬 2K3N1D Temel Cümle Analizi284.000 ÖrnekTürkçe Morfoloji ve Sentaktik AyrıştırmaHF Repo
📚 100k TDK & Morfolojik DNA98.100 ÖrnekTürkçe Sözlük, Kök & Ek Morfolojik AnalizHF Repo
🔤 Turkish 675K Morfolojik Kelime67.800 ÖrnekKelime Tabanlı Morfoloji ve Fonetik YapıHF Repo
🏆 Kaggle: Turkish Python Expert 335K335.000 ÖrnekKaggle Topluluğu İçin Standart FormatKaggle Dataset

📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)

### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*

Ticari lisanslama, iş birliği ve izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.

Çalışmalarınızda bu veri setini referans vermek isterseniz:

bibtex
@misc{bysismo2026turkish5n1k,
  author = {Tektakar, Hakan (bysismo)},
  title = {Turkish 5N1K Structured Synthetic Dataset},
  year = {2026},
  license = {CC BY-NC 4.0},
  publisher = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset}}
}

👨‍💻 Geliştirici & İletişim