bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset.
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).
🇹🇷 Turkish 5N1K Structured Synthetic Dataset
Türkçe 5N1K (Ne, Nerede, Ne Zaman, Nasıl, Neden, Kim) Tabanlı Sentetik Semantik Bilgi Çıkarımı Veri Seti
   
📌 1. Veri Seti Hakkında (About Dataset)
Turkish 5N1K Structured Synthetic Dataset, Türkçe doğal dil işleme (NLP) modellerinin cümle yapısını, kuramsal ögeleri ve temel anlamsal bileşenleri kavramasını sağlamak amacıyla tasarlanmış yüksek kaliteli sentetik ve yapılandırılmış bir veri setidir.
Gazetecilik, metin anlama ve mantıksal çıkarımın temelini oluşturan 5N1K metodolojisi üzerine inşa edilmiştir:
- ❓ Kim? (Who?) - Cümledeki özne, kişi veya fail
- ❓ Ne? (What?) - Eylem, nesne veya gerçekleşen olay
- ❓ Nerede? (Where?) - Mekan, yer ve konum bilgisi
- ❓ Ne Zaman? (When?) - Zaman, tarih veya süre zarfı
- ❓ Neden? (Why?) - Gerekçe, sebep ve nedensellik bağlamı
- ❓ Nasıl? (How?) - Durum, yöntem veya eylemin gerçekleşme biçimi
🚀 2. Kullanım Alanları (Use Cases)
Bu veri seti özellikle aşağıdaki alanlarda Türkçe modelleri eğitmek (Fine-tuning) ve değerlendirmek için optimize edilmiştir:
- Soru-Cevap (Question Answering & Extractive QA): Metinden hedeflenen 5N1K ögelerini tam isabetle çıkarma.
- RAG & Bilgi Çıkarımı (Information Extraction): Vektör tabanlı aramalarda bağlam özetleme ve varlık ilişkilendirme.
- Sentetik LLM Eğitimi (Instruction Tuning): Türkçe LLM'lerin (Llama, Mistral, Qwen, Gemma vb.) Türkçe sentaks ve gramer hâkimiyetini artırma.
- Adlandırılmış Varlık Tanıma (NER) & Semantik Rol Etiketleme (SRL): Cümle ögelerinin ayrıştırılması.
💻 3. Hızlı Başlangıç & Kullanım (Quickstart)
Hugging Face datasets kütüphanesi ile veriyi tek satırda yükleyebilirsiniz:
from datasets import load_dataset
# Veri setini yükle
dataset = load_dataset("bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset")
# İlk örneği görüntüle
print(dataset['train'][0])Alternatif olarak doğrudan pandas ile JSONL dosyasını okumak için:
import pandas as pd
df = pd.read_json("hf://datasets/bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset/cumleler.jsonl", lines=True)
print(df.head())📊 4. Veri Şeması (Data Schema)
Veri seti cumleler.jsonl dosyasında JSON satırları halinde saklanmaktadır.
🌐 5. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)
Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:
📜 6. Lisans, Kullanım Koşulları & Atıf (License & Citation)
### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*
Ticari lisanslama, iş birliği ve izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.
Çalışmalarınızda bu veri setini referans vermek isterseniz:
@misc{bysismo2026turkish5n1k,
author = {Tektakar, Hakan (bysismo)},
title = {Turkish 5N1K Structured Synthetic Dataset},
year = {2026},
license = {CC BY-NC 4.0},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/datasets/bysismo/Turkish_5N1K_Tabanli_Sentetik_Veri_Seti_TR-Structured_Synthetic_Dataset}}
}👨💻 Geliştirici & İletişim
- Hazırlayan: Hakan Tektakar (@bysismo)
- GitHub: bysismo
- Kaggle: hakanttkar
