bysismo/2k3n1d-Temel-cumle-analizi-284k
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/2k3n1d-Temel-cumle-analizi-284k.
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).
🇹🇷 2K3N1D: Türkçe Temel Cümle Analizi ve Duygu Analizi Veri Seti
284.760 Örnekten Oluşan Yapılandırılmış Semantik Bilgi Çıkarımı ve Duygu Etiketleme Veri Seti
   
📌 1. Veri Seti Hakkında (About Dataset)
2K3N1D, Türkçe doğal dil işleme (NLP) ekosisteminde yapılandırılmış veri (structured semantic data) ihtiyacını karşılamak amacıyla tasarlanmış, 284.760 adet sentetik ve kurallı cümleden oluşan zengin bir veri setidir.
Veri setinin mimarisi 6 temel dilbilgisel öge ve 1 duygu sınıflandırması üzerine kurulmuştur:
- 👤 2K (Kim, Kiminle): Özne ve eyleme eşlik eden aktör
- 📍 3N (Nerede, Ne Zaman, Ne Yapıyor): Konum (81 il, 720 ilçe, ~4000 mahalle), zaman ifadesi ve eylem/yüklem
- 🎭 1D (Duygu Analizi): Cümlenin anlamsal duygu durumu (8 farklı sınıf)
🎭 2. Duygu Analizi Sınıfları (Sentiment Classes)
Veri setinde 8 farklı duygu etiketi dengeli bir biçimde dağıtılmıştır:
Pozitif|Negatif|NötrŞaşkın|Üzgün|Mutlu|Mutsuz|Heyecanlı
🚀 3. Kullanım Alanları (Use Cases)
- Semantik Rol Etiketleme (SRL) & NER: Cümle içi ögelerin ve coğrafi varlıkların ayrıştırılması.
- Bilgi Çıkarımı (Information Extraction): Ham metinden yapılandırılmış JSON çıkarma.
- Duygu Durumu Tespiti (Sentiment Analysis): Çok sınıflı duygu analizi modellerinin eğitimi.
- Türkçe LLM Fine-Tuning: LLM'lerin Türkçe sentaks ve çıkarım yeteneklerini artırma.
💻 4. Hızlı Başlangıç & Kullanım (Quickstart)
Hugging Face datasets kütüphanesi ile tek satırda yükleyebilirsiniz:
from datasets import load_dataset
# Veri setini yükle
dataset = load_dataset("bysismo/2k3n1d-Temel-cumle-analizi-284k")
# İlk örneği görüntüle
print(dataset['train'][0])Alternatif olarak doğrudan pandas ile okumak için:
import pandas as pd
df = pd.read_json("hf://datasets/bysismo/2k3n1d-Temel-cumle-analizi-284k/train.jsonl", lines=True)
print(f"Toplam Yüklenen Örnek: {len(df):,}")
print(df.head())📊 5. Veri Şeması (Data Schema)
Her satır bağımsız bir JSON objesidir:
{
"input": "Yoga eğitmeni polisle Mardin Kızıltepe Cumhuriyet Mahallesinde anneler gününde çocukların yanına gitti.",
"kim": "Yoga eğitmeni",
"kiminle": "polisle",
"nerede": "Mardin Kızıltepe Cumhuriyet Mahallesinde",
"ne_zaman": "anneler gününde",
"ne_yapiyor": "çocukların yanına gitti",
"Duygu_Analizi": "Pozitif"
}🌐 6. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)
Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:
📜 7. Lisans, Kullanım Koşulları & Atıf (License & Citation)
### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*
Ticari lisanslama, iş birliği ve kurumsal izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.
Çalışmalarınızda bu veri setini referans vermek isterseniz:
@misc{bysismo2026temelcumleanalizi284k,
author = {Tektakar, Hakan (bysismo)},
title = {2K3N1D: Turkish Sentence Analysis & Sentiment Dataset (284K)},
year = {2026},
license = {CC BY-NC 4.0},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/datasets/bysismo/2k3n1d-Temel-cumle-analizi-284k}}
}👨💻 Geliştirici & İletişim
- Hazırlayan: Hakan Tektakar (@bysismo)
- GitHub: bysismo
- Kaggle: hakanttkar
