CoolFace
Datasetpublic

bysismo/2k3n1d-Temel-cumle-analizi-284k

🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE):Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın!(If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance). 🇹🇷… See the full description on the dataset page: https://huggingface.co/datasets/bysismo/2k3n1d-Temel-cumle-analizi-284k.

sourceHugging Facecc-by-nc-4.0updated 1mo agoView on Hugging Face
1likes28downloads
Dataset Card
🌟 DESTEK & TOPLULUK ÇAĞRISI (SUPPORT & LIKE): Açık kaynak ve ücretsiz olarak sunduğum bu devasa çalışmayı faydalı bulduysanız, projenin sürdürülebilirliğine ve açık kaynak ekosisteminin görünürlüğüne katkı sağlamak için lütfen sayfanın sağ üstündeki Like (❤️ Beğeni) butonuna basarak destek olmayı unutmayın! (If you find this open-source dataset valuable for your research or models, please consider leaving a ❤️ Like at the top-right to support future updates and maintenance).

🇹🇷 2K3N1D: Türkçe Temel Cümle Analizi ve Duygu Analizi Veri Seti

284.760 Örnekten Oluşan Yapılandırılmış Semantik Bilgi Çıkarımı ve Duygu Etiketleme Veri Seti

![License: CC BY-NC 4.0](https://creativecommons.org/licenses/by-nc/4.0/) ![Language: Turkish-red.svg)](#) ![Dataset Size](#) ![Author: bysismo-orange.svg)](https://huggingface.co/bysismo)


📌 1. Veri Seti Hakkında (About Dataset)

2K3N1D, Türkçe doğal dil işleme (NLP) ekosisteminde yapılandırılmış veri (structured semantic data) ihtiyacını karşılamak amacıyla tasarlanmış, 284.760 adet sentetik ve kurallı cümleden oluşan zengin bir veri setidir.

Veri setinin mimarisi 6 temel dilbilgisel öge ve 1 duygu sınıflandırması üzerine kurulmuştur:

  • —👤 2K (Kim, Kiminle): Özne ve eyleme eşlik eden aktör
  • —📍 3N (Nerede, Ne Zaman, Ne Yapıyor): Konum (81 il, 720 ilçe, ~4000 mahalle), zaman ifadesi ve eylem/yüklem
  • —🎭 1D (Duygu Analizi): Cümlenin anlamsal duygu durumu (8 farklı sınıf)

🎭 2. Duygu Analizi Sınıfları (Sentiment Classes)

Veri setinde 8 farklı duygu etiketi dengeli bir biçimde dağıtılmıştır:

  • —Pozitif | Negatif | Nötr
  • —Şaşkın | Üzgün | Mutlu | Mutsuz | Heyecanlı

🚀 3. Kullanım Alanları (Use Cases)

  1. 1.Semantik Rol Etiketleme (SRL) & NER: Cümle içi ögelerin ve coğrafi varlıkların ayrıştırılması.
  2. 2.Bilgi Çıkarımı (Information Extraction): Ham metinden yapılandırılmış JSON çıkarma.
  3. 3.Duygu Durumu Tespiti (Sentiment Analysis): Çok sınıflı duygu analizi modellerinin eğitimi.
  4. 4.Türkçe LLM Fine-Tuning: LLM'lerin Türkçe sentaks ve çıkarım yeteneklerini artırma.

💻 4. Hızlı Başlangıç & Kullanım (Quickstart)

Hugging Face datasets kütüphanesi ile tek satırda yükleyebilirsiniz:

python
from datasets import load_dataset

# Veri setini yükle
dataset = load_dataset("bysismo/2k3n1d-Temel-cumle-analizi-284k")

# İlk örneği görüntüle
print(dataset['train'][0])

Alternatif olarak doğrudan pandas ile okumak için:

python
import pandas as pd

df = pd.read_json("hf://datasets/bysismo/2k3n1d-Temel-cumle-analizi-284k/train.jsonl", lines=True)
print(f"Toplam Yüklenen Örnek: {len(df):,}")
print(df.head())

📊 5. Veri Şeması (Data Schema)

Her satır bağımsız bir JSON objesidir:

json
{
  "input": "Yoga eğitmeni polisle Mardin Kızıltepe Cumhuriyet Mahallesinde anneler gününde çocukların yanına gitti.",
  "kim": "Yoga eğitmeni",
  "kiminle": "polisle",
  "nerede": "Mardin Kızıltepe Cumhuriyet Mahallesinde",
  "ne_zaman": "anneler gününde",
  "ne_yapiyor": "çocukların yanına gitti",
  "Duygu_Analizi": "Pozitif"
}
Alan (Field)TipAçıklama
inputstringAnaliz edilen tam Türkçe cümle
kimstringEylemi gerçekleştiren özne/kişi
kiminlestringEylemin birlikte yapıldığı aktör
neredestringEylemin gerçekleştiği mekan/il/ilçe/mahalle
ne_zamanstringEylemin zaman dilimi
ne_yapiyorstringGerçekleştirilen yüklem/eylem
Duygu_Analizistring8 sınıflı duygu etiketi

🌐 6. İlgili Türkçe Veri Setleri Ekosistemi (Bysismo Ecosystem)

Türkçe yapay zeka, kodlama ve dil modelleri için geliştirdiğimiz diğer açık kaynaklı dev veri setlerimizi de inceleyebilirsiniz:

Veri Seti AdıÖrnek SayısıAlan / OdakBağlantı
🐍 Turkish Python Instruction 335K335.286 ÖrnekPython Kod Üretimi, OOP, Algoritmalar, Shell & DBHF Repo
🗣️ Turkish Instruction 3M Soru Cevap2.98 Milyon ÖrnekGenel Türkçe Diyalog, Soru-Cevap & InstructionHF Repo
🇹🇷 Turkish 5N1K Sentetik Veri Seti100.000+ Örnek5N1K Semantik Bilgi Çıkarımı ve Metin AyrıştırmaHF Repo
📖 Temel Cümle Analizi 2.7M2.76 Milyon ÖrnekSentaks, Gramer, Sentetik Cümle ÇözümlemeHF Repo
📚 100k TDK & Morfolojik DNA98.100 ÖrnekTürkçe Sözlük, Kök & Ek Morfolojik AnalizHF Repo
🔤 Turkish 675K Morfolojik Kelime67.800 ÖrnekKelime Tabanlı Morfoloji ve Fonetik YapıHF Repo
🏆 Kaggle: Turkish Python Expert 335K335.000 ÖrnekKaggle Topluluğu İçin Standart FormatKaggle Dataset

📜 7. Lisans, Kullanım Koşulları & Atıf (License & Citation)

### ⚠️ TİCARİ KULLANIM UYARISI: Bu veri seti akademik, araştırma ve açık kaynaklı kişisel projelerde serbestçe kullanılabilir (CC BY-NC 4.0). *Ticari kullanım (commercial use) için yazarın (Hakan Tektakar / bysismo) açık rıza beyanının alınması gerekmektedir.*

Ticari lisanslama, iş birliği ve kurumsal izin talepleri için Hugging Face profili üzerinden veya GitHub aracılığıyla iletişime geçebilirsiniz.

Çalışmalarınızda bu veri setini referans vermek isterseniz:

bibtex
@misc{bysismo2026temelcumleanalizi284k,
  author = {Tektakar, Hakan (bysismo)},
  title = {2K3N1D: Turkish Sentence Analysis & Sentiment Dataset (284K)},
  year = {2026},
  license = {CC BY-NC 4.0},
  publisher = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/bysismo/2k3n1d-Temel-cumle-analizi-284k}}
}

👨‍💻 Geliştirici & İletişim