CoolFace
Datasetpublic

tugrulkaya/turkish-news-headlines

🇹🇷 Turkish News Headlines Dataset Dataset Description Turkish news headlines dataset for text classification tasks. Contains headlines from various news categories. Dataset Summary Language: Turkish (tr) Task: Multi-class text classification Total Examples: 1,500 Categories: 8 License: CC-BY-4.0 Categories The dataset contains 8 news categories: Category Count Percentage politika 300 20.0% ekonomi 300 20.0% spor 300… See the full description on the dataset page: https://huggingface.co/datasets/tugrulkaya/turkish-news-headlines.

sourceHugging Facecc-by-4.0updated 11mo agoView on Hugging Face
0likes45downloads
Dataset Card

🇹🇷 Turkish News Headlines Dataset

Dataset Description

Turkish news headlines dataset for text classification tasks. Contains headlines from various news categories.

Dataset Summary

  • —Language: Turkish (tr)
  • —Task: Multi-class text classification
  • —Total Examples: 1,500
  • —Categories: 8
  • —License: CC-BY-4.0

Categories

The dataset contains 8 news categories:

CategoryCountPercentage
politika30020.0%
ekonomi30020.0%
spor30020.0%
teknoloji30020.0%
sağlık30020.0%
kültür-sanat00.0%
dünya00.0%
gündem00.0%

Dataset Structure

Data Fields

  • —headline (string): News headline text
  • —category (string): News category
  • —date (string): Publication date (YYYY-MM-DD)
  • —source (string): Data source
  • —length (int): Character count
  • —word_count (int): Word count

Data Splits

SplitExamples
Train1,050
Validation225
Test225

Usage

python
from datasets import load_dataset

# Load dataset
dataset = load_dataset("tugrulkaya/turkish-news-headlines")

# Access splits
train_data = dataset['train']
print(train_data[0])

# Example output:
# {
#   'headline': 'Yapay zeka teknolojileri hızla gelişiyor',
#   'category': 'teknoloji',
#   'date': '2024-06-15',
#   'source': 'manual_collection'
# }

Use Cases

✅ Text Classification

  • —News categorization
  • —Topic modeling
  • —Headline generation

✅ NLP Research

  • —Turkish language modeling
  • —Sentiment analysis baseline
  • —Transfer learning experiments

✅ Educational

  • —ML course projects
  • —NLP tutorials
  • —Classification examples

Dataset Creation

Source Data

Headlines collected from public sources and manually curated.

Annotation Process

  • —Manual category assignment
  • —Quality control checks
  • —Duplicate removal
  • —Format standardization

Data Quality

  • —✅ Balanced across categories
  • —✅ No duplicates
  • —✅ Clean formatting
  • —✅ Consistent labeling

Limitations

  • —Limited to Turkish language
  • —Focused on news domain
  • —Time period: 2023-2024
  • —May not represent all news sources

Citation

bibtex
@misc{kaya2024turkish-news-headlines,
  author = {TuÄŸrul Kaya},
  title = {Turkish News Headlines Dataset},
  year = {2024},
  publisher = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/tugrulkaya/turkish-news-headlines}}
}

License

This dataset is licensed under CC-BY-4.0.

Contact

  • —Creator: TuÄŸrul Kaya
  • —Hugging Face: @tugrulkaya
  • —Issues: Report issues on the dataset page

Acknowledgments

  • —Turkish NLP community
  • —News sources (for public data)
  • —Hugging Face for hosting

Last Updated: December 2024