saeidseyfi/newDB
Dataset Card for Multilingual News Analysis Dataset This dataset contains metadata for news from global sources in multiple languages, designed for multilingual NLP tasks. Dataset Details Dataset Description The dataset includes news article metadata with titles, descriptions, and links in languages such as English, Arabic, Spanish, French, Persian, Chinese, and others. It supports tasks like text analysis, sentiment analysis, and topic modeling… See the full description on the dataset page: https://huggingface.co/datasets/saeidseyfi/newDB.
Dataset Card for Multilingual News Analysis Dataset
This dataset contains metadata for news from global sources in multiple languages, designed for multilingual NLP tasks.
Dataset Details
Dataset Description
The dataset includes news article metadata with titles, descriptions, and links in languages such as English, Arabic, Spanish, French, Persian, Chinese, and others. It supports tasks like text analysis, sentiment analysis, and topic modeling, with computed features for word counts and unique word ratios.
- Curated by: saeid seyfi
- Language(s) (NLP): English, Arabic, Spanish, French, Persian, Chinese, others
- License: CC BY-SA 4.0
Uses
Direct Use
Suitable for:
- Multilingual NLP (translation, summarization, sentiment analysis).
- Cross-lingual news trend analysis.
- Training text classification or clustering models.
Dataset Structure
Tabular CSV with fields:
id: Unique article identifier.title: Article title in original language.description: Article description in original language.link: URL to article.image_url: Image URL (often NaN).title_word_count: Word count in title.description_word_count: Word count in description.avg_word_length_title: Average word length in title.avg_word_length_description: Average word length in description.unique_word_ratio_title: Unique word ratio in title.unique_word_ratio_description: Unique word ratio in description.description_sentences: Sentence count in description.has_image: Binary (1 if image_url exists, 0 otherwise).
Dataset Creation
Curation Rationale
Created to enable multilingual news analysis and cross-cultural NLP research.
Source Data
Data Collection and Processing
- Sources: Global news outlets.
- Processing: Extracted titles, descriptions, and links; computed metadata (e.g., word counts) using Python and pandas. No text normalization applied.
- Tools: Python, pandas, nltk.
Citation
BibTeX:
@dataset{multilingualnewsanalysis_2025, author = {[https://huggingface.co/saeidseyfi]}, title = {Multilingual News Analysis Dataset}, year = {2025}, url = {[https://huggingface.co/datasets/saeidseyfi/newDB]} }
APA:
[https://huggingface.co/saeidseyfi]. (2025). Multilingual News Analysis Dataset. [https://huggingface.co/datasets/saeidseyfi/newDB].
Glossary
- Unique Word Ratio: Proportion of distinct words in a text field.
- Word Count: Total words in a text field.
