CoolFace
Datasetpublic

saeidseyfi/newDB

Dataset Card for Multilingual News Analysis Dataset This dataset contains metadata for news from global sources in multiple languages, designed for multilingual NLP tasks. Dataset Details Dataset Description The dataset includes news article metadata with titles, descriptions, and links in languages such as English, Arabic, Spanish, French, Persian, Chinese, and others. It supports tasks like text analysis, sentiment analysis, and topic modeling… See the full description on the dataset page: https://huggingface.co/datasets/saeidseyfi/newDB.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes8downloads
Dataset Card

Dataset Card for Multilingual News Analysis Dataset

This dataset contains metadata for news from global sources in multiple languages, designed for multilingual NLP tasks.

Dataset Details

Dataset Description

The dataset includes news article metadata with titles, descriptions, and links in languages such as English, Arabic, Spanish, French, Persian, Chinese, and others. It supports tasks like text analysis, sentiment analysis, and topic modeling, with computed features for word counts and unique word ratios.

  • —Curated by: saeid seyfi
  • —Language(s) (NLP): English, Arabic, Spanish, French, Persian, Chinese, others
  • —License: CC BY-SA 4.0

Uses

Direct Use

Suitable for:

  • —Multilingual NLP (translation, summarization, sentiment analysis).
  • —Cross-lingual news trend analysis.
  • —Training text classification or clustering models.

Dataset Structure

Tabular CSV with fields:

  • —id: Unique article identifier.
  • —title: Article title in original language.
  • —description: Article description in original language.
  • —link: URL to article.
  • —image_url: Image URL (often NaN).
  • —title_word_count: Word count in title.
  • —description_word_count: Word count in description.
  • —avg_word_length_title: Average word length in title.
  • —avg_word_length_description: Average word length in description.
  • —unique_word_ratio_title: Unique word ratio in title.
  • —unique_word_ratio_description: Unique word ratio in description.
  • —description_sentences: Sentence count in description.
  • —has_image: Binary (1 if image_url exists, 0 otherwise).

Dataset Creation

Curation Rationale

Created to enable multilingual news analysis and cross-cultural NLP research.

Source Data

Data Collection and Processing
  • —Sources: Global news outlets.
  • —Processing: Extracted titles, descriptions, and links; computed metadata (e.g., word counts) using Python and pandas. No text normalization applied.
  • —Tools: Python, pandas, nltk.

Citation

BibTeX:

@dataset{multilingualnewsanalysis_2025, author = {[https://huggingface.co/saeidseyfi]}, title = {Multilingual News Analysis Dataset}, year = {2025}, url = {[https://huggingface.co/datasets/saeidseyfi/newDB]} }

APA:

[https://huggingface.co/saeidseyfi]. (2025). Multilingual News Analysis Dataset. [https://huggingface.co/datasets/saeidseyfi/newDB].

Glossary

  • —Unique Word Ratio: Proportion of distinct words in a text field.
  • —Word Count: Total words in a text field.