CoolFace
Datasetpublic

avramandrei/RoIt-XMASA

RoIt-XMASA Romanian–Italian Cross-domain Multi-domain Sentiment Analysis RoIt-XMASA is a multilingual, cross-domain sentiment analysis dataset containing user reviews in Romanian (RO) and Italian (IT) across three domains: Books, Movies, and Music. Reviews are annotated with 1–5 star ratings (excluding 3). Dataset Summary Split Rows Labeled train 12,000 yes validation 12,000 yes test 12,000 yes unlabeled 202,141 no Splits… See the full description on the dataset page: https://huggingface.co/datasets/avramandrei/RoIt-XMASA.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
0likes45downloads
Dataset Card

RoIt-XMASA

Romanian–Italian Cross-domain Multi-domain Sentiment Analysis

RoIt-XMASA is a multilingual, cross-domain sentiment analysis dataset containing user reviews in Romanian (RO) and Italian (IT) across three domains: Books, Movies, and Music. Reviews are annotated with 1–5 star ratings (excluding 3).

Dataset Summary

SplitRowsLabeled
train12,000yes
validation12,000yes
test12,000yes
unlabeled202,141no

Splits breakdown (labeled)

Each labeled split is perfectly balanced:

  • —Domains: 4,000 reviews per domain (Books / Movies / Music)
  • —Languages: 6,000 reviews per language (RO / IT)

Data Fields

FieldTypeDescription
idint64Unique review identifier
titlestringReview title (may be empty)
textstringReview body
domainstringDomain: Books, Movies, or Music
languagestringLanguage code: RO (Romanian) or IT (Italian)
ratingint64Star rating: 1, 2, 4, or 5 (null for unlabeled)

Usage

python
from datasets import load_dataset

ds = load_dataset("avramandrei/RoIt-XMASA")

# Labeled splits
train = ds["train"]
val   = ds["validation"]
test  = ds["test"]

# Filter by language or domain
ro_books = train.filter(lambda x: x["language"] == "RO" and x["domain"] == "Books")