avramandrei/RoIt-XMASA
RoIt-XMASA Romanian–Italian Cross-domain Multi-domain Sentiment Analysis RoIt-XMASA is a multilingual, cross-domain sentiment analysis dataset containing user reviews in Romanian (RO) and Italian (IT) across three domains: Books, Movies, and Music. Reviews are annotated with 1–5 star ratings (excluding 3). Dataset Summary Split Rows Labeled train 12,000 yes validation 12,000 yes test 12,000 yes unlabeled 202,141 no Splits… See the full description on the dataset page: https://huggingface.co/datasets/avramandrei/RoIt-XMASA.
RoIt-XMASA
Romanian–Italian Cross-domain Multi-domain Sentiment Analysis
RoIt-XMASA is a multilingual, cross-domain sentiment analysis dataset containing user reviews in Romanian (RO) and Italian (IT) across three domains: Books, Movies, and Music. Reviews are annotated with 1–5 star ratings (excluding 3).
Dataset Summary
Splits breakdown (labeled)
Each labeled split is perfectly balanced:
- Domains: 4,000 reviews per domain (Books / Movies / Music)
- Languages: 6,000 reviews per language (RO / IT)
Data Fields
Usage
from datasets import load_dataset
ds = load_dataset("avramandrei/RoIt-XMASA")
# Labeled splits
train = ds["train"]
val = ds["validation"]
test = ds["test"]
# Filter by language or domain
ro_books = train.filter(lambda x: x["language"] == "RO" and x["domain"] == "Books")