CoolFace
Datasetpublic

msislam/marc-code-mixed-small

marc-code-mixed-small This dataset is based on The Multilingual Amazon Reviews Corpus. It contains German (DE), English (EN), Spanish (ES), and French (FR) languages. The labels are 0 (DE), 1 (EN), 2 (ES), and 3 (FR). Each review contains all four languages. Total number of tokens: In training set: 10195342 In test set: 842760 In validation set: 842760

sourceHugging Faceupdated 3y agoView on Hugging Face
0likes32downloads
Dataset Card

marc-code-mixed-small

This dataset is based on The Multilingual Amazon Reviews Corpus.

It contains German (DE), English (EN), Spanish (ES), and French (FR) languages.

The labels are 0 (DE), 1 (EN), 2 (ES), and 3 (FR).

Each review contains all four languages.

Total number of tokens:

  • In training set: 10195342
  • In test set: 842760
  • In validation set: 842760