CoolFace
Datasetpublic

UTokyo-Yokoya-Lab/twittersemeval2015-pairclassification_CS-MTEB

TwitterSemEval2015 CS-MTEB Code-switching version of mteb/twittersemeval2015-pairclassification, with sentence pairs rewritten in Chinese-English, Japanese-English, German-English, Spanish-English, Korean-English, French-English, Italian-English, Portuguese-English, Dutch-English code-switching styles. Dataset Structure From original dataset (unchanged): default: Original test split (batched format) Code-switching test sets (flat format): test_zh_en:… See the full description on the dataset page: https://huggingface.co/datasets/UTokyo-Yokoya-Lab/twittersemeval2015-pairclassification_CS-MTEB.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes76downloads
Dataset Card

TwitterSemEval2015 CS-MTEB

Code-switching version of mteb/twittersemeval2015-pairclassification, with sentence pairs rewritten in Chinese-English, Japanese-English, German-English, Spanish-English, Korean-English, French-English, Italian-English, Portuguese-English, Dutch-English code-switching styles.

Dataset Structure

From original dataset (unchanged):

  • —default: Original test split (batched format)

Code-switching test sets (flat format):

  • —test_zh_en: Chinese-English code-switching test set
  • —test_ja_en: Japanese-English code-switching test set
  • —test_de_en: German-English code-switching test set
  • —test_es_en: Spanish-English code-switching test set
  • —test_ko_en: Korean-English code-switching test set
  • —test_fr_en: French-English code-switching test set
  • —test_it_en: Italian-English code-switching test set
  • —test_pt_en: Portuguese-English code-switching test set
  • —test_nl_en: Dutch-English code-switching test set

Usage

Attribution

Based on mteb/twittersemeval2015-pairclassification.