UTokyo-Yokoya-Lab/twittersemeval2015-pairclassification_CS-MTEB
TwitterSemEval2015 CS-MTEB Code-switching version of mteb/twittersemeval2015-pairclassification, with sentence pairs rewritten in Chinese-English, Japanese-English, German-English, Spanish-English, Korean-English, French-English, Italian-English, Portuguese-English, Dutch-English code-switching styles. Dataset Structure From original dataset (unchanged): default: Original test split (batched format) Code-switching test sets (flat format): test_zh_en:… See the full description on the dataset page: https://huggingface.co/datasets/UTokyo-Yokoya-Lab/twittersemeval2015-pairclassification_CS-MTEB.
TwitterSemEval2015 CS-MTEB
Code-switching version of mteb/twittersemeval2015-pairclassification, with sentence pairs rewritten in Chinese-English, Japanese-English, German-English, Spanish-English, Korean-English, French-English, Italian-English, Portuguese-English, Dutch-English code-switching styles.
Dataset Structure
From original dataset (unchanged):
default: Original test split (batched format)
Code-switching test sets (flat format):
test_zh_en: Chinese-English code-switching test settest_ja_en: Japanese-English code-switching test settest_de_en: German-English code-switching test settest_es_en: Spanish-English code-switching test settest_ko_en: Korean-English code-switching test settest_fr_en: French-English code-switching test settest_it_en: Italian-English code-switching test settest_pt_en: Portuguese-English code-switching test settest_nl_en: Dutch-English code-switching test set
