UTokyo-Yokoya-Lab/twittersemeval2015-pairclassification_CS-MTEB
TwitterSemEval2015 CS-MTEB Code-switching version of mteb/twittersemeval2015-pairclassification, with sentence pairs rewritten in Chinese-English, Japanese-English, German-English, Spanish-English, Korean-English, French-English, Italian-English, Portuguese-English, Dutch-English code-switching styles. Dataset Structure From original dataset (unchanged): default: Original test split (batched format) Code-switching test sets (flat format): test_zh_en:… See the full description on the dataset page: https://huggingface.co/datasets/UTokyo-Yokoya-Lab/twittersemeval2015-pairclassification_CS-MTEB.
Update README.md
Update README.md
Upload dataset
Remove test_de_en for re-upload
Update README: all configs point to parquet
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Remove test_nl_en.jsonl
Remove test_pt_en.jsonl
Remove test_it_en.jsonl
Remove test_fr_en.jsonl
Remove test_ko_en.jsonl
Remove test_es_en.jsonl
Remove test_de_en.jsonl
Remove test_ja_en.jsonl
Remove test_zh_en.jsonl
Update dataset card for CS-MTEB version
Add Dutch-English code-switching test data
Add Portuguese-English code-switching test data
Add Italian-English code-switching test data
Add French-English code-switching test data
Add Korean-English code-switching test data
Add Spanish-English code-switching test data
Add German-English code-switching test data
Add Japanese-English code-switching test data
Add Chinese-English code-switching test data
Remove original test.json.gz
Duplicate from mteb/twittersemeval2015-pairclassification
