CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01mteb /sprintduplicatequestions-pairclassification SprintDuplicateQuestions An MTEB dataset Massive Text Embedding Benchmark Duplicate questions from the Sprint community. Task category t2t Domains Programming, Written Reference https://www.aclweb.org/anthology/D18-1131/ How to evaluate on this task You can evaluate an embedding model on this dataset using the following code: import mteb task = mteb.get_tasks(["SprintDuplicateQuestions"]) evaluator = mteb.MTEB(task) model = mteb.get_model(YOUR_MODEL)… See the full description on the dataset page: https://huggingface.co/datasets/mteb/sprintduplicatequestions-pairclassification.texttext-classificationn<1K0 likes7.5k downloads7mo agoHugging Face02mteb /twittersemeval2015-pairclassification TwitterSemEval2015 An MTEB dataset Massive Text Embedding Benchmark Paraphrase-Pairs of Tweets from the SemEval 2015 workshop. Task category t2t Domains Social, Written Reference https://alt.qcri.org/semeval2015/task1/ How to evaluate on this task You can evaluate an embedding model on this dataset using the following code: import mteb task = mteb.get_tasks(["TwitterSemEval2015"]) evaluator = mteb.MTEB(task) model = mteb.get_model(YOUR_MODEL)… See the full description on the dataset page: https://huggingface.co/datasets/mteb/twittersemeval2015-pairclassification.texttext-classificationn<1K0 likes4.9k downloads1y agoHugging Face03mteb /twitterurlcorpus-pairclassification TwitterURLCorpus An MTEB dataset Massive Text Embedding Benchmark Paraphrase-Pairs of Tweets. Task category t2t Domains Social, Written Reference https://languagenet.github.io/ How to evaluate on this task You can evaluate an embedding model on this dataset using the following code: import mteb task = mteb.get_tasks(["TwitterURLCorpus"]) evaluator = mteb.MTEB(task) model = mteb.get_model(YOUR_MODEL) evaluator.run(model) To learn more about how to run… See the full description on the dataset page: https://huggingface.co/datasets/mteb/twitterurlcorpus-pairclassification.texttext-classificationn<1K0 likes4.7k downloads7mo agoHugging Face04Lots-of-LoRAs /task1645_medical_question_pair_dataset_text_classification Dataset Card for Natural Instructions (https://github.com/allenai/natural-instructions) Task: task1645_medical_question_pair_dataset_text_classification Additional Information Citation Information The following paper introduces the corpus in detail. If you use the corpus in published work, please cite it: @misc{wang2022supernaturalinstructionsgeneralizationdeclarativeinstructions, title={Super-NaturalInstructions: Generalization via Declarative… See the full description on the dataset page: https://huggingface.co/datasets/Lots-of-LoRAs/task1645_medical_question_pair_dataset_text_classification.texttext-generation1K<n<10K2 likes163 downloads2y agoHugging Face05suwaimyo /newsph-nli-fil-pairclassification NewsPHNLI_fil_PairClassification Deduplicated copy of kornwtp/newsph-nli-fil-pairclassification. Splits split rows test 8,995 train 418,705 validation 89,836 text100K<n<1M0 likes131 downloads28d agoHugging Face06suwaimyo /squad-nli-ind-pairclassification SQuADNLI_ind_PairClassification Deduplicated copy of kornwtp/squad-nli-ind-pairclassification. Splits split rows test 22,190 train 217,873 validation 22,128 text100K<n<1M0 likes114 downloads28d agoHugging Face07suwaimyo /xnli-vie-pairclassification XNLI_vie_PairClassification Deduplicated copy of kornwtp/xnli-vie-pairclassification. Splits split rows test 5,010 train 392,417 validation 2,490 text100K<n<1M0 likes109 downloads28d agoHugging Face08ai-forever /terra-pairclassificationtexttext-classificationn<1K0 likes108 downloads2y agoHugging Face09suwaimyo /xnli-khm-pairclassification XNLI_khm_PairClassification Deduplicated copy of kornwtp/xnli-khm-pairclassification. Splits split rows test 3,340 validation 1,660 text1K<n<10K0 likes103 downloads28d agoHugging Face10suwaimyo /burmese-xnli-mya-pairclassification BurmeseXNLI_mya_PairClassification Deduplicated copy of kornwtp/burmese-xnli-mya-pairclassification. Splits split rows test 3,338 validation 1,660 text1K<n<10K0 likes98 downloads28d agoHugging Face11GreenNode /sprintduplicatequestions-pairclassification-vn How to evaluate on this task You can evaluate an embedding model on this dataset using the following code: import mteb task = mteb.get_tasks(["SprintDuplicateQuestions-VN"]) evaluator = mteb.MTEB(task) model = mteb.get_model(YOUR_MODEL) evaluator.run(model) To learn more about how to run models on mteb task check out the GitHub repitory. Citation If you use this dataset, please cite the dataset as well as mteb, as this dataset likely includes additional… See the full description on the dataset page: https://huggingface.co/datasets/GreenNode/sprintduplicatequestions-pairclassification-vn.texttext-classificationn<1K0 likes96 downloads1y agoHugging Face12suwaimyo /indic-xnli-tam-pairclassification IndicXNLI_tam_PairClassification Deduplicated copy of kornwtp/indic-xnli-tam-pairclassification. Splits split rows test 5,007 train 392,286 validation 2,489 text100K<n<1M0 likes96 downloads28d agoHugging Face13suwaimyo /idnli-ind-pairclassification IndoNLI_ind_PairClassification Deduplicated copy of kornwtp/idnli-ind-pairclassification. Splits split rows test 1,569 train 6,913 validation 1,556 text10K<n<100K0 likes96 downloads28d agoHugging Face14suwaimyo /myxnli-mya-pairclassification MyXNLI_mya_PairClassification Deduplicated copy of kornwtp/myxnli-mya-pairclassification. Splits split rows test 5,009 train 392,437 validation 2,490 text100K<n<1M0 likes96 downloads28d agoHugging Face15suwaimyo /xnli-tha-pairclassification XNLI_tha_PairClassification Deduplicated copy of kornwtp/xnli-tha-pairclassification. Splits split rows test 5,010 train 392,482 validation 2,490 text100K<n<1M0 likes94 downloads28d agoHugging Face16suwaimyo /tydiqa-nli-ind-pairclassification TyDIQANLI_ind_PairClassification Deduplicated copy of kornwtp/tydiqa-nli-ind-pairclassification. Splits split rows test 1,575 train 8,764 validation 1,040 text10K<n<100K0 likes91 downloads28d agoHugging Face17suwaimyo /idkmrc-nli-ind-pairclassification IDKMRCNLI_ind_PairClassification Deduplicated copy of kornwtp/idkmrc-nli-ind-pairclassification. Splits split rows test 1,539 train 17,074 validation 1,403 text10K<n<100K0 likes86 downloads28d agoHugging Face18suwaimyo /wrete-ind-pairclassification WReTE_ind_PairClassification Deduplicated copy of kornwtp/wrete-ind-pairclassification. Splits split rows test 100 train 300 validation 50 textn<1K0 likes85 downloads28d agoHugging Face19suwaimyo /xnli-zsm-pairclassification XNLI_zsm_PairClassification Deduplicated copy of kornwtp/xnli-zsm-pairclassification. Splits split rows test 3,339 validation 1,660 text1K<n<10K0 likes85 downloads28d agoHugging Face20UTokyo-Yokoya-Lab /twittersemeval2015-pairclassification_CS-MTEB TwitterSemEval2015 CS-MTEB Code-switching version of mteb/twittersemeval2015-pairclassification, with sentence pairs rewritten in Chinese-English, Japanese-English, German-English, Spanish-English, Korean-English, French-English, Italian-English, Portuguese-English, Dutch-English code-switching styles. Dataset Structure From original dataset (unchanged): default: Original test split (batched format) Code-switching test sets (flat format): test_zh_en: Chinese-English… See the full description on the dataset page: https://huggingface.co/datasets/UTokyo-Yokoya-Lab/twittersemeval2015-pairclassification_CS-MTEB.texttext-classification100K<n<1M0 likes84 downloads5mo agoHugging Face21suwaimyo /xnli-lao-pairclassification XNLITranslated_lao_PairClassification Deduplicated copy of kornwtp/xnli-lao-pairclassification. Splits split rows test 3,340 text1K<n<10K0 likes82 downloads28d agoHugging Face22suwaimyo /multilingual-nli-26lang-2mil7-vie-pairclassification MultilingualNLI26lang2mil7_vie_PairClassification Deduplicated copy of kornwtp/multilingual-nli-26lang-2mil7-vie-pairclassification. Splits split rows vi_anli 24,968 text10K<n<100K0 likes81 downloads28d agoHugging Face23suwaimyo /spamid-pair-ind-classification SpamidPair_ind_Classification Deduplicated copy of kornwtp/spamid-pair-ind-classification. Splits split rows train 1,911 text1K<n<10K0 likes80 downloads28d agoHugging Face24MCINext /synthetic-persian-chatbot-rag-faq-pair-classification Dataset Summary Synthetic Persian Chatbot RAG FAQ Pair Classification (SynPerChatbotRAGFAQPC) is a Persian (Farsi) dataset for the Pair Classification task, specifically designed for evaluating Retrieval-Augmented Generation (RAG) chatbot systems. It is part of the FaMTEB (Farsi Massive Text Embedding Benchmark) and was synthetically generated using GPT-4o-mini. The dataset measures a model’s ability to assess whether a given FAQ (question–answer pair) is relevant to a new user… See the full description on the dataset page: https://huggingface.co/datasets/MCINext/synthetic-persian-chatbot-rag-faq-pair-classification.text1K<n<10K0 likes74 downloads1y agoHugging Face25MCINext /synthetic-persian-text-keyword-pair-classification Dataset Summary Synthetic Persian Text-Keywords Pair Classification (SynPerTextKeywordsPC) is a Persian (Farsi) dataset developed for the Pair Classification task. The dataset focuses on determining whether a keyword or short phrase is relevant to a longer Persian text passage. It is a component of the FaMTEB (Farsi Massive Text Embedding Benchmark) and was synthetically created using GPT-4o-mini. Language(s): Persian (Farsi) Task(s): Pair Classification (Text–Keyword Relevance)… See the full description on the dataset page: https://huggingface.co/datasets/MCINext/synthetic-persian-text-keyword-pair-classification.text10K<n<100K0 likes70 downloads1y agoHugging Face26MCINext /synthetic-persian-qa-pair-classification Dataset Summary Synthetic Persian QA Pair Classification (SynPerQAPC) is a Persian (Farsi) dataset created for the Pair Classification task, focusing on determining the correctness or relevance of an answer to a given question. It is part of the FaMTEB (Farsi Massive Text Embedding Benchmark). This dataset was synthetically generated using GPT-4o-mini to simulate real-world question–answering scenarios. Language(s): Persian (Farsi) Task(s): Pair Classification (QA Answer… See the full description on the dataset page: https://huggingface.co/datasets/MCINext/synthetic-persian-qa-pair-classification.text100K<n<1M0 likes69 downloads1y agoHugging Face27kornwtp /xnli-tha-pairclassificationref: https://github.com/facebookresearch/XNLI text100K<n<1M0 likes68 downloads2y agoHugging Face28kornwtp /idkmrc-nli-ind-pairclassificationtext10K<n<100K0 likes54 downloads2y agoHugging Face29kornwtp /indic-xnli-tam-pairclassificationref: https://huggingface.co/datasets/Divyanshu/indicxnli text100K<n<1M0 likes53 downloads2y agoHugging Face30kornwtp /squad-nli-ind-pairclassificationtext100K<n<1M0 likes47 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.