sentence-transformers/embedding-training-data
Training Data for Text Embedding Models [!NOTE] This repository contains raw datasets, all of which have also been formatted for easy training in the Embedding Model Datasets collection. We recommend looking there first. This repository contains training files to train text embedding models, e.g. using sentence-transformers. Data Format All files are in a jsonl.gz format: Each line contains a JSON-object that represent one training example. The JSON objects can… See the full description on the dataset page: https://huggingface.co/datasets/sentence-transformers/embedding-training-data.
1442.1k
agnews.jsonl.gzdownload
AllNLI.jsonl.gzdownload
altlex.jsonl.gzdownload
amazon_review_2018.jsonl.gzdownload
amazon-qa.jsonl.gzdownload
ccnews_title_text.jsonl.gzdownload
cnn_dailymail_splitted.jsonl.gzdownload
cnn_dailymail.jsonl.gzdownload
coco_captions.jsonl.gzdownload
codesearchnet.jsonl.gzdownload
eli5_question_answer.jsonl.gzdownload
flickr30k_captions.jsonl.gzdownload
gooaq_pairs.jsonl.gzdownload
msmarco-triplets.jsonl.gzdownload
npr.jsonl.gzdownload
NQ-train_pairs.jsonl.gzdownload
PAQ_pairs.jsonl.gzdownload
quora_duplicates_triplets.jsonl.gzdownload
quora_duplicates.jsonl.gzdownload
S2ORC_citations_abstracts.jsonl.gzdownload
S2ORC_citations_titles.jsonl.gzdownload
S2ORC_title_abstract.jsonl.gzdownload
searchQA_top5_snippets.jsonl.gzdownload
sentence-compression.jsonl.gzdownload
SimpleWiki.jsonl.gzdownload
specter_train_triples.jsonl.gzdownload
squad_pairs.jsonl.gzdownload
stackexchange_duplicate_questions_body_body.jsonl.gzdownload
stackexchange_duplicate_questions_title_title.jsonl.gzdownload
stackexchange_duplicate_questions_title-body_title-body.jsonl.gzdownload
TriviaQA_pairs.jsonl.gzdownload
WikiAnswers.jsonl.gzdownload
xsum.jsonl.gzdownload
yahoo_answers_question_answer.jsonl.gzdownload
yahoo_answers_title_answer.jsonl.gzdownload
yahoo_answers_title_question.jsonl.gzdownload
