CoolFace
Datasetpublic

sentence-transformers/embedding-training-data

Training Data for Text Embedding Models [!NOTE] This repository contains raw datasets, all of which have also been formatted for easy training in the Embedding Model Datasets collection. We recommend looking there first. This repository contains training files to train text embedding models, e.g. using sentence-transformers. Data Format All files are in a jsonl.gz format: Each line contains a JSON-object that represent one training example. The JSON objects can… See the full description on the dataset page: https://huggingface.co/datasets/sentence-transformers/embedding-training-data.

sourceHugging Faceupdated 28d agoView on Hugging Face
144likes2.1kdownloads
fileagnews.jsonl.gz112.8 MBdownload
fileAllNLI.jsonl.gz15.8 MBdownload
filealtlex.jsonl.gz8.0 MBdownload
fileamazon_review_2018.jsonl.gz15.80 GBdownload
fileamazon-qa.jsonl.gz236.0 MBdownload
fileccnews_title_text.jsonl.gz581.2 MBdownload
filecnn_dailymail_splitted.jsonl.gz486.7 MBdownload
filecnn_dailymail.jsonl.gz486.2 MBdownload
filecoco_captions.jsonl.gz6.0 MBdownload
filecodesearchnet.jsonl.gz299.6 MBdownload
fileeli5_question_answer.jsonl.gz63.9 MBdownload
fileflickr30k_captions.jsonl.gz3.0 MBdownload
filegooaq_pairs.jsonl.gz345.4 MBdownload
filemsmarco-triplets.jsonl.gz2.52 GBdownload
filenpr.jsonl.gz410.4 MBdownload
fileNQ-train_pairs.jsonl.gz26.0 MBdownload
filePAQ_pairs.jsonl.gz16.92 GBdownload
filequora_duplicates_triplets.jsonl.gz51.6 MBdownload
filequora_duplicates.jsonl.gz3.3 MBdownload
fileS2ORC_citations_abstracts.jsonl.gz111.23 GBdownload
fileS2ORC_citations_titles.jsonl.gz29.48 GBdownload
fileS2ORC_title_abstract.jsonl.gz10.58 GBdownload
filesearchQA_top5_snippets.jsonl.gz74.3 MBdownload
filesentence-compression.jsonl.gz13.4 MBdownload
fileSimpleWiki.jsonl.gz8.1 MBdownload
filespecter_train_triples.jsonl.gz35.9 MBdownload
filesquad_pairs.jsonl.gz7.5 MBdownload
filestackexchange_duplicate_questions_body_body.jsonl.gz109.0 MBdownload
filestackexchange_duplicate_questions_title_title.jsonl.gz13.3 MBdownload
filestackexchange_duplicate_questions_title-body_title-body.jsonl.gz117.1 MBdownload
fileTriviaQA_pairs.jsonl.gz92.4 MBdownload
fileWikiAnswers.jsonl.gz7.76 GBdownload
filexsum.jsonl.gz198.7 MBdownload
fileyahoo_answers_question_answer.jsonl.gz173.2 MBdownload
fileyahoo_answers_title_answer.jsonl.gz209.4 MBdownload
fileyahoo_answers_title_question.jsonl.gz74.3 MBdownload

sentence-transformers/embedding-training-data · main · files are served by the source, never re-hosted here