sentence-transformers/embedding-training-data
Training Data for Text Embedding Models [!NOTE] This repository contains raw datasets, all of which have also been formatted for easy training in the Embedding Model Datasets collection. We recommend looking there first. This repository contains training files to train text embedding models, e.g. using sentence-transformers. Data Format All files are in a jsonl.gz format: Each line contains a JSON-object that represent one training example. The JSON objects can… See the full description on the dataset page: https://huggingface.co/datasets/sentence-transformers/embedding-training-data.
Update README.md
Drop
Update README.md
add NPR
add agnews corpus
delete fever file
add ccnews
update readme
add xsum and cnn dailymail corpora
add S2ORC citations abstract dataset
add S2ORC cititation titles
add amazon_review corpus
add quora triplets
Add amazonqa
add searchQA
add ms marco
add flickr dataset
add captions dataset
update
Add WikiAnswers
update readme
Readme
add PAQ
add S2ORC file
First file upload
initial commit
