datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base
Wikipedia-Longest-Stride-Chunked-500-Embed-intfloat-multilingual-e5-base
This is the embed processed version of Wikipedia-Longest-Stride-Chunked-500 HF Dataset.
Computational Resources
Used Computational Resources : Colab Pro+ H100 Instance
Total Consumed Time : 24h
Dataset processing
train : 974720 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.
test, val : each 1000 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.… See the full description on the dataset page: https://huggingface.co/datasets/enzoescipy/wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base.wikipedia-longest-salami-chunked-500-embed-intfloat-multilingual-e5-basemassive_serve_dpr_wiki_e5_base_v2_ivfpq
