CoolFace
Datasetpublic

enzoescipy/wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base

Wikipedia-Longest-Stride-Chunked-500-Embed-intfloat-multilingual-e5-base This is the embed processed version of Wikipedia-Longest-Stride-Chunked-500 HF Dataset. Computational Resources Used Computational Resources : Colab Pro+ H100 Instance Total Consumed Time : 24h Dataset processing train : 974720 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings. test, val : each 1000 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base… See the full description on the dataset page: https://huggingface.co/datasets/enzoescipy/wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base.

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes49downloads
Dataset Card

Wikipedia-Longest-Stride-Chunked-500-Embed-intfloat-multilingual-e5-base

This is the embed processed version of Wikipedia-Longest-Stride-Chunked-500 HF Dataset.

  1. 1.Computational Resources
  2. 2.Used Computational Resources : Colab Pro+ H100 Instance
  3. 3.Total Consumed Time : 24h
  4. 4.Dataset processing
  5. 5.train : 974720 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.
  6. 6.test, val : each 1000 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.

embedding strategy is in the scripts/embeddings.py.

detailed description will be provided later. Please stay tuned!