enzoescipy/wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base
Wikipedia-Longest-Stride-Chunked-500-Embed-intfloat-multilingual-e5-base This is the embed processed version of Wikipedia-Longest-Stride-Chunked-500 HF Dataset. Computational Resources Used Computational Resources : Colab Pro+ H100 Instance Total Consumed Time : 24h Dataset processing train : 974720 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings. test, val : each 1000 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base… See the full description on the dataset page: https://huggingface.co/datasets/enzoescipy/wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base.
Wikipedia-Longest-Stride-Chunked-500-Embed-intfloat-multilingual-e5-base
This is the embed processed version of Wikipedia-Longest-Stride-Chunked-500 HF Dataset.
- Computational Resources
- Used Computational Resources : Colab Pro+ H100 Instance
- Total Consumed Time : 24h
- Dataset processing
- train : 974720 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.
- test, val : each 1000 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.
embedding strategy is in the scripts/embeddings.py.
detailed description will be provided later. Please stay tuned!
