datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
wikipedia-embeddings-cs-e5-baseThis dataset contains the Czech subset of the wikimedia/wikipedia dataset. Each page is divided into paragraphs, stored as a list in the chunks column. For every paragraph, embeddings are created using the intfloat/multilingual-e5-base model.
Usage
Load the dataset:
from datasets import load_dataset
ds = load_dataset("karmiq/wikipedia-embeddings-cs-e5-base", split="train")
ds[1]
{
'id': '1',
'url': 'https://cs.wikipedia.org/wiki/Astronomie',
'title': 'Astronomie'… See the full description on the dataset page: https://huggingface.co/datasets/karmiq/wikipedia-embeddings-cs-e5-base.wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base
Wikipedia-Longest-Stride-Chunked-500-Embed-intfloat-multilingual-e5-base
This is the embed processed version of Wikipedia-Longest-Stride-Chunked-500 HF Dataset.
Computational Resources
Used Computational Resources : Colab Pro+ H100 Instance
Total Consumed Time : 24h
Dataset processing
train : 974720 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.
test, val : each 1000 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.… See the full description on the dataset page: https://huggingface.co/datasets/enzoescipy/wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base.wikipedia-longest-salami-chunked-500-embed-intfloat-multilingual-e5-basepython-py_base1_sft_20k_e5-emptymassive_serve_dpr_wiki_e5_base_v2_ivfpqretrieved_results_cosqa_qe_baseline_dres_intfloat_e5-base-v2retrieved_results_cosqa_upd_deepseek1_dres_intfloat_e5-base-v2retrieved_results_cosqa_deepseek1_dres_intfloat_e5-base-v2retrieved_results_cosqa_baseline_dres_intfloat_e5-base-v2retrieved_results_cosqa_granite1_dres_intfloat_e5-base-v2retrieved_results_cosqa_upd_baseline_dres_intfloat_e5-base-v2
