maknee/bioasq_bier_4096_1m
BioASQ-BEIR Vector Database Dataset (4096d, 1M) Generated embeddings dataset for vector database training and evaluation. Dataset Summary This dataset contains 1,000,000 text samples with vector embeddings (4096 dimensions) generated from the BioASQ-BEIR dataset using Qwen/Qwen3-Embedding-8B. Dataset Structure Base dataset: 1,000,000 samples with embeddings Embedding dimension: 4096 Repository Structure parquet/… See the full description on the dataset page: https://huggingface.co/datasets/maknee/bioasq_bier_4096_1m.
BioASQ-BEIR Vector Database Dataset (4096d, 1M)
Generated embeddings dataset for vector database training and evaluation.
Dataset Summary
This dataset contains 1,000,000 text samples with vector embeddings (4096 dimensions) generated from the BioASQ-BEIR dataset using Qwen/Qwen3-Embedding-8B.
Dataset Structure
- Base dataset: 1,000,000 samples with embeddings
- Embedding dimension: 4096
Repository Structure
parquet/
base.parquet- Main dataset with text and embeddings
Usage
from datasets import load_dataset
dataset = load_dataset("maknee/bioasq_bier_4096_1m")
base_data = dataset["train"]
import numpy as np
embeddings = np.array(base_data["embedding"])
texts = base_data["text"]Dataset Information
- Source: BioASQ-BEIR
- Size: 1,000,000 samples
- Dimension: 4096
- Format: Parquet
Citation
@dataset{huggingface_embeddings_maknee_bioasq_bier_4096_1m,
title={BioASQ-BEIR Vector Database Embeddings Dataset},
author={Henry Zhu},
year={2026},
url={https://huggingface.co/datasets/maknee/bioasq_bier_4096_1m}
}License
MIT License.
