CoolFace
Datasetpublic

maknee/bioasq_bier_4096_1m

BioASQ-BEIR Vector Database Dataset (4096d, 1M) Generated embeddings dataset for vector database training and evaluation. Dataset Summary This dataset contains 1,000,000 text samples with vector embeddings (4096 dimensions) generated from the BioASQ-BEIR dataset using Qwen/Qwen3-Embedding-8B. Dataset Structure Base dataset: 1,000,000 samples with embeddings Embedding dimension: 4096 Repository Structure parquet/… See the full description on the dataset page: https://huggingface.co/datasets/maknee/bioasq_bier_4096_1m.

sourceHugging Facemitupdated 6mo agoView on Hugging Face
0likes897downloads
Dataset Card

BioASQ-BEIR Vector Database Dataset (4096d, 1M)

Generated embeddings dataset for vector database training and evaluation.

Dataset Summary

This dataset contains 1,000,000 text samples with vector embeddings (4096 dimensions) generated from the BioASQ-BEIR dataset using Qwen/Qwen3-Embedding-8B.

Dataset Structure

  • —Base dataset: 1,000,000 samples with embeddings
  • —Embedding dimension: 4096

Repository Structure

parquet/

  • —base.parquet - Main dataset with text and embeddings

Usage

python
from datasets import load_dataset

dataset = load_dataset("maknee/bioasq_bier_4096_1m")
base_data = dataset["train"]

import numpy as np
embeddings = np.array(base_data["embedding"])
texts = base_data["text"]

Dataset Information

  • —Source: BioASQ-BEIR
  • —Size: 1,000,000 samples
  • —Dimension: 4096
  • —Format: Parquet

Citation

bibtex
@dataset{huggingface_embeddings_maknee_bioasq_bier_4096_1m,
  title={BioASQ-BEIR Vector Database Embeddings Dataset},
  author={Henry Zhu},
  year={2026},
  url={https://huggingface.co/datasets/maknee/bioasq_bier_4096_1m}
}

License

MIT License.