CoolFace
Datasetpublic

just-dna-seq/ensembl_variations

Ensembl Variations (Parquet Format) This dataset contains Ensembl human genetic variations converted to Parquet format for fast and efficient VCF annotation. Usage With Polars (Recommended) import polars as pl # Load variants for chromosome 21 df = pl.scan_parquet("hf://datasets/just-dna-seq/ensembl_variations/data/homo_sapiens-chr21.parquet") # Filter variants by position variants = df.filter( (pl.col("POS") >= 10000000) & (pl.col("POS") <=… See the full description on the dataset page: https://huggingface.co/datasets/just-dna-seq/ensembl_variations.

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
3likes290downloads
Dataset Card

Ensembl Variations (Parquet Format)

This dataset contains Ensembl human genetic variations converted to Parquet format for fast and efficient VCF annotation.

Dataset Description

  • Purpose: Fast annotation of VCF files with Ensembl variation data
  • Format: Apache Parquet (columnar storage)
  • Source: Ensembl Variation Database
  • Updated: 2026-01-15
  • Total Files: 25
  • Total Size: ~13.7 GB

Usage

With Polars (Recommended)

python
import polars as pl

# Load variants for chromosome 21
df = pl.scan_parquet("hf://datasets/just-dna-seq/ensembl_variations/data/homo_sapiens-chr21.parquet")

# Filter variants by position
variants = df.filter(
    (pl.col("POS") >= 10000000) & (pl.col("POS") <= 20000000)
).collect()

print(variants)

License

This dataset is released under Apache 2.0 license. The original Ensembl data is available under their terms of use.

Maintenance

This dataset is maintained by the GenoBear project.