CoolFace
Datasetpublic

alejoacelas/uniref50-2025-10

UniRef50 Dataset for Protein Language Model Training This dataset is derived from UniRef50 (Release 2025 October) and prepared for protein language model pre-training. Dataset Statistics Original UniRef50 sequences: 58,875,981 Synthetic constructs removed: 439 Validation set size: 294,377 (0.5%) Initial train set size: 58,581,165 Sequences removed by similarity filter (≥50% identity): 457,727 Final train set size: 58,123,438 Total sequences in dataset: 58,417,815… See the full description on the dataset page: https://huggingface.co/datasets/alejoacelas/uniref50-2025-10.

sourceHugging Facemitupdated 11mo agoView on Hugging Face
0likes65downloads
Dataset Card

UniRef50 Dataset for Protein Language Model Training

This dataset is derived from UniRef50 (Release 2025 October) and prepared for protein language model pre-training.

Dataset Statistics

  • —Original UniRef50 sequences: 58,875,981
  • —Synthetic constructs removed: 439
  • —Validation set size: 294,377 (0.5%)
  • —Initial train set size: 58,581,165
  • —Sequences removed by similarity filter (≥50% identity): 457,727
  • —Final train set size: 58,123,438
  • —Total sequences in dataset: 58,417,815

Processing Details

  • —Processing date: 2025-11-03
  • —MMseqs2 version: 13-45111+ds-2
  • —Similarity threshold: 50% sequence identity
  • —Coverage threshold: 80%
  • —Alignment mode: 3
  • —Sensitivity: 7

Data Fields

  • —sequence: Amino acid sequence (string)
  • —sequence_id: UniRef50 cluster ID (string)
  • —description: Full description including taxonomy info (string)
  • —length: Sequence length in amino acids (integer)

Intended Use

This dataset is intended for pre-training protein language models, following similar procedures as used for ESM models.