alejoacelas/uniref50-2025-10
UniRef50 Dataset for Protein Language Model Training This dataset is derived from UniRef50 (Release 2025 October) and prepared for protein language model pre-training. Dataset Statistics Original UniRef50 sequences: 58,875,981 Synthetic constructs removed: 439 Validation set size: 294,377 (0.5%) Initial train set size: 58,581,165 Sequences removed by similarity filter (≥50% identity): 457,727 Final train set size: 58,123,438 Total sequences in dataset: 58,417,815… See the full description on the dataset page: https://huggingface.co/datasets/alejoacelas/uniref50-2025-10.
UniRef50 Dataset for Protein Language Model Training
This dataset is derived from UniRef50 (Release 2025 October) and prepared for protein language model pre-training.
Dataset Statistics
- Original UniRef50 sequences: 58,875,981
- Synthetic constructs removed: 439
- Validation set size: 294,377 (0.5%)
- Initial train set size: 58,581,165
- Sequences removed by similarity filter (≥50% identity): 457,727
- Final train set size: 58,123,438
- Total sequences in dataset: 58,417,815
Processing Details
- Processing date: 2025-11-03
- MMseqs2 version: 13-45111+ds-2
- Similarity threshold: 50% sequence identity
- Coverage threshold: 80%
- Alignment mode: 3
- Sensitivity: 7
Data Fields
sequence: Amino acid sequence (string)sequence_id: UniRef50 cluster ID (string)description: Full description including taxonomy info (string)length: Sequence length in amino acids (integer)
Intended Use
This dataset is intended for pre-training protein language models, following similar procedures as used for ESM models.
