CoolFace
Datasetpublic

alejoacelas/uniref50-2025-10

UniRef50 Dataset for Protein Language Model Training This dataset is derived from UniRef50 (Release 2025 October) and prepared for protein language model pre-training. Dataset Statistics Original UniRef50 sequences: 58,875,981 Synthetic constructs removed: 439 Validation set size: 294,377 (0.5%) Initial train set size: 58,581,165 Sequences removed by similarity filter (≥50% identity): 457,727 Final train set size: 58,123,438 Total sequences in dataset: 58,417,815… See the full description on the dataset page: https://huggingface.co/datasets/alejoacelas/uniref50-2025-10.

sourceHugging Facemitupdated 11mo agoView on Hugging Face
0likes65downloads

alejoacelas/uniref50-2025-10 · main · files are served by the source, never re-hosted here