uniref
Datasets
All datasets matching “uniref”uniref50-test
Dataset Card for UniRef50
Dataset Summary
[More Information Needed]
Supported Tasks and Leaderboards
[More Information Needed]
Languages
[More Information Needed]
Dataset Structure
Data Instances
[More Information Needed]
Data Fields
[More Information Needed]
Data Splits
[More Information Needed]
Dataset Creation
Curation Rationale
[More Information Needed]
Source Data… See the full description on the dataset page: https://huggingface.co/datasets/zgcarvalho/uniref50-test.uniref50esm2_uniref_pretraining_data
ESM-2 Uniref Pretraining Data
Dataset Description:
UniRef, or UniProt Reference Clusters, are databases of clustered protein sequences from the UniProt Knowledgebase (UniProtKB) that group similar sequences to reduce redundancy and make data easier to work with for biological research. It offers different levels of clustering (UniRef100, UniRef90, and UniRef50) based on sequence identity, with each cluster containing a representative sequence, a count of member proteins… See the full description on the dataset page: https://huggingface.co/datasets/nvidia/esm2_uniref_pretraining_data.uniref90
UniRef90
Complete UniRef90 dataset from UniProt, converted from XML to sharded Parquet. UniRef90 clusters sequences at 90% identity, providing a non-redundant protein sequence resource that balances comprehensiveness with reduced redundancy.
Part of the ConvergeBio Protein Database Collection — see also UniRef100, UniRef50, and UniClust30.
Dataset Summary
Clusters
188,848,220
Shards
386
Compressed size
~52 GB (zstd)
Sequence lengths
11 – 49,499 aa… See the full description on the dataset page: https://huggingface.co/datasets/ConvergeBio/uniref90.uniref-50-foldseek-v1uniref50
