RosettaCommons/MIP
Microbiome Immunity Project: Protein Universe ~200,000 predicted structures for diverse protein sequences from 1,003 representative genomes across the microbial tree of life and annotate them functionally on a per-residue basis. Quickstart Usage Install HuggingFace Datasets package Each subset can be loaded into python using the Huggingface datasets library. First, from the command line install the datasets library $ pip install datasets Optionally… See the full description on the dataset page: https://huggingface.co/datasets/RosettaCommons/MIP.
11.3k
1 2 3 4# install huggingface_hub from the command line:5#6# pip install huggingface_hub7# pip install datasets8#9# Log into huggingface hub10# 11# huggingface-cli login12# 13# This will ask you for an access token14 15 16import datasets17 18##### rosetta_high_quality_models #######19dataset = datasets.load_dataset(20 "parquet",21 name = "rosetta_high_quality_models",22 data_dir = "./intermediate",23 data_files = {"train" : "rosetta_high_quality_models.parquet"},24 cache_dir = "/scratch/maom_root/maom0/maom",25 split = "train",26 keep_in_memory = True)27 28dataset.push_to_hub(29 repo_id = "RosettaCommons/MIP",30 config_name = "rosetta_high_quality_models",31 data_dir = "rosetta_high_quality_models/data")32 33 34 35##### rosetta_low_quality_models #######36dataset = datasets.load_dataset(37 "parquet",38 name = "rosetta_low_quality_models",39 data_dir = "./intermediate",40 data_files = {"train" : "rosetta_low_quality_models.parquet"},41 cache_dir = "/scratch/maom_root/maom0/maom",42 split = "train",43 keep_in_memory = True)44 45dataset.push_to_hub(46 repo_id = "RosettaCommons/MIP",47 config_name = "rosetta_low_quality_models",48 data_dir = "rosetta_low_quality_models/data")49 50 51##### dmpfold_high_quality_models #######52dataset = datasets.load_dataset(53 "parquet",54 name = "dmpfold_high_quality_models",55 data_dir = "./intermediate",56 data_files = {"train" : "dmpfold_high_quality_models.parquet"},57 cache_dir = "/scratch/maom_root/maom0/maom",58 split = "train",59 keep_in_memory = True)60 61dataset.push_to_hub(62 repo_id = "RosettaCommons/MIP",63 config_name = "dmpfold_high_quality_models",64 data_dir = "dmpfold_high_quality_models/data")65 66 67 68##### dmpfold_low_quality_models #######69dataset = datasets.load_dataset(70 "parquet",71 name = "dmpfold_low_quality_models",72 data_dir = "./intermediate",73 data_files = {"train" : "dmpfold_low_quality_models.parquet"},74 cache_dir = "/scratch/maom_root/maom0/maom",75 split = "train",76 keep_in_memory = True)77 78dataset.push_to_hub(79 repo_id = "RosettaCommons/MIP",80 config_name = "dmpfold_low_quality_models",81 data_dir = "dmpfold_low_quality_models/data")82 83##########################84## Function Predictions ##85##########################86 87#### rosetta_high_quality_function_predictions88dataset = datasets.load_dataset(89 "parquet",90 name = "rosetta_high_quality_function_predictions",91 data_dir = "./intermediate",92 data_files = {"train" : "rosetta_high_quality_function_predictions.parquet"},93 cache_dir = "/scratch/maom_root/maom0/maom",94 split = "train",95 keep_in_memory = True)96 97dataset.push_to_hub(98 repo_id = "RosettaCommons/MIP",99 config_name = "rosetta_high_quality_function_predictions",100 data_dir = "rosetta_high_quality_function_predictions/data")101 102#### rosetta_low_quality_function_predictions103dataset = datasets.load_dataset(104 "parquet",105 name = "rosetta_low_quality_function_predictions",106 data_dir = "./intermediate",107 data_files = {"train" : "rosetta_low_quality_function_predictions.parquet"},108 cache_dir = "/scratch/maom_root/maom0/maom",109 split = "train",110 keep_in_memory = True)111 112dataset.push_to_hub(113 repo_id = "RosettaCommons/MIP",114 config_name = "rosetta_low_quality_function_predictions",115 data_dir = "rosetta_low_quality_function_predictions/data")116 117 118 119 120#### dmpfold_high_quality_function_predictions121dataset = datasets.load_dataset(122 "parquet",123 name = "dmpfold_high_quality_function_predictions",124 data_dir = "./intermediate",125 data_files = {"train" : "dmpfold_high_quality_function_predictions.parquet"},126 cache_dir = "/scratch/maom_root/maom0/maom",127 split = "train",128 keep_in_memory = True)129 130dataset.push_to_hub(131 repo_id = "RosettaCommons/MIP",132 config_name = "dmpfold_high_quality_function_predictions",133 data_dir = "dmpfold_high_quality_function_predictions/data")134 135#### dmpfold_low_quality_function_predictions136dataset = datasets.load_dataset(137 "parquet",138 name = "dmpfold_low_quality_function_predictions",139 data_dir = "./intermediate",140 data_files = {"train" : "dmpfold_low_quality_function_predictions.parquet"},141 cache_dir = "/scratch/maom_root/maom0/maom",142 split = "train",143 keep_in_memory = True)144 145dataset.push_to_hub(146 repo_id = "RosettaCommons/MIP",147 config_name = "dmpfold_low_quality_function_predictions",148 data_dir = "dmpfold_low_quality_function_predictions/data")149 150 151 152 153 154 155 156 157 