CoolFace
Datasetpublic

RosettaCommons/MIP

Microbiome Immunity Project: Protein Universe ~200,000 predicted structures for diverse protein sequences from 1,003 representative genomes across the microbial tree of life and annotate them functionally on a per-residue basis. Quickstart Usage Install HuggingFace Datasets package Each subset can be loaded into python using the Huggingface datasets library. First, from the command line install the datasets library $ pip install datasets Optionally… See the full description on the dataset page: https://huggingface.co/datasets/RosettaCommons/MIP.

sourceHugging Facecc-by-4.0updated 2y agoView on Hugging Face
1likes1.3kdownloads
03.1_uplaod_data.py157 linesDownload Raw Back to src
1 2 3 4# install huggingface_hub from the command line:5#6#    pip install huggingface_hub7#    pip install datasets8#9# Log into huggingface hub10#  11#    huggingface-cli login12# 13# This will ask you for an access token14 15 16import datasets17 18##### rosetta_high_quality_models #######19dataset = datasets.load_dataset(20    "parquet",21    name = "rosetta_high_quality_models",22    data_dir = "./intermediate",23    data_files = {"train" : "rosetta_high_quality_models.parquet"},24    cache_dir = "/scratch/maom_root/maom0/maom",25    split = "train",26    keep_in_memory = True)27 28dataset.push_to_hub(29    repo_id = "RosettaCommons/MIP",30    config_name = "rosetta_high_quality_models",31    data_dir = "rosetta_high_quality_models/data")32 33 34 35##### rosetta_low_quality_models #######36dataset = datasets.load_dataset(37    "parquet",38    name = "rosetta_low_quality_models",39    data_dir = "./intermediate",40    data_files = {"train" : "rosetta_low_quality_models.parquet"},41    cache_dir = "/scratch/maom_root/maom0/maom",42    split = "train",43    keep_in_memory = True)44 45dataset.push_to_hub(46    repo_id = "RosettaCommons/MIP",47    config_name = "rosetta_low_quality_models",48    data_dir = "rosetta_low_quality_models/data")49 50 51##### dmpfold_high_quality_models #######52dataset = datasets.load_dataset(53    "parquet",54    name = "dmpfold_high_quality_models",55    data_dir = "./intermediate",56    data_files = {"train" : "dmpfold_high_quality_models.parquet"},57    cache_dir = "/scratch/maom_root/maom0/maom",58    split = "train",59    keep_in_memory = True)60 61dataset.push_to_hub(62    repo_id = "RosettaCommons/MIP",63    config_name = "dmpfold_high_quality_models",64    data_dir = "dmpfold_high_quality_models/data")65 66 67 68##### dmpfold_low_quality_models #######69dataset = datasets.load_dataset(70    "parquet",71    name = "dmpfold_low_quality_models",72    data_dir = "./intermediate",73    data_files = {"train" : "dmpfold_low_quality_models.parquet"},74    cache_dir = "/scratch/maom_root/maom0/maom",75    split = "train",76    keep_in_memory = True)77 78dataset.push_to_hub(79    repo_id = "RosettaCommons/MIP",80    config_name = "dmpfold_low_quality_models",81    data_dir = "dmpfold_low_quality_models/data")82 83##########################84## Function Predictions ##85##########################86 87#### rosetta_high_quality_function_predictions88dataset = datasets.load_dataset(89    "parquet",90    name = "rosetta_high_quality_function_predictions",91    data_dir = "./intermediate",92    data_files = {"train" : "rosetta_high_quality_function_predictions.parquet"},93    cache_dir = "/scratch/maom_root/maom0/maom",94    split = "train",95    keep_in_memory = True)96 97dataset.push_to_hub(98    repo_id = "RosettaCommons/MIP",99    config_name = "rosetta_high_quality_function_predictions",100    data_dir = "rosetta_high_quality_function_predictions/data")101 102#### rosetta_low_quality_function_predictions103dataset = datasets.load_dataset(104    "parquet",105    name = "rosetta_low_quality_function_predictions",106    data_dir = "./intermediate",107    data_files = {"train" : "rosetta_low_quality_function_predictions.parquet"},108    cache_dir = "/scratch/maom_root/maom0/maom",109    split = "train",110    keep_in_memory = True)111 112dataset.push_to_hub(113    repo_id = "RosettaCommons/MIP",114    config_name = "rosetta_low_quality_function_predictions",115    data_dir = "rosetta_low_quality_function_predictions/data")116 117 118 119 120#### dmpfold_high_quality_function_predictions121dataset = datasets.load_dataset(122    "parquet",123    name = "dmpfold_high_quality_function_predictions",124    data_dir = "./intermediate",125    data_files = {"train" : "dmpfold_high_quality_function_predictions.parquet"},126    cache_dir = "/scratch/maom_root/maom0/maom",127    split = "train",128    keep_in_memory = True)129 130dataset.push_to_hub(131    repo_id = "RosettaCommons/MIP",132    config_name = "dmpfold_high_quality_function_predictions",133    data_dir = "dmpfold_high_quality_function_predictions/data")134 135#### dmpfold_low_quality_function_predictions136dataset = datasets.load_dataset(137    "parquet",138    name = "dmpfold_low_quality_function_predictions",139    data_dir = "./intermediate",140    data_files = {"train" : "dmpfold_low_quality_function_predictions.parquet"},141    cache_dir = "/scratch/maom_root/maom0/maom",142    split = "train",143    keep_in_memory = True)144 145dataset.push_to_hub(146    repo_id = "RosettaCommons/MIP",147    config_name = "dmpfold_low_quality_function_predictions",148    data_dir = "dmpfold_low_quality_function_predictions/data")149 150 151 152 153 154 155 156 157