RosettaCommons/MegaScale
Mega-scale experimental analysis of protein folding stability in biology and design The full MegaScale dataset contains 1,841,285 thermodynamic folding stability measurements using cDNA display proteolysis of natural and designed proteins. From these 776,298 high-quality folding stabilities (dataset2) cover all single amino acid variants and selected double mutants of 331 natural and 148 de novo designed protein domains 40–72 amino acids in length. Of these mutations, 607,839… See the full description on the dataset page: https://huggingface.co/datasets/RosettaCommons/MegaScale.
5455
1 2 3 4# install huggingface_hub from the command line:5#6# pip install huggingface_hub7# pip install datasets8#9# Log into huggingface hub (this only needs to be done once per project, and then it is cached)10# 11# huggingface-cli login12# 13# This will ask you for an access token14 15 16import datasets17 18 19# dataset120# dataset221# dataset322# dataset3_single23# dataset3_single_cv24 25 26 27##### dataset1 #######28dataset = datasets.load_dataset(29 "parquet",30 name = "dataset1",31 data_dir = "./intermediate",32 data_files = {33 "train" : "dataset1.parquet"},34 cache_dir = "/scratch/maom_root/maom0/maom",35 keep_in_memory = True)36 37dataset.push_to_hub(38 repo_id = "maom/MegaScale",39 config_name = "dataset1",40 data_dir = "dataset1/data",41 commit_message = "Upload dataset1")42 43 44##### dataset2 #######45dataset = datasets.load_dataset(46 "parquet",47 name = "dataset2",48 data_dir = "./intermediate",49 data_files = {50 "train" : "dataset2.parquet"},51 cache_dir = "/scratch/maom_root/maom0/maom",52 keep_in_memory = True)53 54dataset.push_to_hub(55 repo_id = "maom/MegaScale",56 config_name = "dataset2",57 data_dir = "dataset2/data",58 commit_message = "Upload dataset2")59 60 61##### dataset3 #######62dataset = datasets.load_dataset(63 "parquet",64 name = "dataset3",65 data_dir = "./intermediate",66 data_files = {67 "train" : "dataset3.parquet"},68 cache_dir = "/scratch/maom_root/maom0/maom",69 keep_in_memory = True)70 71dataset.push_to_hub(72 repo_id = "maom/MegaScale",73 config_name = "dataset3",74 data_dir = "dataset3/data",75 commit_message = "Upload dataset3")76 77 78##### dataset3_single #######79dataset = datasets.load_dataset(80 "parquet",81 name = "dataset3_single",82 data_dir = "./intermediate",83 data_files = {84 "train" : "dataset3_single_train.parquet",85 "val" : "dataset3_single_val.parquet",86 "test" : "dataset3_single_test.parquet"},87 cache_dir = "/scratch/maom_root/maom0/maom",88 keep_in_memory = True)89 90dataset.push_to_hub(91 repo_id = "maom/MegaScale",92 config_name = "dataset3_single",93 data_dir = "dataset3_single/data",94 commit_message = "Upload dataset3_single")95 96 97##### dataset3_single_cv #######98dataset = datasets.load_dataset(99 "parquet",100 name = "dataset3_single_cv",101 data_dir = "./intermediate",102 data_files = {103 "train_0" : "dataset3_single_cv_train_0.parquet",104 "train_1" : "dataset3_single_cv_train_1.parquet", 105 "train_2" : "dataset3_single_cv_train_2.parquet",106 "train_3" : "dataset3_single_cv_train_3.parquet",107 "train_4" : "dataset3_single_cv_train_4.parquet", 108 "val_0" : "dataset3_single_cv_val_0.parquet",109 "val_1" : "dataset3_single_cv_val_1.parquet", 110 "val_2" : "dataset3_single_cv_val_2.parquet",111 "val_3" : "dataset3_single_cv_val_3.parquet",112 "val_4" : "dataset3_single_cv_val_4.parquet", 113 "test_0" : "dataset3_single_cv_test_0.parquet",114 "test_1" : "dataset3_single_cv_test_1.parquet", 115 "test_2" : "dataset3_single_cv_test_2.parquet",116 "test_3" : "dataset3_single_cv_test_3.parquet",117 "test_4" : "dataset3_single_cv_test_4.parquet"},118 cache_dir = "/scratch/maom_root/maom0/maom",119 keep_in_memory = True)120 121dataset.push_to_hub(122 repo_id = "maom/MegaScale",123 config_name = "dataset3_single_cv",124 data_dir = "datase3_single_cv/data",125 commit_message = "Upload dataset3_single_cv")126 127 128##### AlphaFold2_model_PDBs ####129dataset = datasets.load_dataset(130 "parquet",131 name = "AlphaFold_model_PDBs",132 data_dir = "./intermediate",133 data_files = {134 "train" : "AlphaFold_model_PDBs.parquet"},135 cache_dir = "/scratch/maom_root/maom0/maom",136 keep_in_memory = True)137 138dataset.push_to_hub(139 repo_id = "maom/MegaScale",140 config_name = "AlphaFold_model_PDBs",141 data_dir = "AlphaFold_model_PDBs/data",142 commit_message = "Upload AlphaFold_model_PDBs")143 144 