CoolFace
Datasetpublic

RosettaCommons/MegaScale

Mega-scale experimental analysis of protein folding stability in biology and design The full MegaScale dataset contains 1,841,285 thermodynamic folding stability measurements using cDNA display proteolysis of natural and designed proteins. From these 776,298 high-quality folding stabilities (dataset2) cover all single amino acid variants and selected double mutants of 331 natural and 148 de novo designed protein domains 40–72 amino acids in length. Of these mutations, 607,839… See the full description on the dataset page: https://huggingface.co/datasets/RosettaCommons/MegaScale.

sourceHugging Facecc-by-4.0updated 2y agoView on Hugging Face
5likes455downloads
03.1_upload_data.py144 linesDownload Raw Back to src
1 2 3 4# install huggingface_hub from the command line:5#6#    pip install huggingface_hub7#    pip install datasets8#9# Log into huggingface hub (this only needs to be done once per project, and then it is cached)10#  11#    huggingface-cli login12# 13# This will ask you for an access token14 15 16import datasets17 18 19# dataset120# dataset221# dataset322# dataset3_single23# dataset3_single_cv24 25 26 27##### dataset1 #######28dataset = datasets.load_dataset(29    "parquet",30    name = "dataset1",31    data_dir = "./intermediate",32    data_files = {33        "train" : "dataset1.parquet"},34    cache_dir = "/scratch/maom_root/maom0/maom",35    keep_in_memory = True)36 37dataset.push_to_hub(38    repo_id = "maom/MegaScale",39    config_name = "dataset1",40    data_dir = "dataset1/data",41    commit_message = "Upload dataset1")42 43 44##### dataset2 #######45dataset = datasets.load_dataset(46    "parquet",47    name = "dataset2",48    data_dir = "./intermediate",49    data_files = {50        "train" : "dataset2.parquet"},51    cache_dir = "/scratch/maom_root/maom0/maom",52    keep_in_memory = True)53 54dataset.push_to_hub(55    repo_id = "maom/MegaScale",56    config_name = "dataset2",57    data_dir = "dataset2/data",58    commit_message = "Upload dataset2")59 60 61##### dataset3 #######62dataset = datasets.load_dataset(63    "parquet",64    name = "dataset3",65    data_dir = "./intermediate",66    data_files = {67        "train" : "dataset3.parquet"},68    cache_dir = "/scratch/maom_root/maom0/maom",69    keep_in_memory = True)70 71dataset.push_to_hub(72    repo_id = "maom/MegaScale",73    config_name = "dataset3",74    data_dir = "dataset3/data",75    commit_message = "Upload dataset3")76 77 78##### dataset3_single #######79dataset = datasets.load_dataset(80    "parquet",81    name = "dataset3_single",82    data_dir = "./intermediate",83    data_files = {84        "train" : "dataset3_single_train.parquet",85        "val" : "dataset3_single_val.parquet",86        "test" : "dataset3_single_test.parquet"},87    cache_dir = "/scratch/maom_root/maom0/maom",88    keep_in_memory = True)89 90dataset.push_to_hub(91    repo_id = "maom/MegaScale",92    config_name = "dataset3_single",93    data_dir = "dataset3_single/data",94    commit_message = "Upload dataset3_single")95 96 97##### dataset3_single_cv #######98dataset = datasets.load_dataset(99    "parquet",100    name = "dataset3_single_cv",101    data_dir = "./intermediate",102    data_files = {103        "train_0" : "dataset3_single_cv_train_0.parquet",104        "train_1" : "dataset3_single_cv_train_1.parquet",        105        "train_2" : "dataset3_single_cv_train_2.parquet",106        "train_3" : "dataset3_single_cv_train_3.parquet",107        "train_4" : "dataset3_single_cv_train_4.parquet",        108        "val_0" : "dataset3_single_cv_val_0.parquet",109        "val_1" : "dataset3_single_cv_val_1.parquet",        110        "val_2" : "dataset3_single_cv_val_2.parquet",111        "val_3" : "dataset3_single_cv_val_3.parquet",112        "val_4" : "dataset3_single_cv_val_4.parquet",        113        "test_0" : "dataset3_single_cv_test_0.parquet",114        "test_1" : "dataset3_single_cv_test_1.parquet",        115        "test_2" : "dataset3_single_cv_test_2.parquet",116        "test_3" : "dataset3_single_cv_test_3.parquet",117        "test_4" : "dataset3_single_cv_test_4.parquet"},118    cache_dir = "/scratch/maom_root/maom0/maom",119    keep_in_memory = True)120 121dataset.push_to_hub(122    repo_id = "maom/MegaScale",123    config_name = "dataset3_single_cv",124    data_dir = "datase3_single_cv/data",125    commit_message = "Upload dataset3_single_cv")126 127 128##### AlphaFold2_model_PDBs ####129dataset = datasets.load_dataset(130    "parquet",131    name = "AlphaFold_model_PDBs",132    data_dir = "./intermediate",133    data_files = {134        "train" : "AlphaFold_model_PDBs.parquet"},135    cache_dir = "/scratch/maom_root/maom0/maom",136    keep_in_memory = True)137 138dataset.push_to_hub(139    repo_id = "maom/MegaScale",140    config_name = "AlphaFold_model_PDBs",141    data_dir = "AlphaFold_model_PDBs/data",142    commit_message = "Upload AlphaFold_model_PDBs")143 144