CoolFace
Modelpublic

Hartunka/tiny_bert_rand_5_v2_sst2

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes20downloads
trainer_state.json149 linesDownload Raw Back to root
1{2  "best_global_step": 264,3  "best_metric": 0.44867685437202454,4  "best_model_checkpoint": "tiny_bert_rand_5_v2_sst2/checkpoint-264",5  "epoch": 6.0,6  "eval_steps": 500,7  "global_step": 1584,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 1.0,14      "grad_norm": 9.064800262451172,15      "learning_rate": 4.9e-05,16      "loss": 0.427,17      "step": 26418    },19    {20      "epoch": 1.0,21      "eval_accuracy": 0.8165137614678899,22      "eval_loss": 0.44867685437202454,23      "eval_runtime": 0.2808,24      "eval_samples_per_second": 3105.024,25      "eval_steps_per_second": 14.243,26      "step": 26427    },28    {29      "epoch": 2.0,30      "grad_norm": 7.39294958114624,31      "learning_rate": 4.8e-05,32      "loss": 0.2402,33      "step": 52834    },35    {36      "epoch": 2.0,37      "eval_accuracy": 0.7947247706422018,38      "eval_loss": 0.5559569001197815,39      "eval_runtime": 0.2662,40      "eval_samples_per_second": 3275.758,41      "eval_steps_per_second": 15.026,42      "step": 52843    },44    {45      "epoch": 3.0,46      "grad_norm": 5.649034023284912,47      "learning_rate": 4.7e-05,48      "loss": 0.1856,49      "step": 79250    },51    {52      "epoch": 3.0,53      "eval_accuracy": 0.805045871559633,54      "eval_loss": 0.5291202664375305,55      "eval_runtime": 0.2725,56      "eval_samples_per_second": 3199.63,57      "eval_steps_per_second": 14.677,58      "step": 79259    },60    {61      "epoch": 4.0,62      "grad_norm": 11.652801513671875,63      "learning_rate": 4.600000000000001e-05,64      "loss": 0.155,65      "step": 105666    },67    {68      "epoch": 4.0,69      "eval_accuracy": 0.7958715596330275,70      "eval_loss": 0.5920218825340271,71      "eval_runtime": 0.2711,72      "eval_samples_per_second": 3217.0,73      "eval_steps_per_second": 14.757,74      "step": 105675    },76    {77      "epoch": 5.0,78      "grad_norm": 9.776528358459473,79      "learning_rate": 4.5e-05,80      "loss": 0.1259,81      "step": 132082    },83    {84      "epoch": 5.0,85      "eval_accuracy": 0.7935779816513762,86      "eval_loss": 0.637986958026886,87      "eval_runtime": 0.2896,88      "eval_samples_per_second": 3010.989,89      "eval_steps_per_second": 13.812,90      "step": 132091    },92    {93      "epoch": 6.0,94      "grad_norm": 6.283332824707031,95      "learning_rate": 4.4000000000000006e-05,96      "loss": 0.1068,97      "step": 158498    },99    {100      "epoch": 6.0,101      "eval_accuracy": 0.801605504587156,102      "eval_loss": 0.7637522220611572,103      "eval_runtime": 0.275,104      "eval_samples_per_second": 3170.916,105      "eval_steps_per_second": 14.545,106      "step": 1584107    },108    {109      "epoch": 6.0,110      "step": 1584,111      "total_flos": 1.0596790573590528e+16,112      "train_loss": 0.20675967678879248,113      "train_runtime": 217.3543,114      "train_samples_per_second": 15492.91,115      "train_steps_per_second": 60.73116    }117  ],118  "logging_steps": 1,119  "max_steps": 13200,120  "num_input_tokens_seen": 0,121  "num_train_epochs": 50,122  "save_steps": 500,123  "stateful_callbacks": {124    "EarlyStoppingCallback": {125      "args": {126        "early_stopping_patience": 5,127        "early_stopping_threshold": 0.0128      },129      "attributes": {130        "early_stopping_patience_counter": 5131      }132    },133    "TrainerControl": {134      "args": {135        "should_epoch_stop": false,136        "should_evaluate": false,137        "should_log": false,138        "should_save": true,139        "should_training_stop": true140      },141      "attributes": {}142    }143  },144  "total_flos": 1.0596790573590528e+16,145  "train_batch_size": 256,146  "trial_name": null,147  "trial_params": null148}149