CoolFace
Modelpublic

CognitiveLab/Fireship-clone-hf

sourceHugging Faceupdated 3y agoView on Hugging Face
0likes15downloads
trainer_state.json158 linesDownload Raw Back to checkpoint-16
1{2  "best_metric": 1.8443655967712402,3  "best_model_checkpoint": "./out/checkpoint-16",4  "epoch": 0.9846153846153847,5  "eval_steps": 4,6  "global_step": 16,7  "is_hyper_param_search": false,8  "is_local_process_zero": true,9  "is_world_process_zero": true,10  "log_history": [11    {12      "epoch": 0.06,13      "learning_rate": 2.0000000000000003e-06,14      "loss": 2.1256,15      "step": 116    },17    {18      "epoch": 0.06,19      "eval_loss": 2.164146661758423,20      "eval_runtime": 4.1785,21      "eval_samples_per_second": 6.701,22      "eval_steps_per_second": 1.675,23      "step": 124    },25    {26      "epoch": 0.12,27      "learning_rate": 4.000000000000001e-06,28      "loss": 2.1478,29      "step": 230    },31    {32      "epoch": 0.18,33      "learning_rate": 6e-06,34      "loss": 2.1527,35      "step": 336    },37    {38      "epoch": 0.25,39      "learning_rate": 8.000000000000001e-06,40      "loss": 2.1049,41      "step": 442    },43    {44      "epoch": 0.25,45      "eval_loss": 2.125430107116699,46      "eval_runtime": 4.2671,47      "eval_samples_per_second": 6.562,48      "eval_steps_per_second": 1.64,49      "step": 450    },51    {52      "epoch": 0.31,53      "learning_rate": 1e-05,54      "loss": 2.0978,55      "step": 556    },57    {58      "epoch": 0.37,59      "learning_rate": 1.2e-05,60      "loss": 2.0632,61      "step": 662    },63    {64      "epoch": 0.43,65      "learning_rate": 1.4000000000000001e-05,66      "loss": 2.0281,67      "step": 768    },69    {70      "epoch": 0.49,71      "learning_rate": 1.6000000000000003e-05,72      "loss": 1.9826,73      "step": 874    },75    {76      "epoch": 0.49,77      "eval_loss": 1.9868038892745972,78      "eval_runtime": 4.2896,79      "eval_samples_per_second": 6.527,80      "eval_steps_per_second": 1.632,81      "step": 882    },83    {84      "epoch": 0.55,85      "learning_rate": 1.8e-05,86      "loss": 1.964,87      "step": 988    },89    {90      "epoch": 0.62,91      "learning_rate": 2e-05,92      "loss": 1.9839,93      "step": 1094    },95    {96      "epoch": 0.68,97      "learning_rate": 2.2000000000000003e-05,98      "loss": 1.9244,99      "step": 11100    },101    {102      "epoch": 0.74,103      "learning_rate": 2.4e-05,104      "loss": 1.8545,105      "step": 12106    },107    {108      "epoch": 0.74,109      "eval_loss": 1.877912163734436,110      "eval_runtime": 4.2905,111      "eval_samples_per_second": 6.526,112      "eval_steps_per_second": 1.632,113      "step": 12114    },115    {116      "epoch": 0.8,117      "learning_rate": 2.6000000000000002e-05,118      "loss": 1.894,119      "step": 13120    },121    {122      "epoch": 0.86,123      "learning_rate": 2.8000000000000003e-05,124      "loss": 1.8909,125      "step": 14126    },127    {128      "epoch": 0.92,129      "learning_rate": 3e-05,130      "loss": 1.8444,131      "step": 15132    },133    {134      "epoch": 0.98,135      "learning_rate": 3.2000000000000005e-05,136      "loss": 1.8597,137      "step": 16138    },139    {140      "epoch": 0.98,141      "eval_loss": 1.8443655967712402,142      "eval_runtime": 4.2861,143      "eval_samples_per_second": 6.533,144      "eval_steps_per_second": 1.633,145      "step": 16146    }147  ],148  "logging_steps": 1,149  "max_steps": 16,150  "num_input_tokens_seen": 0,151  "num_train_epochs": 1,152  "save_steps": 8,153  "total_flos": 4.15698116369449e+16,154  "train_batch_size": 4,155  "trial_name": null,156  "trial_params": null157}158