CoolFace
Modelpublic

CognitiveLab/Fireship-clone

sourceHugging Faceupdated 3y agoView on Hugging Face
0likes15downloads
trainer_state.json94 linesDownload Raw Back to checkpoint-8
1{2  "best_metric": 1.9868038892745972,3  "best_model_checkpoint": "./out/checkpoint-8",4  "epoch": 0.49230769230769234,5  "eval_steps": 4,6  "global_step": 8,7  "is_hyper_param_search": false,8  "is_local_process_zero": true,9  "is_world_process_zero": true,10  "log_history": [11    {12      "epoch": 0.06,13      "learning_rate": 2.0000000000000003e-06,14      "loss": 2.1256,15      "step": 116    },17    {18      "epoch": 0.06,19      "eval_loss": 2.164146661758423,20      "eval_runtime": 4.1785,21      "eval_samples_per_second": 6.701,22      "eval_steps_per_second": 1.675,23      "step": 124    },25    {26      "epoch": 0.12,27      "learning_rate": 4.000000000000001e-06,28      "loss": 2.1478,29      "step": 230    },31    {32      "epoch": 0.18,33      "learning_rate": 6e-06,34      "loss": 2.1527,35      "step": 336    },37    {38      "epoch": 0.25,39      "learning_rate": 8.000000000000001e-06,40      "loss": 2.1049,41      "step": 442    },43    {44      "epoch": 0.25,45      "eval_loss": 2.125430107116699,46      "eval_runtime": 4.2671,47      "eval_samples_per_second": 6.562,48      "eval_steps_per_second": 1.64,49      "step": 450    },51    {52      "epoch": 0.31,53      "learning_rate": 1e-05,54      "loss": 2.0978,55      "step": 556    },57    {58      "epoch": 0.37,59      "learning_rate": 1.2e-05,60      "loss": 2.0632,61      "step": 662    },63    {64      "epoch": 0.43,65      "learning_rate": 1.4000000000000001e-05,66      "loss": 2.0281,67      "step": 768    },69    {70      "epoch": 0.49,71      "learning_rate": 1.6000000000000003e-05,72      "loss": 1.9826,73      "step": 874    },75    {76      "epoch": 0.49,77      "eval_loss": 1.9868038892745972,78      "eval_runtime": 4.2896,79      "eval_samples_per_second": 6.527,80      "eval_steps_per_second": 1.632,81      "step": 882    }83  ],84  "logging_steps": 1,85  "max_steps": 16,86  "num_input_tokens_seen": 0,87  "num_train_epochs": 1,88  "save_steps": 8,89  "total_flos": 2.078490581847245e+16,90  "train_batch_size": 4,91  "trial_name": null,92  "trial_params": null93}94