CognitiveLab/Fireship-clone-hf
015
1{2 "best_metric": 1.8443655967712402,3 "best_model_checkpoint": "./out/checkpoint-16",4 "epoch": 0.9846153846153847,5 "eval_steps": 4,6 "global_step": 16,7 "is_hyper_param_search": false,8 "is_local_process_zero": true,9 "is_world_process_zero": true,10 "log_history": [11 {12 "epoch": 0.06,13 "learning_rate": 2.0000000000000003e-06,14 "loss": 2.1256,15 "step": 116 },17 {18 "epoch": 0.06,19 "eval_loss": 2.164146661758423,20 "eval_runtime": 4.1785,21 "eval_samples_per_second": 6.701,22 "eval_steps_per_second": 1.675,23 "step": 124 },25 {26 "epoch": 0.12,27 "learning_rate": 4.000000000000001e-06,28 "loss": 2.1478,29 "step": 230 },31 {32 "epoch": 0.18,33 "learning_rate": 6e-06,34 "loss": 2.1527,35 "step": 336 },37 {38 "epoch": 0.25,39 "learning_rate": 8.000000000000001e-06,40 "loss": 2.1049,41 "step": 442 },43 {44 "epoch": 0.25,45 "eval_loss": 2.125430107116699,46 "eval_runtime": 4.2671,47 "eval_samples_per_second": 6.562,48 "eval_steps_per_second": 1.64,49 "step": 450 },51 {52 "epoch": 0.31,53 "learning_rate": 1e-05,54 "loss": 2.0978,55 "step": 556 },57 {58 "epoch": 0.37,59 "learning_rate": 1.2e-05,60 "loss": 2.0632,61 "step": 662 },63 {64 "epoch": 0.43,65 "learning_rate": 1.4000000000000001e-05,66 "loss": 2.0281,67 "step": 768 },69 {70 "epoch": 0.49,71 "learning_rate": 1.6000000000000003e-05,72 "loss": 1.9826,73 "step": 874 },75 {76 "epoch": 0.49,77 "eval_loss": 1.9868038892745972,78 "eval_runtime": 4.2896,79 "eval_samples_per_second": 6.527,80 "eval_steps_per_second": 1.632,81 "step": 882 },83 {84 "epoch": 0.55,85 "learning_rate": 1.8e-05,86 "loss": 1.964,87 "step": 988 },89 {90 "epoch": 0.62,91 "learning_rate": 2e-05,92 "loss": 1.9839,93 "step": 1094 },95 {96 "epoch": 0.68,97 "learning_rate": 2.2000000000000003e-05,98 "loss": 1.9244,99 "step": 11100 },101 {102 "epoch": 0.74,103 "learning_rate": 2.4e-05,104 "loss": 1.8545,105 "step": 12106 },107 {108 "epoch": 0.74,109 "eval_loss": 1.877912163734436,110 "eval_runtime": 4.2905,111 "eval_samples_per_second": 6.526,112 "eval_steps_per_second": 1.632,113 "step": 12114 },115 {116 "epoch": 0.8,117 "learning_rate": 2.6000000000000002e-05,118 "loss": 1.894,119 "step": 13120 },121 {122 "epoch": 0.86,123 "learning_rate": 2.8000000000000003e-05,124 "loss": 1.8909,125 "step": 14126 },127 {128 "epoch": 0.92,129 "learning_rate": 3e-05,130 "loss": 1.8444,131 "step": 15132 },133 {134 "epoch": 0.98,135 "learning_rate": 3.2000000000000005e-05,136 "loss": 1.8597,137 "step": 16138 },139 {140 "epoch": 0.98,141 "eval_loss": 1.8443655967712402,142 "eval_runtime": 4.2861,143 "eval_samples_per_second": 6.533,144 "eval_steps_per_second": 1.633,145 "step": 16146 }147 ],148 "logging_steps": 1,149 "max_steps": 16,150 "num_input_tokens_seen": 0,151 "num_train_epochs": 1,152 "save_steps": 8,153 "total_flos": 4.15698116369449e+16,154 "train_batch_size": 4,155 "trial_name": null,156 "trial_params": null157}158 