CognitiveLab/Fireship-clone
015
1{2 "best_metric": 1.9868038892745972,3 "best_model_checkpoint": "./out/checkpoint-8",4 "epoch": 0.49230769230769234,5 "eval_steps": 4,6 "global_step": 8,7 "is_hyper_param_search": false,8 "is_local_process_zero": true,9 "is_world_process_zero": true,10 "log_history": [11 {12 "epoch": 0.06,13 "learning_rate": 2.0000000000000003e-06,14 "loss": 2.1256,15 "step": 116 },17 {18 "epoch": 0.06,19 "eval_loss": 2.164146661758423,20 "eval_runtime": 4.1785,21 "eval_samples_per_second": 6.701,22 "eval_steps_per_second": 1.675,23 "step": 124 },25 {26 "epoch": 0.12,27 "learning_rate": 4.000000000000001e-06,28 "loss": 2.1478,29 "step": 230 },31 {32 "epoch": 0.18,33 "learning_rate": 6e-06,34 "loss": 2.1527,35 "step": 336 },37 {38 "epoch": 0.25,39 "learning_rate": 8.000000000000001e-06,40 "loss": 2.1049,41 "step": 442 },43 {44 "epoch": 0.25,45 "eval_loss": 2.125430107116699,46 "eval_runtime": 4.2671,47 "eval_samples_per_second": 6.562,48 "eval_steps_per_second": 1.64,49 "step": 450 },51 {52 "epoch": 0.31,53 "learning_rate": 1e-05,54 "loss": 2.0978,55 "step": 556 },57 {58 "epoch": 0.37,59 "learning_rate": 1.2e-05,60 "loss": 2.0632,61 "step": 662 },63 {64 "epoch": 0.43,65 "learning_rate": 1.4000000000000001e-05,66 "loss": 2.0281,67 "step": 768 },69 {70 "epoch": 0.49,71 "learning_rate": 1.6000000000000003e-05,72 "loss": 1.9826,73 "step": 874 },75 {76 "epoch": 0.49,77 "eval_loss": 1.9868038892745972,78 "eval_runtime": 4.2896,79 "eval_samples_per_second": 6.527,80 "eval_steps_per_second": 1.632,81 "step": 882 }83 ],84 "logging_steps": 1,85 "max_steps": 16,86 "num_input_tokens_seen": 0,87 "num_train_epochs": 1,88 "save_steps": 8,89 "total_flos": 2.078490581847245e+16,90 "train_batch_size": 4,91 "trial_name": null,92 "trial_params": null93}94 