CoolFace
Modelpublic

asadullahdogarr/adaption_codeintel_python_reasoning_v

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
0likes6downloads
trainer_state.json292 linesDownload Raw Back to root
1{2  "best_global_step": null,3  "best_metric": null,4  "best_model_checkpoint": null,5  "epoch": 1.0,6  "eval_steps": 6,7  "global_step": 31,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.03225806451612903,14      "grad_norm": 2.39890456199646,15      "learning_rate": 0.0,16      "loss": 1.736328125,17      "step": 118    },19    {20      "epoch": 0.06451612903225806,21      "grad_norm": 2.554351329803467,22      "learning_rate": 2.5e-06,23      "loss": 1.7060546875,24      "step": 225    },26    {27      "epoch": 0.0967741935483871,28      "grad_norm": 2.6744349002838135,29      "learning_rate": 5e-06,30      "loss": 1.6474609375,31      "step": 332    },33    {34      "epoch": 0.12903225806451613,35      "grad_norm": 2.8339805603027344,36      "learning_rate": 7.500000000000001e-06,37      "loss": 1.6865234375,38      "step": 439    },40    {41      "epoch": 0.16129032258064516,42      "grad_norm": 2.64522123336792,43      "learning_rate": 1e-05,44      "loss": 1.64453125,45      "step": 546    },47    {48      "epoch": 0.1935483870967742,49      "grad_norm": 2.179842710494995,50      "learning_rate": 9.969572609838745e-06,51      "loss": 1.6220703125,52      "step": 653    },54    {55      "epoch": 0.22580645161290322,56      "grad_norm": 2.2128775119781494,57      "learning_rate": 9.878701917609208e-06,58      "loss": 1.650390625,59      "step": 760    },61    {62      "epoch": 0.22580645161290322,63      "eval_loss": 1.48046875,64      "eval_runtime": 2.6339,65      "eval_samples_per_second": 0.759,66      "eval_steps_per_second": 0.38,67      "step": 768    },69    {70      "epoch": 0.25806451612903225,71      "grad_norm": 2.7124762535095215,72      "learning_rate": 9.728616793536588e-06,73      "loss": 1.6220703125,74      "step": 875    },76    {77      "epoch": 0.2903225806451613,78      "grad_norm": 1.7431614398956299,79      "learning_rate": 9.521346881455356e-06,80      "loss": 1.4306640625,81      "step": 982    },83    {84      "epoch": 0.3225806451612903,85      "grad_norm": 1.9239155054092407,86      "learning_rate": 9.259695151358215e-06,87      "loss": 1.427734375,88      "step": 1089    },90    {91      "epoch": 0.3548387096774194,92      "grad_norm": 2.201296806335449,93      "learning_rate": 8.947199994035402e-06,94      "loss": 1.5146484375,95      "step": 1196    },97    {98      "epoch": 0.3870967741935484,99      "grad_norm": 1.9941728115081787,100      "learning_rate": 8.588087370409303e-06,101      "loss": 1.4658203125,102      "step": 12103    },104    {105      "epoch": 0.41935483870967744,106      "grad_norm": 1.4463545083999634,107      "learning_rate": 8.187213662662539e-06,108      "loss": 1.3359375,109      "step": 13110    },111    {112      "epoch": 0.41935483870967744,113      "eval_loss": 1.3125,114      "eval_runtime": 2.6299,115      "eval_samples_per_second": 0.76,116      "eval_steps_per_second": 0.38,117      "step": 13118    },119    {120      "epoch": 0.45161290322580644,121      "grad_norm": 1.8634389638900757,122      "learning_rate": 7.75e-06,123      "loss": 1.3623046875,124      "step": 14125    },126    {127      "epoch": 0.4838709677419355,128      "grad_norm": 1.3964911699295044,129      "learning_rate": 7.282358947176207e-06,130      "loss": 1.3232421875,131      "step": 15132    },133    {134      "epoch": 0.5161290322580645,135      "grad_norm": 1.4567354917526245,136      "learning_rate": 6.790614547199908e-06,137      "loss": 1.3125,138      "step": 16139    },140    {141      "epoch": 0.5483870967741935,142      "grad_norm": 1.2070086002349854,143      "learning_rate": 6.281416799501188e-06,144      "loss": 1.263671875,145      "step": 17146    },147    {148      "epoch": 0.5806451612903226,149      "grad_norm": 1.337532639503479,150      "learning_rate": 5.761651730097142e-06,151      "loss": 1.396484375,152      "step": 18153    },154    {155      "epoch": 0.6129032258064516,156      "grad_norm": 1.2737104892730713,157      "learning_rate": 5.23834826990286e-06,158      "loss": 1.314453125,159      "step": 19160    },161    {162      "epoch": 0.6129032258064516,163      "eval_loss": 1.2265625,164      "eval_runtime": 2.629,165      "eval_samples_per_second": 0.761,166      "eval_steps_per_second": 0.38,167      "step": 19168    },169    {170      "epoch": 0.6451612903225806,171      "grad_norm": 1.2080662250518799,172      "learning_rate": 4.718583200498814e-06,173      "loss": 1.2978515625,174      "step": 20175    },176    {177      "epoch": 0.6774193548387096,178      "grad_norm": 0.7336212992668152,179      "learning_rate": 4.2093854528000955e-06,180      "loss": 1.388671875,181      "step": 21182    },183    {184      "epoch": 0.7096774193548387,185      "grad_norm": 0.6965171694755554,186      "learning_rate": 3.717641052823795e-06,187      "loss": 1.3662109375,188      "step": 22189    },190    {191      "epoch": 0.7419354838709677,192      "grad_norm": 1.1687854528427124,193      "learning_rate": 3.2500000000000015e-06,194      "loss": 1.2197265625,195      "step": 23196    },197    {198      "epoch": 0.7741935483870968,199      "grad_norm": 1.0150550603866577,200      "learning_rate": 2.8127863373374637e-06,201      "loss": 1.2353515625,202      "step": 24203    },204    {205      "epoch": 0.8064516129032258,206      "grad_norm": 1.0265108346939087,207      "learning_rate": 2.4119126295906997e-06,208      "loss": 1.2353515625,209      "step": 25210    },211    {212      "epoch": 0.8064516129032258,213      "eval_loss": 1.19140625,214      "eval_runtime": 2.622,215      "eval_samples_per_second": 0.763,216      "eval_steps_per_second": 0.381,217      "step": 25218    },219    {220      "epoch": 0.8387096774193549,221      "grad_norm": 0.872216522693634,222      "learning_rate": 2.0528000059646e-06,223      "loss": 1.158203125,224      "step": 26225    },226    {227      "epoch": 0.8709677419354839,228      "grad_norm": 0.6529123783111572,229      "learning_rate": 1.740304848641787e-06,230      "loss": 1.31494140625,231      "step": 27232    },233    {234      "epoch": 0.9032258064516129,235      "grad_norm": 1.0117592811584473,236      "learning_rate": 1.4786531185446455e-06,237      "loss": 1.2607421875,238      "step": 28239    },240    {241      "epoch": 0.9354838709677419,242      "grad_norm": 0.8021711111068726,243      "learning_rate": 1.2713832064634127e-06,244      "loss": 1.2509765625,245      "step": 29246    },247    {248      "epoch": 0.967741935483871,249      "grad_norm": 0.6989158391952515,250      "learning_rate": 1.121298082390793e-06,251      "loss": 1.349609375,252      "step": 30253    },254    {255      "epoch": 1.0,256      "grad_norm": 0.8156901001930237,257      "learning_rate": 1.0304273901612566e-06,258      "loss": 1.11328125,259      "step": 31260    },261    {262      "epoch": 1.0,263      "eval_loss": 1.17578125,264      "eval_runtime": 2.6331,265      "eval_samples_per_second": 0.76,266      "eval_steps_per_second": 0.38,267      "step": 31268    }269  ],270  "logging_steps": 1.0,271  "max_steps": 31,272  "num_input_tokens_seen": 0,273  "num_train_epochs": 1,274  "save_steps": 0,275  "stateful_callbacks": {276    "TrainerControl": {277      "args": {278        "should_epoch_stop": false,279        "should_evaluate": false,280        "should_log": false,281        "should_save": true,282        "should_training_stop": true283      },284      "attributes": {}285    }286  },287  "total_flos": 6.361719431579566e+17,288  "train_batch_size": 1,289  "trial_name": null,290  "trial_params": null291}292