CoolFace
Modelpublic

one-thousand-ai/beans_model

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
0likes8downloads
trainer_state.json245 linesDownload Raw Back to root
1{2  "best_metric": 0.0630112811923027,3  "best_model_checkpoint": "beans_model/checkpoint-200",4  "epoch": 4.0,5  "eval_steps": 100,6  "global_step": 260,7  "is_hyper_param_search": false,8  "is_local_process_zero": true,9  "is_world_process_zero": true,10  "log_history": [11    {12      "epoch": 0.15384615384615385,13      "grad_norm": 1.528293251991272,14      "learning_rate": 0.00019230769230769233,15      "loss": 0.7841,16      "step": 1017    },18    {19      "epoch": 0.3076923076923077,20      "grad_norm": 1.525876522064209,21      "learning_rate": 0.00018461538461538463,22      "loss": 0.3219,23      "step": 2024    },25    {26      "epoch": 0.46153846153846156,27      "grad_norm": 2.951483964920044,28      "learning_rate": 0.00017692307692307693,29      "loss": 0.1955,30      "step": 3031    },32    {33      "epoch": 0.6153846153846154,34      "grad_norm": 0.8248862624168396,35      "learning_rate": 0.00016923076923076923,36      "loss": 0.1905,37      "step": 4038    },39    {40      "epoch": 0.7692307692307693,41      "grad_norm": 4.840185642242432,42      "learning_rate": 0.00016153846153846155,43      "loss": 0.2207,44      "step": 5045    },46    {47      "epoch": 0.9230769230769231,48      "grad_norm": 3.156651496887207,49      "learning_rate": 0.00015384615384615385,50      "loss": 0.248,51      "step": 6052    },53    {54      "epoch": 1.0769230769230769,55      "grad_norm": 0.3212275505065918,56      "learning_rate": 0.00014615384615384615,57      "loss": 0.1409,58      "step": 7059    },60    {61      "epoch": 1.2307692307692308,62      "grad_norm": 0.14757445454597473,63      "learning_rate": 0.00013846153846153847,64      "loss": 0.0797,65      "step": 8066    },67    {68      "epoch": 1.3846153846153846,69      "grad_norm": 0.16617465019226074,70      "learning_rate": 0.00013076923076923077,71      "loss": 0.112,72      "step": 9073    },74    {75      "epoch": 1.5384615384615383,76      "grad_norm": 1.4776158332824707,77      "learning_rate": 0.0001230769230769231,78      "loss": 0.0983,79      "step": 10080    },81    {82      "epoch": 1.5384615384615383,83      "eval_accuracy": 0.9624060150375939,84      "eval_loss": 0.11257314682006836,85      "eval_model_preparation_time": 0.006,86      "eval_runtime": 1.2635,87      "eval_samples_per_second": 105.261,88      "eval_steps_per_second": 13.454,89      "step": 10090    },91    {92      "epoch": 1.6923076923076923,93      "grad_norm": 0.17706085741519928,94      "learning_rate": 0.00011538461538461538,95      "loss": 0.1054,96      "step": 11097    },98    {99      "epoch": 1.8461538461538463,100      "grad_norm": 7.802417278289795,101      "learning_rate": 0.0001076923076923077,102      "loss": 0.1234,103      "step": 120104    },105    {106      "epoch": 2.0,107      "grad_norm": 0.10370013862848282,108      "learning_rate": 0.0001,109      "loss": 0.0904,110      "step": 130111    },112    {113      "epoch": 2.1538461538461537,114      "grad_norm": 0.1017041876912117,115      "learning_rate": 9.230769230769232e-05,116      "loss": 0.0363,117      "step": 140118    },119    {120      "epoch": 2.3076923076923075,121      "grad_norm": 0.5070149302482605,122      "learning_rate": 8.461538461538461e-05,123      "loss": 0.0429,124      "step": 150125    },126    {127      "epoch": 2.4615384615384617,128      "grad_norm": 7.553247928619385,129      "learning_rate": 7.692307692307693e-05,130      "loss": 0.0324,131      "step": 160132    },133    {134      "epoch": 2.6153846153846154,135      "grad_norm": 6.309382438659668,136      "learning_rate": 6.923076923076924e-05,137      "loss": 0.0308,138      "step": 170139    },140    {141      "epoch": 2.769230769230769,142      "grad_norm": 0.35512471199035645,143      "learning_rate": 6.153846153846155e-05,144      "loss": 0.019,145      "step": 180146    },147    {148      "epoch": 2.9230769230769234,149      "grad_norm": 0.062438324093818665,150      "learning_rate": 5.384615384615385e-05,151      "loss": 0.0194,152      "step": 190153    },154    {155      "epoch": 3.076923076923077,156      "grad_norm": 0.06177965924143791,157      "learning_rate": 4.615384615384616e-05,158      "loss": 0.0283,159      "step": 200160    },161    {162      "epoch": 3.076923076923077,163      "eval_accuracy": 0.9774436090225563,164      "eval_loss": 0.0630112811923027,165      "eval_model_preparation_time": 0.006,166      "eval_runtime": 1.262,167      "eval_samples_per_second": 105.388,168      "eval_steps_per_second": 13.471,169      "step": 200170    },171    {172      "epoch": 3.230769230769231,173      "grad_norm": 0.05896027013659477,174      "learning_rate": 3.846153846153846e-05,175      "loss": 0.0116,176      "step": 210177    },178    {179      "epoch": 3.3846153846153846,180      "grad_norm": 0.06045134365558624,181      "learning_rate": 3.0769230769230774e-05,182      "loss": 0.0133,183      "step": 220184    },185    {186      "epoch": 3.5384615384615383,187      "grad_norm": 0.06165293976664543,188      "learning_rate": 2.307692307692308e-05,189      "loss": 0.0113,190      "step": 230191    },192    {193      "epoch": 3.6923076923076925,194      "grad_norm": 0.057042431086301804,195      "learning_rate": 1.5384615384615387e-05,196      "loss": 0.0115,197      "step": 240198    },199    {200      "epoch": 3.8461538461538463,201      "grad_norm": 0.05782578885555267,202      "learning_rate": 7.692307692307694e-06,203      "loss": 0.0117,204      "step": 250205    },206    {207      "epoch": 4.0,208      "grad_norm": 0.06298615038394928,209      "learning_rate": 0.0,210      "loss": 0.0109,211      "step": 260212    },213    {214      "epoch": 4.0,215      "step": 260,216      "total_flos": 3.205097416476426e+17,217      "train_loss": 0.11501647262619091,218      "train_runtime": 105.1039,219      "train_samples_per_second": 39.352,220      "train_steps_per_second": 2.474221    }222  ],223  "logging_steps": 10,224  "max_steps": 260,225  "num_input_tokens_seen": 0,226  "num_train_epochs": 4,227  "save_steps": 100,228  "stateful_callbacks": {229    "TrainerControl": {230      "args": {231        "should_epoch_stop": false,232        "should_evaluate": false,233        "should_log": false,234        "should_save": true,235        "should_training_stop": true236      },237      "attributes": {}238    }239  },240  "total_flos": 3.205097416476426e+17,241  "train_batch_size": 16,242  "trial_name": null,243  "trial_params": null244}245