CoolFace
Modelpublic

LamaDiab/FinetunningMiniLM-V18Data-256ConstantBATCH-SemanticEngine

sourceHugging Faceupdated 10mo agoView on Hugging Face
0likes75downloads
trainer_state.json122 linesDownload Raw Back to checkpoint-5518
1{2  "best_global_step": null,3  "best_metric": null,4  "best_model_checkpoint": null,5  "epoch": 2.0,6  "eval_steps": 1000,7  "global_step": 5518,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.00036258158085569254,14      "grad_norm": 3.518895387649536,15      "learning_rate": 0.0,16      "loss": 1.2042,17      "step": 118    },19    {20      "epoch": 0.36258158085569253,21      "grad_norm": 4.220677852630615,22      "learning_rate": 9.053013140009063e-06,23      "loss": 1.1885,24      "step": 100025    },26    {27      "epoch": 0.36258158085569253,28      "eval_cosine_accuracy": 0.9711852073669434,29      "eval_loss": 0.3902958035469055,30      "eval_runtime": 34.6603,31      "eval_samples_per_second": 274.348,32      "eval_steps_per_second": 1.096,33      "step": 100034    },35    {36      "epoch": 0.7251631617113851,37      "grad_norm": 4.6132588386535645,38      "learning_rate": 1.811508835523335e-05,39      "loss": 0.8207,40      "step": 200041    },42    {43      "epoch": 0.7251631617113851,44      "eval_cosine_accuracy": 0.9699232578277588,45      "eval_loss": 0.37875595688819885,46      "eval_runtime": 33.7082,47      "eval_samples_per_second": 282.098,48      "eval_steps_per_second": 1.127,49      "step": 200050    },51    {52      "epoch": 1.0876811594202898,53      "grad_norm": 4.405287742614746,54      "learning_rate": 1.8205099150141645e-05,55      "loss": 0.7257,56      "step": 300057    },58    {59      "epoch": 1.0876811594202898,60      "eval_cosine_accuracy": 0.9716058373451233,61      "eval_loss": 0.3854234516620636,62      "eval_runtime": 34.2421,63      "eval_samples_per_second": 277.699,64      "eval_steps_per_second": 1.11,65      "step": 300066    },67    {68      "epoch": 1.45,69      "grad_norm": 4.425130367279053,70      "learning_rate": 1.5941076487252125e-05,71      "loss": 0.9126,72      "step": 400073    },74    {75      "epoch": 1.45,76      "eval_cosine_accuracy": 0.9708697199821472,77      "eval_loss": 0.3814031183719635,78      "eval_runtime": 33.9647,79      "eval_samples_per_second": 279.967,80      "eval_steps_per_second": 1.119,81      "step": 400082    },83    {84      "epoch": 1.8123188405797102,85      "grad_norm": 4.010558128356934,86      "learning_rate": 1.3677053824362606e-05,87      "loss": 0.8911,88      "step": 500089    },90    {91      "epoch": 1.8123188405797102,92      "eval_cosine_accuracy": 0.9710800051689148,93      "eval_loss": 0.38102903962135315,94      "eval_runtime": 34.858,95      "eval_samples_per_second": 272.792,96      "eval_steps_per_second": 1.09,97      "step": 500098    }99  ],100  "logging_steps": 1000,101  "max_steps": 11032,102  "num_input_tokens_seen": 0,103  "num_train_epochs": 4,104  "save_steps": 500,105  "stateful_callbacks": {106    "TrainerControl": {107      "args": {108        "should_epoch_stop": false,109        "should_evaluate": false,110        "should_log": false,111        "should_save": true,112        "should_training_stop": false113      },114      "attributes": {}115    }116  },117  "total_flos": 0.0,118  "train_batch_size": 256,119  "trial_name": null,120  "trial_params": null121}122