CoolFace
Modelpublic

LamaDiab/MiniLM-V13Data-256BATCH-SemanticEngine

sourceHugging Faceupdated 10mo agoView on Hugging Face
0likes76downloads
trainer_state.json154 linesDownload Raw Back to checkpoint-7989
1{2  "best_global_step": null,3  "best_metric": null,4  "best_model_checkpoint": null,5  "epoch": 3.0,6  "eval_steps": 1000,7  "global_step": 7989,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.0003755163349605708,14      "grad_norm": 6.263205528259277,15      "learning_rate": 0.0,16      "loss": 3.7128,17      "step": 118    },19    {20      "epoch": 0.3755163349605708,21      "grad_norm": 3.8261115550994873,22      "learning_rate": 7.502816372512205e-06,23      "loss": 2.8207,24      "step": 100025    },26    {27      "epoch": 0.3755163349605708,28      "eval_cosine_accuracy": 0.9523609280586243,29      "eval_loss": 1.359626054763794,30      "eval_runtime": 22.5746,31      "eval_samples_per_second": 421.226,32      "eval_steps_per_second": 1.683,33      "step": 100034    },35    {36      "epoch": 0.7510326699211416,37      "grad_norm": 3.8652374744415283,38      "learning_rate": 1.5013143071723622e-05,39      "loss": 2.2515,40      "step": 200041    },42    {43      "epoch": 0.7510326699211416,44      "eval_cosine_accuracy": 0.9578294157981873,45      "eval_loss": 1.3198553323745728,46      "eval_runtime": 22.5254,47      "eval_samples_per_second": 422.145,48      "eval_steps_per_second": 1.687,49      "step": 200050    },51    {52      "epoch": 1.1265490048817124,53      "grad_norm": 3.8326590061187744,54      "learning_rate": 1.9372887720615848e-05,55      "loss": 1.8906,56      "step": 300057    },58    {59      "epoch": 1.1265490048817124,60      "eval_cosine_accuracy": 0.9598275423049927,61      "eval_loss": 1.3083600997924805,62      "eval_runtime": 22.9203,63      "eval_samples_per_second": 414.873,64      "eval_steps_per_second": 1.658,65      "step": 300066    },67    {68      "epoch": 1.5020653398422832,69      "grad_norm": 3.9242522716522217,70      "learning_rate": 1.7495306045812995e-05,71      "loss": 1.7993,72      "step": 400073    },74    {75      "epoch": 1.5020653398422832,76      "eval_cosine_accuracy": 0.9630876183509827,77      "eval_loss": 1.272866129875183,78      "eval_runtime": 22.2844,79      "eval_samples_per_second": 426.712,80      "eval_steps_per_second": 1.705,81      "step": 400082    },83    {84      "epoch": 1.8775816748028538,85      "grad_norm": 3.9837265014648438,86      "learning_rate": 1.561772437101014e-05,87      "loss": 1.6857,88      "step": 500089    },90    {91      "epoch": 1.8775816748028538,92      "eval_cosine_accuracy": 0.9651908874511719,93      "eval_loss": 1.2809278964996338,94      "eval_runtime": 22.5564,95      "eval_samples_per_second": 421.565,96      "eval_steps_per_second": 1.685,97      "step": 500098    },99    {100      "epoch": 2.253098009763425,101      "grad_norm": 3.77929425239563,102      "learning_rate": 1.3742020277882089e-05,103      "loss": 1.5251,104      "step": 6000105    },106    {107      "epoch": 2.253098009763425,108      "eval_cosine_accuracy": 0.9658218622207642,109      "eval_loss": 1.2626943588256836,110      "eval_runtime": 23.9918,111      "eval_samples_per_second": 396.343,112      "eval_steps_per_second": 1.584,113      "step": 6000114    },115    {116      "epoch": 2.6286143447239954,117      "grad_norm": 3.7737784385681152,118      "learning_rate": 1.1864438603079236e-05,119      "loss": 1.5447,120      "step": 7000121    },122    {123      "epoch": 2.6286143447239954,124      "eval_cosine_accuracy": 0.965927004814148,125      "eval_loss": 1.2667568922042847,126      "eval_runtime": 22.5788,127      "eval_samples_per_second": 421.147,128      "eval_steps_per_second": 1.683,129      "step": 7000130    }131  ],132  "logging_steps": 1000,133  "max_steps": 13315,134  "num_input_tokens_seen": 0,135  "num_train_epochs": 5,136  "save_steps": 500,137  "stateful_callbacks": {138    "TrainerControl": {139      "args": {140        "should_epoch_stop": false,141        "should_evaluate": false,142        "should_log": false,143        "should_save": true,144        "should_training_stop": false145      },146      "attributes": {}147    }148  },149  "total_flos": 0.0,150  "train_batch_size": 256,151  "trial_name": null,152  "trial_params": null153}154