CoolFace
Modelpublic

LamaDiab/MiniLM-V13Data-256BATCH-SemanticEngine

sourceHugging Faceupdated 10mo agoView on Hugging Face
0likes76downloads
trainer_state.json202 linesDownload Raw Back to checkpoint-10652
1{2  "best_global_step": null,3  "best_metric": null,4  "best_model_checkpoint": null,5  "epoch": 4.0,6  "eval_steps": 1000,7  "global_step": 10652,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.0003755163349605708,14      "grad_norm": 6.263205528259277,15      "learning_rate": 0.0,16      "loss": 3.7128,17      "step": 118    },19    {20      "epoch": 0.3755163349605708,21      "grad_norm": 3.8261115550994873,22      "learning_rate": 7.502816372512205e-06,23      "loss": 2.8207,24      "step": 100025    },26    {27      "epoch": 0.3755163349605708,28      "eval_cosine_accuracy": 0.9523609280586243,29      "eval_loss": 1.359626054763794,30      "eval_runtime": 22.5746,31      "eval_samples_per_second": 421.226,32      "eval_steps_per_second": 1.683,33      "step": 100034    },35    {36      "epoch": 0.7510326699211416,37      "grad_norm": 3.8652374744415283,38      "learning_rate": 1.5013143071723622e-05,39      "loss": 2.2515,40      "step": 200041    },42    {43      "epoch": 0.7510326699211416,44      "eval_cosine_accuracy": 0.9578294157981873,45      "eval_loss": 1.3198553323745728,46      "eval_runtime": 22.5254,47      "eval_samples_per_second": 422.145,48      "eval_steps_per_second": 1.687,49      "step": 200050    },51    {52      "epoch": 1.1265490048817124,53      "grad_norm": 3.8326590061187744,54      "learning_rate": 1.9372887720615848e-05,55      "loss": 1.8906,56      "step": 300057    },58    {59      "epoch": 1.1265490048817124,60      "eval_cosine_accuracy": 0.9598275423049927,61      "eval_loss": 1.3083600997924805,62      "eval_runtime": 22.9203,63      "eval_samples_per_second": 414.873,64      "eval_steps_per_second": 1.658,65      "step": 300066    },67    {68      "epoch": 1.5020653398422832,69      "grad_norm": 3.9242522716522217,70      "learning_rate": 1.7495306045812995e-05,71      "loss": 1.7993,72      "step": 400073    },74    {75      "epoch": 1.5020653398422832,76      "eval_cosine_accuracy": 0.9630876183509827,77      "eval_loss": 1.272866129875183,78      "eval_runtime": 22.2844,79      "eval_samples_per_second": 426.712,80      "eval_steps_per_second": 1.705,81      "step": 400082    },83    {84      "epoch": 1.8775816748028538,85      "grad_norm": 3.9837265014648438,86      "learning_rate": 1.561772437101014e-05,87      "loss": 1.6857,88      "step": 500089    },90    {91      "epoch": 1.8775816748028538,92      "eval_cosine_accuracy": 0.9651908874511719,93      "eval_loss": 1.2809278964996338,94      "eval_runtime": 22.5564,95      "eval_samples_per_second": 421.565,96      "eval_steps_per_second": 1.685,97      "step": 500098    },99    {100      "epoch": 2.253098009763425,101      "grad_norm": 3.77929425239563,102      "learning_rate": 1.3742020277882089e-05,103      "loss": 1.5251,104      "step": 6000105    },106    {107      "epoch": 2.253098009763425,108      "eval_cosine_accuracy": 0.9658218622207642,109      "eval_loss": 1.2626943588256836,110      "eval_runtime": 23.9918,111      "eval_samples_per_second": 396.343,112      "eval_steps_per_second": 1.584,113      "step": 6000114    },115    {116      "epoch": 2.6286143447239954,117      "grad_norm": 3.7737784385681152,118      "learning_rate": 1.1864438603079236e-05,119      "loss": 1.5447,120      "step": 7000121    },122    {123      "epoch": 2.6286143447239954,124      "eval_cosine_accuracy": 0.965927004814148,125      "eval_loss": 1.2667568922042847,126      "eval_runtime": 22.5788,127      "eval_samples_per_second": 421.147,128      "eval_steps_per_second": 1.683,129      "step": 7000130    },131    {132      "epoch": 3.0041306796845664,133      "grad_norm": 3.8111581802368164,134      "learning_rate": 9.988734509951183e-06,135      "loss": 1.4464,136      "step": 8000137    },138    {139      "epoch": 3.0041306796845664,140      "eval_cosine_accuracy": 0.9660322070121765,141      "eval_loss": 1.2620376348495483,142      "eval_runtime": 22.8802,143      "eval_samples_per_second": 415.599,144      "eval_steps_per_second": 1.661,145      "step": 8000146    },147    {148      "epoch": 3.379647014645137,149      "grad_norm": 3.9379682540893555,150      "learning_rate": 8.11115283514833e-06,151      "loss": 1.4583,152      "step": 9000153    },154    {155      "epoch": 3.379647014645137,156      "eval_cosine_accuracy": 0.9686612486839294,157      "eval_loss": 1.2404857873916626,158      "eval_runtime": 22.5549,159      "eval_samples_per_second": 421.593,160      "eval_steps_per_second": 1.685,161      "step": 9000162    },163    {164      "epoch": 3.755163349605708,165      "grad_norm": 3.93530011177063,166      "learning_rate": 6.233571160345475e-06,167      "loss": 1.4374,168      "step": 10000169    },170    {171      "epoch": 3.755163349605708,172      "eval_cosine_accuracy": 0.9690819382667542,173      "eval_loss": 1.2410143613815308,174      "eval_runtime": 22.5543,175      "eval_samples_per_second": 421.605,176      "eval_steps_per_second": 1.685,177      "step": 10000178    }179  ],180  "logging_steps": 1000,181  "max_steps": 13315,182  "num_input_tokens_seen": 0,183  "num_train_epochs": 5,184  "save_steps": 500,185  "stateful_callbacks": {186    "TrainerControl": {187      "args": {188        "should_epoch_stop": false,189        "should_evaluate": false,190        "should_log": false,191        "should_save": true,192        "should_training_stop": false193      },194      "attributes": {}195    }196  },197  "total_flos": 0.0,198  "train_batch_size": 256,199  "trial_name": null,200  "trial_params": null201}202