LamaDiab/MiniLM-V13Data-256BATCH-SemanticEngine
076
1{2 "best_global_step": null,3 "best_metric": null,4 "best_model_checkpoint": null,5 "epoch": 4.0,6 "eval_steps": 1000,7 "global_step": 10652,8 "is_hyper_param_search": false,9 "is_local_process_zero": true,10 "is_world_process_zero": true,11 "log_history": [12 {13 "epoch": 0.0003755163349605708,14 "grad_norm": 6.263205528259277,15 "learning_rate": 0.0,16 "loss": 3.7128,17 "step": 118 },19 {20 "epoch": 0.3755163349605708,21 "grad_norm": 3.8261115550994873,22 "learning_rate": 7.502816372512205e-06,23 "loss": 2.8207,24 "step": 100025 },26 {27 "epoch": 0.3755163349605708,28 "eval_cosine_accuracy": 0.9523609280586243,29 "eval_loss": 1.359626054763794,30 "eval_runtime": 22.5746,31 "eval_samples_per_second": 421.226,32 "eval_steps_per_second": 1.683,33 "step": 100034 },35 {36 "epoch": 0.7510326699211416,37 "grad_norm": 3.8652374744415283,38 "learning_rate": 1.5013143071723622e-05,39 "loss": 2.2515,40 "step": 200041 },42 {43 "epoch": 0.7510326699211416,44 "eval_cosine_accuracy": 0.9578294157981873,45 "eval_loss": 1.3198553323745728,46 "eval_runtime": 22.5254,47 "eval_samples_per_second": 422.145,48 "eval_steps_per_second": 1.687,49 "step": 200050 },51 {52 "epoch": 1.1265490048817124,53 "grad_norm": 3.8326590061187744,54 "learning_rate": 1.9372887720615848e-05,55 "loss": 1.8906,56 "step": 300057 },58 {59 "epoch": 1.1265490048817124,60 "eval_cosine_accuracy": 0.9598275423049927,61 "eval_loss": 1.3083600997924805,62 "eval_runtime": 22.9203,63 "eval_samples_per_second": 414.873,64 "eval_steps_per_second": 1.658,65 "step": 300066 },67 {68 "epoch": 1.5020653398422832,69 "grad_norm": 3.9242522716522217,70 "learning_rate": 1.7495306045812995e-05,71 "loss": 1.7993,72 "step": 400073 },74 {75 "epoch": 1.5020653398422832,76 "eval_cosine_accuracy": 0.9630876183509827,77 "eval_loss": 1.272866129875183,78 "eval_runtime": 22.2844,79 "eval_samples_per_second": 426.712,80 "eval_steps_per_second": 1.705,81 "step": 400082 },83 {84 "epoch": 1.8775816748028538,85 "grad_norm": 3.9837265014648438,86 "learning_rate": 1.561772437101014e-05,87 "loss": 1.6857,88 "step": 500089 },90 {91 "epoch": 1.8775816748028538,92 "eval_cosine_accuracy": 0.9651908874511719,93 "eval_loss": 1.2809278964996338,94 "eval_runtime": 22.5564,95 "eval_samples_per_second": 421.565,96 "eval_steps_per_second": 1.685,97 "step": 500098 },99 {100 "epoch": 2.253098009763425,101 "grad_norm": 3.77929425239563,102 "learning_rate": 1.3742020277882089e-05,103 "loss": 1.5251,104 "step": 6000105 },106 {107 "epoch": 2.253098009763425,108 "eval_cosine_accuracy": 0.9658218622207642,109 "eval_loss": 1.2626943588256836,110 "eval_runtime": 23.9918,111 "eval_samples_per_second": 396.343,112 "eval_steps_per_second": 1.584,113 "step": 6000114 },115 {116 "epoch": 2.6286143447239954,117 "grad_norm": 3.7737784385681152,118 "learning_rate": 1.1864438603079236e-05,119 "loss": 1.5447,120 "step": 7000121 },122 {123 "epoch": 2.6286143447239954,124 "eval_cosine_accuracy": 0.965927004814148,125 "eval_loss": 1.2667568922042847,126 "eval_runtime": 22.5788,127 "eval_samples_per_second": 421.147,128 "eval_steps_per_second": 1.683,129 "step": 7000130 },131 {132 "epoch": 3.0041306796845664,133 "grad_norm": 3.8111581802368164,134 "learning_rate": 9.988734509951183e-06,135 "loss": 1.4464,136 "step": 8000137 },138 {139 "epoch": 3.0041306796845664,140 "eval_cosine_accuracy": 0.9660322070121765,141 "eval_loss": 1.2620376348495483,142 "eval_runtime": 22.8802,143 "eval_samples_per_second": 415.599,144 "eval_steps_per_second": 1.661,145 "step": 8000146 },147 {148 "epoch": 3.379647014645137,149 "grad_norm": 3.9379682540893555,150 "learning_rate": 8.11115283514833e-06,151 "loss": 1.4583,152 "step": 9000153 },154 {155 "epoch": 3.379647014645137,156 "eval_cosine_accuracy": 0.9686612486839294,157 "eval_loss": 1.2404857873916626,158 "eval_runtime": 22.5549,159 "eval_samples_per_second": 421.593,160 "eval_steps_per_second": 1.685,161 "step": 9000162 },163 {164 "epoch": 3.755163349605708,165 "grad_norm": 3.93530011177063,166 "learning_rate": 6.233571160345475e-06,167 "loss": 1.4374,168 "step": 10000169 },170 {171 "epoch": 3.755163349605708,172 "eval_cosine_accuracy": 0.9690819382667542,173 "eval_loss": 1.2410143613815308,174 "eval_runtime": 22.5543,175 "eval_samples_per_second": 421.605,176 "eval_steps_per_second": 1.685,177 "step": 10000178 }179 ],180 "logging_steps": 1000,181 "max_steps": 13315,182 "num_input_tokens_seen": 0,183 "num_train_epochs": 5,184 "save_steps": 500,185 "stateful_callbacks": {186 "TrainerControl": {187 "args": {188 "should_epoch_stop": false,189 "should_evaluate": false,190 "should_log": false,191 "should_save": true,192 "should_training_stop": false193 },194 "attributes": {}195 }196 },197 "total_flos": 0.0,198 "train_batch_size": 256,199 "trial_name": null,200 "trial_params": null201}202 