LamaDiab/NewMiniLM-V25Data-256BATCH-SemanticEngine
073
1{2 "best_global_step": null,3 "best_metric": null,4 "best_model_checkpoint": null,5 "epoch": 3.0,6 "eval_steps": 1000,7 "global_step": 5900,8 "is_hyper_param_search": false,9 "is_local_process_zero": true,10 "is_world_process_zero": true,11 "log_history": [12 {13 "epoch": 0.000508646998982706,14 "grad_norm": 4.802672863006592,15 "learning_rate": 0.0,16 "loss": 3.5148,17 "step": 118 },19 {20 "epoch": 0.508646998982706,21 "grad_norm": 4.325772285461426,22 "learning_rate": 2.994574432010851e-05,23 "loss": 2.3332,24 "step": 100025 },26 {27 "epoch": 0.508646998982706,28 "eval_cosine_accuracy": 0.9514144659042358,29 "eval_loss": 0.4182649254798889,30 "eval_runtime": 40.3586,31 "eval_samples_per_second": 235.613,32 "eval_steps_per_second": 0.942,33 "step": 100034 },35 {36 "epoch": 1.0172852058973056,37 "grad_norm": 4.248680114746094,38 "learning_rate": 2.6554764326890472e-05,39 "loss": 1.1848,40 "step": 200041 },42 {43 "epoch": 1.0172852058973056,44 "eval_cosine_accuracy": 0.9598275423049927,45 "eval_loss": 0.36312881112098694,46 "eval_runtime": 39.402,47 "eval_samples_per_second": 241.333,48 "eval_steps_per_second": 0.964,49 "step": 200050 },51 {52 "epoch": 1.5256736146415861,53 "grad_norm": 3.5537898540496826,54 "learning_rate": 2.316378433367243e-05,55 "loss": 1.2233,56 "step": 300057 },58 {59 "epoch": 1.5256736146415861,60 "eval_cosine_accuracy": 0.964454710483551,61 "eval_loss": 0.35020381212234497,62 "eval_runtime": 39.2709,63 "eval_samples_per_second": 242.139,64 "eval_steps_per_second": 0.968,65 "step": 300066 },67 {68 "epoch": 2.0340620233858666,69 "grad_norm": 3.946258068084717,70 "learning_rate": 1.9772804340454392e-05,71 "loss": 1.0983,72 "step": 400073 },74 {75 "epoch": 2.0340620233858666,76 "eval_cosine_accuracy": 0.9663476943969727,77 "eval_loss": 0.34889712929725647,78 "eval_runtime": 39.8981,79 "eval_samples_per_second": 238.332,80 "eval_steps_per_second": 0.952,81 "step": 400082 },83 {84 "epoch": 2.5424504321301473,85 "grad_norm": 4.344015598297119,86 "learning_rate": 1.638182434723635e-05,87 "loss": 0.9919,88 "step": 500089 },90 {91 "epoch": 2.5424504321301473,92 "eval_cosine_accuracy": 0.9686612486839294,93 "eval_loss": 0.33659711480140686,94 "eval_runtime": 40.7722,95 "eval_samples_per_second": 233.222,96 "eval_steps_per_second": 0.932,97 "step": 500098 }99 ],100 "logging_steps": 1000,101 "max_steps": 9830,102 "num_input_tokens_seen": 0,103 "num_train_epochs": 5,104 "save_steps": 500,105 "stateful_callbacks": {106 "TrainerControl": {107 "args": {108 "should_epoch_stop": false,109 "should_evaluate": false,110 "should_log": false,111 "should_save": true,112 "should_training_stop": false113 },114 "attributes": {}115 }116 },117 "total_flos": 0.0,118 "train_batch_size": 256,119 "trial_name": null,120 "trial_params": null121}122 