CoolFace
Modelpublic

LamaDiab/NewMiniLM-V25Data-256BATCH-SemanticEngine

sourceHugging Faceupdated 10mo agoView on Hugging Face
0likes73downloads
trainer_state.json122 linesDownload Raw Back to checkpoint-5900
1{2  "best_global_step": null,3  "best_metric": null,4  "best_model_checkpoint": null,5  "epoch": 3.0,6  "eval_steps": 1000,7  "global_step": 5900,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.000508646998982706,14      "grad_norm": 4.802672863006592,15      "learning_rate": 0.0,16      "loss": 3.5148,17      "step": 118    },19    {20      "epoch": 0.508646998982706,21      "grad_norm": 4.325772285461426,22      "learning_rate": 2.994574432010851e-05,23      "loss": 2.3332,24      "step": 100025    },26    {27      "epoch": 0.508646998982706,28      "eval_cosine_accuracy": 0.9514144659042358,29      "eval_loss": 0.4182649254798889,30      "eval_runtime": 40.3586,31      "eval_samples_per_second": 235.613,32      "eval_steps_per_second": 0.942,33      "step": 100034    },35    {36      "epoch": 1.0172852058973056,37      "grad_norm": 4.248680114746094,38      "learning_rate": 2.6554764326890472e-05,39      "loss": 1.1848,40      "step": 200041    },42    {43      "epoch": 1.0172852058973056,44      "eval_cosine_accuracy": 0.9598275423049927,45      "eval_loss": 0.36312881112098694,46      "eval_runtime": 39.402,47      "eval_samples_per_second": 241.333,48      "eval_steps_per_second": 0.964,49      "step": 200050    },51    {52      "epoch": 1.5256736146415861,53      "grad_norm": 3.5537898540496826,54      "learning_rate": 2.316378433367243e-05,55      "loss": 1.2233,56      "step": 300057    },58    {59      "epoch": 1.5256736146415861,60      "eval_cosine_accuracy": 0.964454710483551,61      "eval_loss": 0.35020381212234497,62      "eval_runtime": 39.2709,63      "eval_samples_per_second": 242.139,64      "eval_steps_per_second": 0.968,65      "step": 300066    },67    {68      "epoch": 2.0340620233858666,69      "grad_norm": 3.946258068084717,70      "learning_rate": 1.9772804340454392e-05,71      "loss": 1.0983,72      "step": 400073    },74    {75      "epoch": 2.0340620233858666,76      "eval_cosine_accuracy": 0.9663476943969727,77      "eval_loss": 0.34889712929725647,78      "eval_runtime": 39.8981,79      "eval_samples_per_second": 238.332,80      "eval_steps_per_second": 0.952,81      "step": 400082    },83    {84      "epoch": 2.5424504321301473,85      "grad_norm": 4.344015598297119,86      "learning_rate": 1.638182434723635e-05,87      "loss": 0.9919,88      "step": 500089    },90    {91      "epoch": 2.5424504321301473,92      "eval_cosine_accuracy": 0.9686612486839294,93      "eval_loss": 0.33659711480140686,94      "eval_runtime": 40.7722,95      "eval_samples_per_second": 233.222,96      "eval_steps_per_second": 0.932,97      "step": 500098    }99  ],100  "logging_steps": 1000,101  "max_steps": 9830,102  "num_input_tokens_seen": 0,103  "num_train_epochs": 5,104  "save_steps": 500,105  "stateful_callbacks": {106    "TrainerControl": {107      "args": {108        "should_epoch_stop": false,109        "should_evaluate": false,110        "should_log": false,111        "should_save": true,112        "should_training_stop": false113      },114      "attributes": {}115    }116  },117  "total_flos": 0.0,118  "train_batch_size": 256,119  "trial_name": null,120  "trial_params": null121}122