CoolFace
Modelpublic

LamaDiab/NewMiniLM-V25Data-256BATCH-SemanticEngine

sourceHugging Faceupdated 10mo agoView on Hugging Face
0likes73downloads
trainer_state.json90 linesDownload Raw Back to checkpoint-3933
1{2  "best_global_step": null,3  "best_metric": null,4  "best_model_checkpoint": null,5  "epoch": 2.0,6  "eval_steps": 1000,7  "global_step": 3933,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.000508646998982706,14      "grad_norm": 4.802672863006592,15      "learning_rate": 0.0,16      "loss": 3.5148,17      "step": 118    },19    {20      "epoch": 0.508646998982706,21      "grad_norm": 4.325772285461426,22      "learning_rate": 2.994574432010851e-05,23      "loss": 2.3332,24      "step": 100025    },26    {27      "epoch": 0.508646998982706,28      "eval_cosine_accuracy": 0.9514144659042358,29      "eval_loss": 0.4182649254798889,30      "eval_runtime": 40.3586,31      "eval_samples_per_second": 235.613,32      "eval_steps_per_second": 0.942,33      "step": 100034    },35    {36      "epoch": 1.0172852058973056,37      "grad_norm": 4.248680114746094,38      "learning_rate": 2.6554764326890472e-05,39      "loss": 1.1848,40      "step": 200041    },42    {43      "epoch": 1.0172852058973056,44      "eval_cosine_accuracy": 0.9598275423049927,45      "eval_loss": 0.36312881112098694,46      "eval_runtime": 39.402,47      "eval_samples_per_second": 241.333,48      "eval_steps_per_second": 0.964,49      "step": 200050    },51    {52      "epoch": 1.5256736146415861,53      "grad_norm": 3.5537898540496826,54      "learning_rate": 2.316378433367243e-05,55      "loss": 1.2233,56      "step": 300057    },58    {59      "epoch": 1.5256736146415861,60      "eval_cosine_accuracy": 0.964454710483551,61      "eval_loss": 0.35020381212234497,62      "eval_runtime": 39.2709,63      "eval_samples_per_second": 242.139,64      "eval_steps_per_second": 0.968,65      "step": 300066    }67  ],68  "logging_steps": 1000,69  "max_steps": 9830,70  "num_input_tokens_seen": 0,71  "num_train_epochs": 5,72  "save_steps": 500,73  "stateful_callbacks": {74    "TrainerControl": {75      "args": {76        "should_epoch_stop": false,77        "should_evaluate": false,78        "should_log": false,79        "should_save": true,80        "should_training_stop": false81      },82      "attributes": {}83    }84  },85  "total_flos": 0.0,86  "train_batch_size": 256,87  "trial_name": null,88  "trial_params": null89}90