CoolFace
Modelpublic

thenlpresearcher/mistral_sequence_classification

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
0likes3downloads
trainer_state.json102 linesDownload Raw Back to root
1{2  "best_metric": 0.24322812259197235,3  "best_model_checkpoint": "mistral_sequence_classification/checkpoint-618",4  "epoch": 5.0,5  "eval_steps": 500,6  "global_step": 1030,7  "is_hyper_param_search": false,8  "is_local_process_zero": true,9  "is_world_process_zero": true,10  "log_history": [11    {12      "epoch": 1.0,13      "eval_loss": 0.3304608464241028,14      "eval_pearson": 0.9027747531908439,15      "eval_runtime": 15.8259,16      "eval_samples_per_second": 58.891,17      "eval_steps_per_second": 7.393,18      "step": 20619    },20    {21      "epoch": 2.0,22      "eval_loss": 0.2608998417854309,23      "eval_pearson": 0.9531635605038489,24      "eval_runtime": 15.7775,25      "eval_samples_per_second": 59.071,26      "eval_steps_per_second": 7.416,27      "step": 41228    },29    {30      "epoch": 2.4271844660194173,31      "grad_norm": 21.120954513549805,32      "learning_rate": 5.145631067961165e-05,33      "loss": 0.4868,34      "step": 50035    },36    {37      "epoch": 3.0,38      "eval_loss": 0.24322812259197235,39      "eval_pearson": 0.961136250737733,40      "eval_runtime": 15.732,41      "eval_samples_per_second": 59.242,42      "eval_steps_per_second": 7.437,43      "step": 61844    },45    {46      "epoch": 4.0,47      "eval_loss": 0.26112988591194153,48      "eval_pearson": 0.9639457727475045,49      "eval_runtime": 15.8547,50      "eval_samples_per_second": 58.784,51      "eval_steps_per_second": 7.38,52      "step": 82453    },54    {55      "epoch": 4.854368932038835,56      "grad_norm": 0.005307361483573914,57      "learning_rate": 2.912621359223301e-06,58      "loss": 0.0417,59      "step": 100060    },61    {62      "epoch": 5.0,63      "eval_loss": 0.2666521966457367,64      "eval_pearson": 0.9703769235281202,65      "eval_runtime": 15.6636,66      "eval_samples_per_second": 59.501,67      "eval_steps_per_second": 7.47,68      "step": 103069    },70    {71      "epoch": 5.0,72      "step": 1030,73      "total_flos": 6.321458643082445e+16,74      "train_loss": 0.2567840828768258,75      "train_runtime": 1141.9471,76      "train_samples_per_second": 28.745,77      "train_steps_per_second": 0.90278    }79  ],80  "logging_steps": 500,81  "max_steps": 1030,82  "num_input_tokens_seen": 0,83  "num_train_epochs": 5,84  "save_steps": 500,85  "stateful_callbacks": {86    "TrainerControl": {87      "args": {88        "should_epoch_stop": false,89        "should_evaluate": false,90        "should_log": false,91        "should_save": true,92        "should_training_stop": true93      },94      "attributes": {}95    }96  },97  "total_flos": 6.321458643082445e+16,98  "train_batch_size": 32,99  "trial_name": null,100  "trial_params": null101}102