CoolFace
Modelpublic

omb23/reddit_classification_multilabel_base_lm_head

sourceHugging Faceupdated 6mo agoView on Hugging Face
1likes4downloads
trainer_state.json109 linesDownload Raw Back to root
1{2  "best_metric": 0.4966275691986084,3  "best_model_checkpoint": "/content/models/gemma_qlora_lmh/checkpoint-100",4  "epoch": 1.9607843137254903,5  "eval_steps": 20,6  "global_step": 100,7  "is_hyper_param_search": false,8  "is_local_process_zero": true,9  "is_world_process_zero": true,10  "log_history": [11    {12      "epoch": 0.39215686274509803,13      "grad_norm": 0.142578125,14      "learning_rate": 0.00016078431372549022,15      "loss": 1.9189,16      "step": 2017    },18    {19      "epoch": 0.39215686274509803,20      "eval_loss": 0.6956291198730469,21      "eval_runtime": 2.5321,22      "eval_samples_per_second": 80.171,23      "eval_steps_per_second": 5.134,24      "step": 2025    },26    {27      "epoch": 0.7843137254901961,28      "grad_norm": 0.2451171875,29      "learning_rate": 0.00012156862745098039,30      "loss": 0.6936,31      "step": 4032    },33    {34      "epoch": 0.7843137254901961,35      "eval_loss": 0.6871838569641113,36      "eval_runtime": 2.5413,37      "eval_samples_per_second": 79.881,38      "eval_steps_per_second": 5.116,39      "step": 4040    },41    {42      "epoch": 1.1764705882352942,43      "grad_norm": 1.3203125,44      "learning_rate": 8.23529411764706e-05,45      "loss": 0.7369,46      "step": 6047    },48    {49      "epoch": 1.1764705882352942,50      "eval_loss": 0.6056703329086304,51      "eval_runtime": 2.5135,52      "eval_samples_per_second": 80.765,53      "eval_steps_per_second": 5.172,54      "step": 6055    },56    {57      "epoch": 1.5686274509803921,58      "grad_norm": 6.375,59      "learning_rate": 4.313725490196079e-05,60      "loss": 0.5682,61      "step": 8062    },63    {64      "epoch": 1.5686274509803921,65      "eval_loss": 0.4978070557117462,66      "eval_runtime": 2.527,67      "eval_samples_per_second": 80.333,68      "eval_steps_per_second": 5.144,69      "step": 8070    },71    {72      "epoch": 1.9607843137254903,73      "grad_norm": 1.71875,74      "learning_rate": 3.92156862745098e-06,75      "loss": 0.4668,76      "step": 10077    },78    {79      "epoch": 1.9607843137254903,80      "eval_loss": 0.4966275691986084,81      "eval_runtime": 2.5077,82      "eval_samples_per_second": 80.951,83      "eval_steps_per_second": 5.184,84      "step": 10085    }86  ],87  "logging_steps": 20,88  "max_steps": 102,89  "num_input_tokens_seen": 0,90  "num_train_epochs": 2,91  "save_steps": 20,92  "stateful_callbacks": {93    "TrainerControl": {94      "args": {95        "should_epoch_stop": false,96        "should_evaluate": false,97        "should_log": false,98        "should_save": true,99        "should_training_stop": false100      },101      "attributes": {}102    }103  },104  "total_flos": 5905861022605824.0,105  "train_batch_size": 16,106  "trial_name": null,107  "trial_params": null108}109