omb23/reddit_classification_multilabel_base_lm_head
14
1{2 "best_metric": 0.4966275691986084,3 "best_model_checkpoint": "/content/models/gemma_qlora_lmh/checkpoint-100",4 "epoch": 1.9607843137254903,5 "eval_steps": 20,6 "global_step": 100,7 "is_hyper_param_search": false,8 "is_local_process_zero": true,9 "is_world_process_zero": true,10 "log_history": [11 {12 "epoch": 0.39215686274509803,13 "grad_norm": 0.142578125,14 "learning_rate": 0.00016078431372549022,15 "loss": 1.9189,16 "step": 2017 },18 {19 "epoch": 0.39215686274509803,20 "eval_loss": 0.6956291198730469,21 "eval_runtime": 2.5321,22 "eval_samples_per_second": 80.171,23 "eval_steps_per_second": 5.134,24 "step": 2025 },26 {27 "epoch": 0.7843137254901961,28 "grad_norm": 0.2451171875,29 "learning_rate": 0.00012156862745098039,30 "loss": 0.6936,31 "step": 4032 },33 {34 "epoch": 0.7843137254901961,35 "eval_loss": 0.6871838569641113,36 "eval_runtime": 2.5413,37 "eval_samples_per_second": 79.881,38 "eval_steps_per_second": 5.116,39 "step": 4040 },41 {42 "epoch": 1.1764705882352942,43 "grad_norm": 1.3203125,44 "learning_rate": 8.23529411764706e-05,45 "loss": 0.7369,46 "step": 6047 },48 {49 "epoch": 1.1764705882352942,50 "eval_loss": 0.6056703329086304,51 "eval_runtime": 2.5135,52 "eval_samples_per_second": 80.765,53 "eval_steps_per_second": 5.172,54 "step": 6055 },56 {57 "epoch": 1.5686274509803921,58 "grad_norm": 6.375,59 "learning_rate": 4.313725490196079e-05,60 "loss": 0.5682,61 "step": 8062 },63 {64 "epoch": 1.5686274509803921,65 "eval_loss": 0.4978070557117462,66 "eval_runtime": 2.527,67 "eval_samples_per_second": 80.333,68 "eval_steps_per_second": 5.144,69 "step": 8070 },71 {72 "epoch": 1.9607843137254903,73 "grad_norm": 1.71875,74 "learning_rate": 3.92156862745098e-06,75 "loss": 0.4668,76 "step": 10077 },78 {79 "epoch": 1.9607843137254903,80 "eval_loss": 0.4966275691986084,81 "eval_runtime": 2.5077,82 "eval_samples_per_second": 80.951,83 "eval_steps_per_second": 5.184,84 "step": 10085 }86 ],87 "logging_steps": 20,88 "max_steps": 102,89 "num_input_tokens_seen": 0,90 "num_train_epochs": 2,91 "save_steps": 20,92 "stateful_callbacks": {93 "TrainerControl": {94 "args": {95 "should_epoch_stop": false,96 "should_evaluate": false,97 "should_log": false,98 "should_save": true,99 "should_training_stop": false100 },101 "attributes": {}102 }103 },104 "total_flos": 5905861022605824.0,105 "train_batch_size": 16,106 "trial_name": null,107 "trial_params": null108}109 