CoolFace
Modelpublic

JeremiahZ/roberta-base-sst2

sourceHugging Facemitupdated 2y agoView on Hugging Face
0likes597downloads
trainer_state.json260 linesDownload Raw Back to root
1{2  "best_metric": 0.9357798165137615,3  "best_model_checkpoint": "./fine-tune/roberta-base/sst2/checkpoint-4210",4  "epoch": 4.0,5  "global_step": 16840,6  "is_hyper_param_search": false,7  "is_local_process_zero": true,8  "is_world_process_zero": true,9  "log_history": [10    {11      "epoch": 0.12,12      "learning_rate": 3.9588281868566905e-06,13      "loss": 0.5645,14      "step": 50015    },16    {17      "epoch": 0.24,18      "learning_rate": 7.917656373713381e-06,19      "loss": 0.3021,20      "step": 100021    },22    {23      "epoch": 0.36,24      "learning_rate": 1.1876484560570072e-05,25      "loss": 0.2658,26      "step": 150027    },28    {29      "epoch": 0.48,30      "learning_rate": 1.5835312747426762e-05,31      "loss": 0.2706,32      "step": 200033    },34    {35      "epoch": 0.59,36      "learning_rate": 1.9794140934283453e-05,37      "loss": 0.2508,38      "step": 250039    },40    {41      "epoch": 0.71,42      "learning_rate": 1.9760448779501697e-05,43      "loss": 0.2557,44      "step": 300045    },46    {47      "epoch": 0.83,48      "learning_rate": 1.95077576186385e-05,49      "loss": 0.2578,50      "step": 350051    },52    {53      "epoch": 0.95,54      "learning_rate": 1.925506645777531e-05,55      "loss": 0.2287,56      "step": 400057    },58    {59      "epoch": 1.0,60      "eval_accuracy": 0.9357798165137615,61      "eval_loss": 0.23143097758293152,62      "eval_runtime": 1.9026,63      "eval_samples_per_second": 458.311,64      "eval_steps_per_second": 57.289,65      "step": 421066    },67    {68      "epoch": 1.07,69      "learning_rate": 1.9002375296912114e-05,70      "loss": 0.2229,71      "step": 450072    },73    {74      "epoch": 1.19,75      "learning_rate": 1.874968413604892e-05,76      "loss": 0.2084,77      "step": 500078    },79    {80      "epoch": 1.31,81      "learning_rate": 1.849699297518573e-05,82      "loss": 0.2047,83      "step": 550084    },85    {86      "epoch": 1.43,87      "learning_rate": 1.8244301814322537e-05,88      "loss": 0.189,89      "step": 600090    },91    {92      "epoch": 1.54,93      "learning_rate": 1.7991610653459345e-05,94      "loss": 0.1914,95      "step": 650096    },97    {98      "epoch": 1.66,99      "learning_rate": 1.773891949259615e-05,100      "loss": 0.1874,101      "step": 7000102    },103    {104      "epoch": 1.78,105      "learning_rate": 1.7486228331732958e-05,106      "loss": 0.1942,107      "step": 7500108    },109    {110      "epoch": 1.9,111      "learning_rate": 1.7233537170869766e-05,112      "loss": 0.1959,113      "step": 8000114    },115    {116      "epoch": 2.0,117      "eval_accuracy": 0.926605504587156,118      "eval_loss": 0.30272433161735535,119      "eval_runtime": 1.8407,120      "eval_samples_per_second": 473.726,121      "eval_steps_per_second": 59.216,122      "step": 8420123    },124    {125      "epoch": 2.02,126      "learning_rate": 1.698084601000657e-05,127      "loss": 0.1783,128      "step": 8500129    },130    {131      "epoch": 2.14,132      "learning_rate": 1.672815484914338e-05,133      "loss": 0.1453,134      "step": 9000135    },136    {137      "epoch": 2.26,138      "learning_rate": 1.6475463688280183e-05,139      "loss": 0.1481,140      "step": 9500141    },142    {143      "epoch": 2.38,144      "learning_rate": 1.622277252741699e-05,145      "loss": 0.1564,146      "step": 10000147    },148    {149      "epoch": 2.49,150      "learning_rate": 1.59700813665538e-05,151      "loss": 0.1457,152      "step": 10500153    },154    {155      "epoch": 2.61,156      "learning_rate": 1.5717390205690607e-05,157      "loss": 0.15,158      "step": 11000159    },160    {161      "epoch": 2.73,162      "learning_rate": 1.5464699044827415e-05,163      "loss": 0.157,164      "step": 11500165    },166    {167      "epoch": 2.85,168      "learning_rate": 1.521200788396422e-05,169      "loss": 0.1531,170      "step": 12000171    },172    {173      "epoch": 2.97,174      "learning_rate": 1.4959316723101027e-05,175      "loss": 0.1635,176      "step": 12500177    },178    {179      "epoch": 3.0,180      "eval_accuracy": 0.930045871559633,181      "eval_loss": 0.30217334628105164,182      "eval_runtime": 1.7605,183      "eval_samples_per_second": 495.309,184      "eval_steps_per_second": 61.914,185      "step": 12630186    },187    {188      "epoch": 3.09,189      "learning_rate": 1.4706625562237835e-05,190      "loss": 0.1167,191      "step": 13000192    },193    {194      "epoch": 3.21,195      "learning_rate": 1.4453934401374641e-05,196      "loss": 0.1147,197      "step": 13500198    },199    {200      "epoch": 3.33,201      "learning_rate": 1.420124324051145e-05,202      "loss": 0.1123,203      "step": 14000204    },205    {206      "epoch": 3.44,207      "learning_rate": 1.3948552079648254e-05,208      "loss": 0.1173,209      "step": 14500210    },211    {212      "epoch": 3.56,213      "learning_rate": 1.3695860918785062e-05,214      "loss": 0.1105,215      "step": 15000216    },217    {218      "epoch": 3.68,219      "learning_rate": 1.344316975792187e-05,220      "loss": 0.1148,221      "step": 15500222    },223    {224      "epoch": 3.8,225      "learning_rate": 1.3190478597058676e-05,226      "loss": 0.1335,227      "step": 16000228    },229    {230      "epoch": 3.92,231      "learning_rate": 1.2937787436195484e-05,232      "loss": 0.1148,233      "step": 16500234    },235    {236      "epoch": 4.0,237      "eval_accuracy": 0.9288990825688074,238      "eval_loss": 0.31621453166007996,239      "eval_runtime": 1.6764,240      "eval_samples_per_second": 520.163,241      "eval_steps_per_second": 65.02,242      "step": 16840243    },244    {245      "epoch": 4.0,246      "step": 16840,247      "total_flos": 1.772026646744064e+16,248      "train_loss": 0.19015042130567683,249      "train_runtime": 1734.8381,250      "train_samples_per_second": 388.215,251      "train_steps_per_second": 24.267252    }253  ],254  "max_steps": 42100,255  "num_train_epochs": 10,256  "total_flos": 1.772026646744064e+16,257  "trial_name": null,258  "trial_params": null259}260