CoolFace
Modelpublic

prithivMLmods/Multisource-121-DomainNet

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
0likes7downloads
trainer_state.json107 linesDownload Raw Back to checkpoint-3063
1{2  "best_global_step": 3063,3  "best_metric": 0.9870542287826538,4  "best_model_checkpoint": "siglip2-finetune-full/checkpoint-3063",5  "epoch": 3.0,6  "eval_steps": 500,7  "global_step": 3063,8  "is_hyper_param_search": false,9  "is_local_process_zero": true,10  "is_world_process_zero": true,11  "log_history": [12    {13      "epoch": 0.48971596474045054,14      "grad_norm": 59.27558135986328,15      "learning_rate": 2.665344571145265e-06,16      "loss": 4.268,17      "step": 50018    },19    {20      "epoch": 0.9794319294809011,21      "grad_norm": 61.66608810424805,22      "learning_rate": 2.2935052057511156e-06,23      "loss": 2.4217,24      "step": 100025    },26    {27      "epoch": 1.0,28      "eval_accuracy": 0.666574839302112,29      "eval_loss": 1.7632426023483276,30      "eval_model_preparation_time": 0.0024,31      "eval_runtime": 476.9192,32      "eval_samples_per_second": 68.502,33      "eval_steps_per_second": 8.563,34      "step": 102135    },36    {37      "epoch": 1.4691478942213516,38      "grad_norm": 71.97106170654297,39      "learning_rate": 1.921665840356966e-06,40      "loss": 1.709,41      "step": 150042    },43    {44      "epoch": 1.9588638589618022,45      "grad_norm": 63.00515365600586,46      "learning_rate": 1.5498264749628163e-06,47      "loss": 1.4697,48      "step": 200049    },50    {51      "epoch": 2.0,52      "eval_accuracy": 0.7615243342516069,53      "eval_loss": 1.171113133430481,54      "eval_model_preparation_time": 0.0024,55      "eval_runtime": 475.7496,56      "eval_samples_per_second": 68.671,57      "eval_steps_per_second": 8.584,58      "step": 204259    },60    {61      "epoch": 2.4485798237022527,62      "grad_norm": 51.789241790771484,63      "learning_rate": 1.1779871095686663e-06,64      "loss": 1.2603,65      "step": 250066    },67    {68      "epoch": 2.9382957884427032,69      "grad_norm": 42.61498260498047,70      "learning_rate": 8.061477441745166e-07,71      "loss": 1.2054,72      "step": 300073    },74    {75      "epoch": 3.0,76      "eval_accuracy": 0.7891031527395164,77      "eval_loss": 0.9870542287826538,78      "eval_model_preparation_time": 0.0024,79      "eval_runtime": 475.3188,80      "eval_samples_per_second": 68.733,81      "eval_steps_per_second": 8.592,82      "step": 306383    }84  ],85  "logging_steps": 500,86  "max_steps": 4084,87  "num_input_tokens_seen": 0,88  "num_train_epochs": 4,89  "save_steps": 500,90  "stateful_callbacks": {91    "TrainerControl": {92      "args": {93        "should_epoch_stop": false,94        "should_evaluate": false,95        "should_log": false,96        "should_save": true,97        "should_training_stop": false98      },99      "attributes": {}100    }101  },102  "total_flos": 8.216976653015962e+18,103  "train_batch_size": 32,104  "trial_name": null,105  "trial_params": null106}107