CoolFace
Modelpublic

titanhacker/sequence_classification

sourceHugging Facellama3.2updated 1y agoView on Hugging Face
0likes5downloads
trainer_state.json107 linesDownload Raw Back to root
1{
2  "best_metric": 0.8860787153244019,
3  "best_model_checkpoint": "sequence_classification\\checkpoint-1238",
4  "epoch": 4.0,
5  "eval_steps": 500,
6  "global_step": 2476,
7  "is_hyper_param_search": false,
8  "is_local_process_zero": true,
9  "is_world_process_zero": true,
10  "log_history": [
11    {
12      "epoch": 0.8077544426494345,
13      "grad_norm": 15.20165729522705,
14      "learning_rate": 7.980613893376414e-05,
15      "loss": 1.3148,
16      "step": 500
17    },
18    {
19      "epoch": 1.0,
20      "eval_loss": 0.9956253170967102,
21      "eval_pearson": 0.7673949737715109,
22      "eval_runtime": 593.2409,
23      "eval_samples_per_second": 8.337,
24      "eval_steps_per_second": 0.261,
25      "step": 619
26    },
27    {
28      "epoch": 1.615508885298869,
29      "grad_norm": 19.32335662841797,
30      "learning_rate": 5.9612277867528274e-05,
31      "loss": 0.9627,
32      "step": 1000
33    },
34    {
35      "epoch": 2.0,
36      "eval_loss": 0.8860787153244019,
37      "eval_pearson": 0.7987432834261069,
38      "eval_runtime": 588.6019,
39      "eval_samples_per_second": 8.403,
40      "eval_steps_per_second": 0.263,
41      "step": 1238
42    },
43    {
44      "epoch": 2.4232633279483036,
45      "grad_norm": 10.007705688476562,
46      "learning_rate": 3.941841680129241e-05,
47      "loss": 0.8641,
48      "step": 1500
49    },
50    {
51      "epoch": 3.0,
52      "eval_loss": 0.9137663245201111,
53      "eval_pearson": 0.7964932034547004,
54      "eval_runtime": 589.478,
55      "eval_samples_per_second": 8.39,
56      "eval_steps_per_second": 0.263,
57      "step": 1857
58    },
59    {
60      "epoch": 3.231017770597738,
61      "grad_norm": 4.174856662750244,
62      "learning_rate": 1.9224555735056543e-05,
63      "loss": 0.7651,
64      "step": 2000
65    },
66    {
67      "epoch": 4.0,
68      "eval_loss": 0.8885385990142822,
69      "eval_pearson": 0.8035657020343545,
70      "eval_runtime": 588.4581,
71      "eval_samples_per_second": 8.405,
72      "eval_steps_per_second": 0.263,
73      "step": 2476
74    },
75    {
76      "epoch": 4.0,
77      "step": 2476,
78      "total_flos": 2.3738772810018816e+17,
79      "train_loss": 0.9284627911347372,
80      "train_runtime": 31889.2207,
81      "train_samples_per_second": 2.481,
82      "train_steps_per_second": 0.078
83    }
84  ],
85  "logging_steps": 500,
86  "max_steps": 2476,
87  "num_input_tokens_seen": 0,
88  "num_train_epochs": 4,
89  "save_steps": 500,
90  "stateful_callbacks": {
91    "TrainerControl": {
92      "args": {
93        "should_epoch_stop": false,
94        "should_evaluate": false,
95        "should_log": false,
96        "should_save": true,
97        "should_training_stop": true
98      },
99      "attributes": {}
100    }
101  },
102  "total_flos": 2.3738772810018816e+17,
103  "train_batch_size": 32,
104  "trial_name": null,
105  "trial_params": null
106}
107