CoolFace
Modelpublic

avsolatorio/data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702-lora

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
0likes
14 commits on main
0b5a1b02y ago

best (Trained with Unsloth)

avsolatorio
1c9ea7d2y ago

{"epoch": 9.0, "global_step": 5085, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 7.376905398512517e+18, "log_history": [{"loss": 1.2085, "grad_norm": 0.15643130242824554, "learning_rate": 3.7546933667083855e-05, "epoch": 8.141592920353983, "step": 4600}, {"eval_loss": 1.3804749250411987, "eval_runtime": 129.5778, "eval_samples_per_second": 8.312, "eval_steps_per_second": 2.084, "epoch": 8.141592920353983, "step": 4600}, {"loss": 1.2272, "grad_norm": 0.149332657456398, "learning_rate": 3.3971035222599675e-05, "epoch": 8.31858407079646, "step": 4700}, {"eval_loss": 1.3825435638427734, "eval_runtime": 129.265, "eval_samples_per_second": 8.332, "eval_steps_per_second": 2.089, "epoch": 8.31858407079646, "step": 4700}, {"loss": 1.2105, "grad_norm": 0.14463898539543152, "learning_rate": 3.0395136778115502e-05, "epoch": 8.495575221238939, "step": 4800}, {"eval_loss": 1.3810926675796509, "eval_runtime": 129.3414, "eval_samples_per_second": 8.327, "eval_steps_per_second": 2.087, "epoch": 8.495575221238939, "step": 4800}, {"loss": 1.2104, "grad_norm": 0.147825226187706, "learning_rate": 2.6819238333631326e-05, "epoch": 8.672566371681416, "step": 4900}, {"eval_loss": 1.3812334537506104, "eval_runtime": 129.2705, "eval_samples_per_second": 8.331, "eval_steps_per_second": 2.089, "epoch": 8.672566371681416, "step": 4900}, {"loss": 1.2193, "grad_norm": 0.1529868245124817, "learning_rate": 2.324333988914715e-05, "epoch": 8.849557522123893, "step": 5000}, {"eval_loss": 1.3813197612762451, "eval_runtime": 129.314, "eval_samples_per_second": 8.329, "eval_steps_per_second": 2.088, "epoch": 8.849557522123893, "step": 5000}], "best_metric": 1.3600431680679321, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-2800", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
fb2250c2y ago

{"epoch": 8.0, "global_step": 4520, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 6.639233302769172e+18, "log_history": [{"loss": 1.2311, "grad_norm": 0.18058137595653534, "learning_rate": 5.9002324333988914e-05, "epoch": 7.079646017699115, "step": 4000}, {"eval_loss": 1.3767077922821045, "eval_runtime": 129.298, "eval_samples_per_second": 8.33, "eval_steps_per_second": 2.088, "epoch": 7.079646017699115, "step": 4000}, {"loss": 1.2274, "grad_norm": 0.1428651362657547, "learning_rate": 5.542642588950474e-05, "epoch": 7.256637168141593, "step": 4100}, {"eval_loss": 1.3741710186004639, "eval_runtime": 129.2836, "eval_samples_per_second": 8.331, "eval_steps_per_second": 2.088, "epoch": 7.256637168141593, "step": 4100}, {"loss": 1.2282, "grad_norm": 0.1381855010986328, "learning_rate": 5.185052744502057e-05, "epoch": 7.433628318584071, "step": 4200}, {"eval_loss": 1.3751704692840576, "eval_runtime": 129.304, "eval_samples_per_second": 8.329, "eval_steps_per_second": 2.088, "epoch": 7.433628318584071, "step": 4200}, {"loss": 1.2306, "grad_norm": 0.1633206456899643, "learning_rate": 4.827462900053639e-05, "epoch": 7.610619469026549, "step": 4300}, {"eval_loss": 1.3738926649093628, "eval_runtime": 129.3656, "eval_samples_per_second": 8.325, "eval_steps_per_second": 2.087, "epoch": 7.610619469026549, "step": 4300}, {"loss": 1.2402, "grad_norm": 0.14496219158172607, "learning_rate": 4.469873055605221e-05, "epoch": 7.787610619469026, "step": 4400}, {"eval_loss": 1.3739736080169678, "eval_runtime": 129.307, "eval_samples_per_second": 8.329, "eval_steps_per_second": 2.088, "epoch": 7.787610619469026, "step": 4400}, {"loss": 1.2279, "grad_norm": 0.14324885606765747, "learning_rate": 4.1122832111568035e-05, "epoch": 7.964601769911504, "step": 4500}, {"eval_loss": 1.3739391565322876, "eval_runtime": 129.3451, "eval_samples_per_second": 8.327, "eval_steps_per_second": 2.087, "epoch": 7.964601769911504, "step": 4500}], "best_metric": 1.3600431680679321, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-2800", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
6d4d7992y ago

{"epoch": 7.0, "global_step": 3955, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 5.754008343769252e+18, "log_history": [{"loss": 1.264, "grad_norm": 0.14140304923057556, "learning_rate": 8.045771500089397e-05, "epoch": 6.017699115044247, "step": 3400}, {"eval_loss": 1.3684132099151611, "eval_runtime": 129.3189, "eval_samples_per_second": 8.328, "eval_steps_per_second": 2.088, "epoch": 6.017699115044247, "step": 3400}, {"loss": 1.2404, "grad_norm": 0.13698157668113708, "learning_rate": 7.688181655640981e-05, "epoch": 6.1946902654867255, "step": 3500}, {"eval_loss": 1.3691898584365845, "eval_runtime": 129.3419, "eval_samples_per_second": 8.327, "eval_steps_per_second": 2.087, "epoch": 6.1946902654867255, "step": 3500}, {"loss": 1.2465, "grad_norm": 0.1386970430612564, "learning_rate": 7.330591811192561e-05, "epoch": 6.371681415929204, "step": 3600}, {"eval_loss": 1.369583249092102, "eval_runtime": 129.6089, "eval_samples_per_second": 8.31, "eval_steps_per_second": 2.083, "epoch": 6.371681415929204, "step": 3600}, {"loss": 1.252, "grad_norm": 0.1313806176185608, "learning_rate": 6.973001966744145e-05, "epoch": 6.548672566371682, "step": 3700}, {"eval_loss": 1.368135929107666, "eval_runtime": 129.3333, "eval_samples_per_second": 8.327, "eval_steps_per_second": 2.088, "epoch": 6.548672566371682, "step": 3700}, {"loss": 1.2409, "grad_norm": 0.14860659837722778, "learning_rate": 6.615412122295727e-05, "epoch": 6.725663716814159, "step": 3800}, {"eval_loss": 1.3686259984970093, "eval_runtime": 129.4315, "eval_samples_per_second": 8.321, "eval_steps_per_second": 2.086, "epoch": 6.725663716814159, "step": 3800}, {"loss": 1.2518, "grad_norm": 0.1303570419549942, "learning_rate": 6.25782227784731e-05, "epoch": 6.902654867256637, "step": 3900}, {"eval_loss": 1.367377519607544, "eval_runtime": 129.4671, "eval_samples_per_second": 8.319, "eval_steps_per_second": 2.085, "epoch": 6.902654867256637, "step": 3900}], "best_metric": 1.3600431680679321, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-2800", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
88c2fd42y ago

{"epoch": 6.0, "global_step": 3390, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 4.868783384769331e+18, "log_history": [{"loss": 1.2721, "grad_norm": 0.13575193285942078, "learning_rate": 9.833720722331486e-05, "epoch": 5.132743362831858, "step": 2900}, {"eval_loss": 1.3637126684188843, "eval_runtime": 129.4141, "eval_samples_per_second": 8.322, "eval_steps_per_second": 2.086, "epoch": 5.132743362831858, "step": 2900}, {"loss": 1.2704, "grad_norm": 0.14111797511577606, "learning_rate": 9.476130877883068e-05, "epoch": 5.3097345132743365, "step": 3000}, {"eval_loss": 1.3641278743743896, "eval_runtime": 129.2864, "eval_samples_per_second": 8.33, "eval_steps_per_second": 2.088, "epoch": 5.3097345132743365, "step": 3000}, {"loss": 1.2632, "grad_norm": 0.14969052374362946, "learning_rate": 9.118541033434651e-05, "epoch": 5.486725663716814, "step": 3100}, {"eval_loss": 1.3650586605072021, "eval_runtime": 129.2117, "eval_samples_per_second": 8.335, "eval_steps_per_second": 2.09, "epoch": 5.486725663716814, "step": 3100}, {"loss": 1.2664, "grad_norm": 0.13355447351932526, "learning_rate": 8.760951188986233e-05, "epoch": 5.663716814159292, "step": 3200}, {"eval_loss": 1.3636552095413208, "eval_runtime": 129.2841, "eval_samples_per_second": 8.33, "eval_steps_per_second": 2.088, "epoch": 5.663716814159292, "step": 3200}, {"loss": 1.2682, "grad_norm": 0.1321106106042862, "learning_rate": 8.403361344537815e-05, "epoch": 5.84070796460177, "step": 3300}, {"eval_loss": 1.3638768196105957, "eval_runtime": 129.2997, "eval_samples_per_second": 8.329, "eval_steps_per_second": 2.088, "epoch": 5.84070796460177, "step": 3300}], "best_metric": 1.3600431680679321, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-2800", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
70435b82y ago

{"epoch": 5.0, "global_step": 2825, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 4.1311112890259866e+18, "log_history": [{"loss": 1.2929, "grad_norm": 0.11513873934745789, "learning_rate": 0.00011979259789021993, "epoch": 4.070796460176991, "step": 2300}, {"eval_loss": 1.3636656999588013, "eval_runtime": 129.3624, "eval_samples_per_second": 8.325, "eval_steps_per_second": 2.087, "epoch": 4.070796460176991, "step": 2300}, {"loss": 1.2822, "grad_norm": 0.12702393531799316, "learning_rate": 0.00011621669944573575, "epoch": 4.247787610619469, "step": 2400}, {"eval_loss": 1.3644509315490723, "eval_runtime": 129.3038, "eval_samples_per_second": 8.329, "eval_steps_per_second": 2.088, "epoch": 4.247787610619469, "step": 2400}, {"loss": 1.2872, "grad_norm": 0.14375126361846924, "learning_rate": 0.00011264080100125157, "epoch": 4.424778761061947, "step": 2500}, {"eval_loss": 1.362855315208435, "eval_runtime": 129.2631, "eval_samples_per_second": 8.332, "eval_steps_per_second": 2.089, "epoch": 4.424778761061947, "step": 2500}, {"loss": 1.2908, "grad_norm": 0.13253188133239746, "learning_rate": 0.0001090649025567674, "epoch": 4.601769911504425, "step": 2600}, {"eval_loss": 1.3605667352676392, "eval_runtime": 129.3139, "eval_samples_per_second": 8.329, "eval_steps_per_second": 2.088, "epoch": 4.601769911504425, "step": 2600}, {"loss": 1.2969, "grad_norm": 0.12235808372497559, "learning_rate": 0.00010548900411228322, "epoch": 4.778761061946903, "step": 2700}, {"eval_loss": 1.3602815866470337, "eval_runtime": 129.3524, "eval_samples_per_second": 8.326, "eval_steps_per_second": 2.087, "epoch": 4.778761061946903, "step": 2700}, {"loss": 1.2827, "grad_norm": 0.12722694873809814, "learning_rate": 0.00010191310566779904, "epoch": 4.95575221238938, "step": 2800}, {"eval_loss": 1.3600431680679321, "eval_runtime": 129.3362, "eval_samples_per_second": 8.327, "eval_steps_per_second": 2.088, "epoch": 4.95575221238938, "step": 2800}], "best_metric": 1.3600431680679321, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-2800", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
b17fd3a2y ago

{"epoch": 4.0, "global_step": 2260, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 3.245886330026066e+18, "log_history": [{"loss": 1.326, "grad_norm": 0.13466985523700714, "learning_rate": 0.00014124798855712496, "epoch": 3.0088495575221237, "step": 1700}, {"eval_loss": 1.3643239736557007, "eval_runtime": 129.3816, "eval_samples_per_second": 8.324, "eval_steps_per_second": 2.087, "epoch": 3.0088495575221237, "step": 1700}, {"loss": 1.3134, "grad_norm": 0.11522851139307022, "learning_rate": 0.00013767209011264083, "epoch": 3.185840707964602, "step": 1800}, {"eval_loss": 1.364418387413025, "eval_runtime": 129.2668, "eval_samples_per_second": 8.332, "eval_steps_per_second": 2.089, "epoch": 3.185840707964602, "step": 1800}, {"loss": 1.3095, "grad_norm": 0.12836964428424835, "learning_rate": 0.00013409619166815663, "epoch": 3.3628318584070795, "step": 1900}, {"eval_loss": 1.364190697669983, "eval_runtime": 129.3527, "eval_samples_per_second": 8.326, "eval_steps_per_second": 2.087, "epoch": 3.3628318584070795, "step": 1900}, {"loss": 1.3207, "grad_norm": 0.1270432025194168, "learning_rate": 0.00013052029322367244, "epoch": 3.5398230088495577, "step": 2000}, {"eval_loss": 1.362518548965454, "eval_runtime": 129.3837, "eval_samples_per_second": 8.324, "eval_steps_per_second": 2.087, "epoch": 3.5398230088495577, "step": 2000}, {"loss": 1.3118, "grad_norm": 0.12102756649255753, "learning_rate": 0.00012694439477918827, "epoch": 3.7168141592920354, "step": 2100}, {"eval_loss": 1.3608036041259766, "eval_runtime": 129.2752, "eval_samples_per_second": 8.331, "eval_steps_per_second": 2.089, "epoch": 3.7168141592920354, "step": 2100}, {"loss": 1.3159, "grad_norm": 0.13318948447704315, "learning_rate": 0.0001233684963347041, "epoch": 3.893805309734513, "step": 2200}, {"eval_loss": 1.3602889776229858, "eval_runtime": 129.2583, "eval_samples_per_second": 8.332, "eval_steps_per_second": 2.089, "epoch": 3.893805309734513, "step": 2200}], "best_metric": 1.3602889776229858, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-2200", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
8e8bcdf2y ago

{"epoch": 3.0, "global_step": 1695, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 2.3606613710261453e+18, "log_history": [{"loss": 1.3584, "grad_norm": 0.10968083143234253, "learning_rate": 0.00015912748077954588, "epoch": 2.1238938053097347, "step": 1200}, {"eval_loss": 1.3741145133972168, "eval_runtime": 129.2637, "eval_samples_per_second": 8.332, "eval_steps_per_second": 2.089, "epoch": 2.1238938053097347, "step": 1200}, {"loss": 1.3525, "grad_norm": 0.134329691529274, "learning_rate": 0.00015555158233506168, "epoch": 2.3008849557522124, "step": 1300}, {"eval_loss": 1.3716199398040771, "eval_runtime": 129.2455, "eval_samples_per_second": 8.333, "eval_steps_per_second": 2.089, "epoch": 2.3008849557522124, "step": 1300}, {"loss": 1.3442, "grad_norm": 0.12658581137657166, "learning_rate": 0.00015197568389057752, "epoch": 2.47787610619469, "step": 1400}, {"eval_loss": 1.3691881895065308, "eval_runtime": 129.3336, "eval_samples_per_second": 8.327, "eval_steps_per_second": 2.088, "epoch": 2.47787610619469, "step": 1400}, {"loss": 1.3446, "grad_norm": 0.12408660352230072, "learning_rate": 0.00014839978544609335, "epoch": 2.6548672566371683, "step": 1500}, {"eval_loss": 1.3679156303405762, "eval_runtime": 129.4792, "eval_samples_per_second": 8.318, "eval_steps_per_second": 2.085, "epoch": 2.6548672566371683, "step": 1500}, {"loss": 1.3391, "grad_norm": 0.1020989641547203, "learning_rate": 0.00014482388700160916, "epoch": 2.831858407079646, "step": 1600}, {"eval_loss": 1.3648655414581299, "eval_runtime": 129.2856, "eval_samples_per_second": 8.33, "eval_steps_per_second": 2.088, "epoch": 2.831858407079646, "step": 1600}], "best_metric": 1.3648655414581299, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-1600", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
5a9ebb92y ago

{"epoch": 2.0, "global_step": 1130, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 1.6229892752828006e+18, "log_history": [{"loss": 1.4136, "grad_norm": 0.11081118881702423, "learning_rate": 0.00018058287144645093, "epoch": 1.0619469026548674, "step": 600}, {"eval_loss": 1.4039709568023682, "eval_runtime": 129.2614, "eval_samples_per_second": 8.332, "eval_steps_per_second": 2.089, "epoch": 1.0619469026548674, "step": 600}, {"loss": 1.3857, "grad_norm": 0.11329254508018494, "learning_rate": 0.00017700697300196676, "epoch": 1.238938053097345, "step": 700}, {"eval_loss": 1.3966178894042969, "eval_runtime": 129.4415, "eval_samples_per_second": 8.32, "eval_steps_per_second": 2.086, "epoch": 1.238938053097345, "step": 700}, {"loss": 1.3804, "grad_norm": 0.14488695561885834, "learning_rate": 0.00017343107455748257, "epoch": 1.415929203539823, "step": 800}, {"eval_loss": 1.3899469375610352, "eval_runtime": 129.4251, "eval_samples_per_second": 8.321, "eval_steps_per_second": 2.086, "epoch": 1.415929203539823, "step": 800}, {"loss": 1.3891, "grad_norm": 0.10952924191951752, "learning_rate": 0.0001698551761129984, "epoch": 1.592920353982301, "step": 900}, {"eval_loss": 1.3857674598693848, "eval_runtime": 129.2198, "eval_samples_per_second": 8.335, "eval_steps_per_second": 2.089, "epoch": 1.592920353982301, "step": 900}, {"loss": 1.3741, "grad_norm": 0.11011792719364166, "learning_rate": 0.00016627927766851424, "epoch": 1.7699115044247788, "step": 1000}, {"eval_loss": 1.3795846700668335, "eval_runtime": 129.2448, "eval_samples_per_second": 8.333, "eval_steps_per_second": 2.089, "epoch": 1.7699115044247788, "step": 1000}, {"loss": 1.3613, "grad_norm": 0.10358926653862, "learning_rate": 0.00016270337922403004, "epoch": 1.9469026548672566, "step": 1100}, {"eval_loss": 1.3751627206802368, "eval_runtime": 129.2564, "eval_samples_per_second": 8.332, "eval_steps_per_second": 2.089, "epoch": 1.9469026548672566, "step": 1100}], "best_metric": 1.3751627206802368, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-1100", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
de512ed2y ago

{"epoch": 1.0, "global_step": 565, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 7.3776431628288e+17, "log_history": [{"loss": 2.9323, "grad_norm": 0.15510527789592743, "learning_rate": 0.00019846236366887182, "epoch": 0.17699115044247787, "step": 100}, {"eval_loss": 1.6457003355026245, "eval_runtime": 129.4892, "eval_samples_per_second": 8.317, "eval_steps_per_second": 2.085, "epoch": 0.17699115044247787, "step": 100}, {"loss": 1.5442, "grad_norm": 0.13386400043964386, "learning_rate": 0.00019488646522438762, "epoch": 0.35398230088495575, "step": 200}, {"eval_loss": 1.4938856363296509, "eval_runtime": 129.3524, "eval_samples_per_second": 8.326, "eval_steps_per_second": 2.087, "epoch": 0.35398230088495575, "step": 200}, {"loss": 1.4715, "grad_norm": 0.11129985749721527, "learning_rate": 0.00019131056677990346, "epoch": 0.5309734513274337, "step": 300}, {"eval_loss": 1.4499516487121582, "eval_runtime": 129.1904, "eval_samples_per_second": 8.337, "eval_steps_per_second": 2.09, "epoch": 0.5309734513274337, "step": 300}, {"loss": 1.447, "grad_norm": 0.09917670488357544, "learning_rate": 0.0001877346683354193, "epoch": 0.7079646017699115, "step": 400}, {"eval_loss": 1.4284520149230957, "eval_runtime": 129.1617, "eval_samples_per_second": 8.338, "eval_steps_per_second": 2.09, "epoch": 0.7079646017699115, "step": 400}, {"loss": 1.4264, "grad_norm": 0.11954418569803238, "learning_rate": 0.0001841587698909351, "epoch": 0.8849557522123894, "step": 500}, {"eval_loss": 1.4138357639312744, "eval_runtime": 129.2867, "eval_samples_per_second": 8.33, "eval_steps_per_second": 2.088, "epoch": 0.8849557522123894, "step": 500}], "best_metric": 1.4138357639312744, "best_model_checkpoint": "./pf-data-use-unsloth-phi-3.5-simpleschema-thinking-tccml-iclr-prwp-train-10epochs-1738646702/checkpoint-500", "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
4efa13d2y ago

{"epoch": 0, "global_step": 0, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 0, "log_history": [], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": false, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
96423e42y ago

{"epoch": 0, "global_step": 0, "max_steps": 5650, "logging_steps": 100, "eval_steps": 100, "save_steps": 100, "train_batch_size": 4, "num_train_epochs": 10, "num_input_tokens_seen": 0, "total_flos": 0, "log_history": [], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": false, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)

avsolatorio
b2edd812y ago

Upload README.md with huggingface_hub

avsolatorio
19908952y ago

initial commit

avsolatorio