avsolatorio/data-use-unsloth-phi-3.5-simpleschema-thinking-prwp-manual-464-train-100epochs-1738542480-lora
{"epoch": 99.0, "global_step": 9306, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 8.57651017678848e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.0011898166267201304, "learning_rate": 4.728132387706856e-06, "epoch": 98.93617021276596, "step": 9300}, {"eval_loss": 4.1270670890808105, "eval_runtime": 0.6266, "eval_samples_per_second": 7.979, "eval_steps_per_second": 3.192, "epoch": 98.93617021276596, "step": 9300}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 98.0, "global_step": 9212, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 8.48428963725312e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.0013786827912554145, "learning_rate": 9.456264775413712e-06, "epoch": 97.87234042553192, "step": 9200}, {"eval_loss": 4.128390312194824, "eval_runtime": 0.6276, "eval_samples_per_second": 7.967, "eval_steps_per_second": 3.187, "epoch": 97.87234042553192, "step": 9200}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 97.0, "global_step": 9118, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 8.39206909771776e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.01664472371339798, "learning_rate": 1.418439716312057e-05, "epoch": 96.80851063829788, "step": 9100}, {"eval_loss": 4.124192714691162, "eval_runtime": 0.6273, "eval_samples_per_second": 7.971, "eval_steps_per_second": 3.188, "epoch": 96.80851063829788, "step": 9100}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 96.0, "global_step": 9024, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 8.2998485581824e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.016011761501431465, "learning_rate": 1.8912529550827425e-05, "epoch": 95.74468085106383, "step": 9000}, {"eval_loss": 4.11873722076416, "eval_runtime": 0.6272, "eval_samples_per_second": 7.972, "eval_steps_per_second": 3.189, "epoch": 95.74468085106383, "step": 9000}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 95.0, "global_step": 8930, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 8.20762801864704e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.023024097084999084, "learning_rate": 2.364066193853428e-05, "epoch": 94.68085106382979, "step": 8900}, {"eval_loss": 4.118570804595947, "eval_runtime": 0.6276, "eval_samples_per_second": 7.967, "eval_steps_per_second": 3.187, "epoch": 94.68085106382979, "step": 8900}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 94.0, "global_step": 8836, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 8.11540747911168e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.0016429867828264832, "learning_rate": 2.836879432624114e-05, "epoch": 93.61702127659575, "step": 8800}, {"eval_loss": 4.116238117218018, "eval_runtime": 0.6252, "eval_samples_per_second": 7.998, "eval_steps_per_second": 3.199, "epoch": 93.61702127659575, "step": 8800}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 93.0, "global_step": 8742, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 8.02318693957632e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.0015919277211651206, "learning_rate": 3.309692671394799e-05, "epoch": 92.55319148936171, "step": 8700}, {"eval_loss": 4.1118855476379395, "eval_runtime": 0.6253, "eval_samples_per_second": 7.996, "eval_steps_per_second": 3.198, "epoch": 92.55319148936171, "step": 8700}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 92.0, "global_step": 8648, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.93096640004096e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.0037659837398678064, "learning_rate": 3.782505910165485e-05, "epoch": 91.48936170212765, "step": 8600}, {"eval_loss": 4.105937480926514, "eval_runtime": 0.6254, "eval_samples_per_second": 7.995, "eval_steps_per_second": 3.198, "epoch": 91.48936170212765, "step": 8600}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 91.0, "global_step": 8554, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.8387458605056e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.011060199700295925, "learning_rate": 4.2553191489361704e-05, "epoch": 90.42553191489361, "step": 8500}, {"eval_loss": 4.101666450500488, "eval_runtime": 0.627, "eval_samples_per_second": 7.975, "eval_steps_per_second": 3.19, "epoch": 90.42553191489361, "step": 8500}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 90.0, "global_step": 8460, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.74652532097024e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.0015391557244583964, "learning_rate": 4.728132387706856e-05, "epoch": 89.36170212765957, "step": 8400}, {"eval_loss": 4.094901084899902, "eval_runtime": 0.6248, "eval_samples_per_second": 8.003, "eval_steps_per_second": 3.201, "epoch": 89.36170212765957, "step": 8400}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 89.0, "global_step": 8366, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.65430478143488e+17, "log_history": [{"loss": 0.0028, "grad_norm": 0.014235073700547218, "learning_rate": 5.2009456264775415e-05, "epoch": 88.29787234042553, "step": 8300}, {"eval_loss": 4.088274955749512, "eval_runtime": 0.6252, "eval_samples_per_second": 7.998, "eval_steps_per_second": 3.199, "epoch": 88.29787234042553, "step": 8300}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 88.0, "global_step": 8272, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.56208424189952e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.007941348478198051, "learning_rate": 5.673758865248228e-05, "epoch": 87.23404255319149, "step": 8200}, {"eval_loss": 4.077054500579834, "eval_runtime": 0.626, "eval_samples_per_second": 7.988, "eval_steps_per_second": 3.195, "epoch": 87.23404255319149, "step": 8200}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 87.0, "global_step": 8178, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.46986370236416e+17, "log_history": [{"loss": 0.0028, "grad_norm": 0.015305789187550545, "learning_rate": 6.146572104018913e-05, "epoch": 86.17021276595744, "step": 8100}, {"eval_loss": 4.069526672363281, "eval_runtime": 0.6249, "eval_samples_per_second": 8.001, "eval_steps_per_second": 3.201, "epoch": 86.17021276595744, "step": 8100}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 86.0, "global_step": 8084, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.3776431628288e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.0018435996025800705, "learning_rate": 6.619385342789597e-05, "epoch": 85.1063829787234, "step": 8000}, {"eval_loss": 4.062919616699219, "eval_runtime": 0.6278, "eval_samples_per_second": 7.965, "eval_steps_per_second": 3.186, "epoch": 85.1063829787234, "step": 8000}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 85.0, "global_step": 7990, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.28542262329344e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.01836533285677433, "learning_rate": 7.092198581560284e-05, "epoch": 84.04255319148936, "step": 7900}, {"eval_loss": 4.0584611892700195, "eval_runtime": 0.625, "eval_samples_per_second": 8.0, "eval_steps_per_second": 3.2, "epoch": 84.04255319148936, "step": 7900}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 84.0, "global_step": 7896, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.19320208375808e+17, "log_history": [], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 83.0, "global_step": 7802, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.19320208375808e+17, "log_history": [{"loss": 0.0027, "grad_norm": 0.03406771644949913, "learning_rate": 7.56501182033097e-05, "epoch": 82.97872340425532, "step": 7800}, {"eval_loss": 4.046733856201172, "eval_runtime": 0.6287, "eval_samples_per_second": 7.953, "eval_steps_per_second": 3.181, "epoch": 82.97872340425532, "step": 7800}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 82.0, "global_step": 7708, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.10098154422272e+17, "log_history": [{"loss": 0.0028, "grad_norm": 0.0029814711306244135, "learning_rate": 8.037825059101656e-05, "epoch": 81.91489361702128, "step": 7700}, {"eval_loss": 4.016782283782959, "eval_runtime": 0.6278, "eval_samples_per_second": 7.965, "eval_steps_per_second": 3.186, "epoch": 81.91489361702128, "step": 7700}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 81.0, "global_step": 7614, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 7.00876100468736e+17, "log_history": [{"loss": 0.0028, "grad_norm": 0.0036774433683604, "learning_rate": 8.510638297872341e-05, "epoch": 80.85106382978724, "step": 7600}, {"eval_loss": 4.017739772796631, "eval_runtime": 0.6276, "eval_samples_per_second": 7.967, "eval_steps_per_second": 3.187, "epoch": 80.85106382978724, "step": 7600}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 80.0, "global_step": 7520, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.916540465152e+17, "log_history": [{"loss": 0.003, "grad_norm": 0.007182097993791103, "learning_rate": 8.983451536643026e-05, "epoch": 79.7872340425532, "step": 7500}, {"eval_loss": 3.9759628772735596, "eval_runtime": 0.626, "eval_samples_per_second": 7.987, "eval_steps_per_second": 3.195, "epoch": 79.7872340425532, "step": 7500}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 79.0, "global_step": 7426, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.82431992561664e+17, "log_history": [{"loss": 0.0031, "grad_norm": 0.022391272708773613, "learning_rate": 9.456264775413712e-05, "epoch": 78.72340425531915, "step": 7400}, {"eval_loss": 3.980299472808838, "eval_runtime": 0.6264, "eval_samples_per_second": 7.982, "eval_steps_per_second": 3.193, "epoch": 78.72340425531915, "step": 7400}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 78.0, "global_step": 7332, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.73209938608128e+17, "log_history": [{"loss": 0.0028, "grad_norm": 0.011058667674660683, "learning_rate": 9.929078014184398e-05, "epoch": 77.65957446808511, "step": 7300}, {"eval_loss": 4.012667655944824, "eval_runtime": 0.6267, "eval_samples_per_second": 7.978, "eval_steps_per_second": 3.191, "epoch": 77.65957446808511, "step": 7300}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 77.0, "global_step": 7238, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.63987884654592e+17, "log_history": [{"loss": 0.0029, "grad_norm": 0.00668993778526783, "learning_rate": 0.00010401891252955083, "epoch": 76.59574468085107, "step": 7200}, {"eval_loss": 3.99019193649292, "eval_runtime": 0.6367, "eval_samples_per_second": 7.854, "eval_steps_per_second": 3.141, "epoch": 76.59574468085107, "step": 7200}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 76.0, "global_step": 7144, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.54765830701056e+17, "log_history": [{"loss": 0.003, "grad_norm": 0.015763597562909126, "learning_rate": 0.00010874704491725769, "epoch": 75.53191489361703, "step": 7100}, {"eval_loss": 3.9878220558166504, "eval_runtime": 0.6263, "eval_samples_per_second": 7.983, "eval_steps_per_second": 3.193, "epoch": 75.53191489361703, "step": 7100}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 75.0, "global_step": 7050, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.4554377674752e+17, "log_history": [{"loss": 0.0034, "grad_norm": 0.029084505513310432, "learning_rate": 0.00011347517730496455, "epoch": 74.46808510638297, "step": 7000}, {"eval_loss": 3.9317474365234375, "eval_runtime": 0.6271, "eval_samples_per_second": 7.973, "eval_steps_per_second": 3.189, "epoch": 74.46808510638297, "step": 7000}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 74.0, "global_step": 6956, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.36321722793984e+17, "log_history": [{"loss": 0.0033, "grad_norm": 0.15208174288272858, "learning_rate": 0.00011820330969267139, "epoch": 73.40425531914893, "step": 6900}, {"eval_loss": 3.8778324127197266, "eval_runtime": 0.6261, "eval_samples_per_second": 7.986, "eval_steps_per_second": 3.195, "epoch": 73.40425531914893, "step": 6900}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 73.0, "global_step": 6862, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.27099668840448e+17, "log_history": [{"loss": 0.003, "grad_norm": 0.026165582239627838, "learning_rate": 0.00012293144208037825, "epoch": 72.34042553191489, "step": 6800}, {"eval_loss": 3.975142240524292, "eval_runtime": 0.6254, "eval_samples_per_second": 7.995, "eval_steps_per_second": 3.198, "epoch": 72.34042553191489, "step": 6800}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 72.0, "global_step": 6768, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.17877614886912e+17, "log_history": [{"loss": 0.0031, "grad_norm": 0.011204049922525883, "learning_rate": 0.00012765957446808513, "epoch": 71.27659574468085, "step": 6700}, {"eval_loss": 3.9283180236816406, "eval_runtime": 0.6255, "eval_samples_per_second": 7.994, "eval_steps_per_second": 3.198, "epoch": 71.27659574468085, "step": 6700}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 71.0, "global_step": 6674, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 6.08655560933376e+17, "log_history": [{"loss": 0.0032, "grad_norm": 0.04076816886663437, "learning_rate": 0.00013238770685579195, "epoch": 70.2127659574468, "step": 6600}, {"eval_loss": 3.942195415496826, "eval_runtime": 0.6254, "eval_samples_per_second": 7.994, "eval_steps_per_second": 3.198, "epoch": 70.2127659574468, "step": 6600}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 70.0, "global_step": 6580, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.9943350697984e+17, "log_history": [{"loss": 0.0032, "grad_norm": 0.027784479781985283, "learning_rate": 0.00013711583924349882, "epoch": 69.14893617021276, "step": 6500}, {"eval_loss": 3.918938398361206, "eval_runtime": 0.626, "eval_samples_per_second": 7.987, "eval_steps_per_second": 3.195, "epoch": 69.14893617021276, "step": 6500}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 69.0, "global_step": 6486, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.90211453026304e+17, "log_history": [{"loss": 0.0038, "grad_norm": 0.1203397586941719, "learning_rate": 0.00014184397163120567, "epoch": 68.08510638297872, "step": 6400}, {"eval_loss": 3.8906161785125732, "eval_runtime": 0.6252, "eval_samples_per_second": 7.998, "eval_steps_per_second": 3.199, "epoch": 68.08510638297872, "step": 6400}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 68.0, "global_step": 6392, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.80989399072768e+17, "log_history": [{"loss": 0.0036, "grad_norm": 0.004219126887619495, "learning_rate": 0.00014657210401891252, "epoch": 67.02127659574468, "step": 6300}, {"eval_loss": 3.8358912467956543, "eval_runtime": 0.6241, "eval_samples_per_second": 8.012, "eval_steps_per_second": 3.205, "epoch": 67.02127659574468, "step": 6300}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 67.0, "global_step": 6298, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.71767345119232e+17, "log_history": [], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 66.0, "global_step": 6204, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.71767345119232e+17, "log_history": [{"loss": 0.0035, "grad_norm": 0.21429955959320068, "learning_rate": 0.0001513002364066194, "epoch": 65.95744680851064, "step": 6200}, {"eval_loss": 3.8884406089782715, "eval_runtime": 0.6283, "eval_samples_per_second": 7.958, "eval_steps_per_second": 3.183, "epoch": 65.95744680851064, "step": 6200}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 65.0, "global_step": 6110, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.62545291165696e+17, "log_history": [{"loss": 0.0039, "grad_norm": 0.1099667027592659, "learning_rate": 0.00015602836879432625, "epoch": 64.8936170212766, "step": 6100}, {"eval_loss": 3.8296501636505127, "eval_runtime": 0.6268, "eval_samples_per_second": 7.978, "eval_steps_per_second": 3.191, "epoch": 64.8936170212766, "step": 6100}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 64.0, "global_step": 6016, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.5332323721216e+17, "log_history": [{"loss": 0.0038, "grad_norm": 0.028303222730755806, "learning_rate": 0.00016075650118203312, "epoch": 63.829787234042556, "step": 6000}, {"eval_loss": 3.8620095252990723, "eval_runtime": 0.6272, "eval_samples_per_second": 7.972, "eval_steps_per_second": 3.189, "epoch": 63.829787234042556, "step": 6000}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 63.0, "global_step": 5922, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.44101183258624e+17, "log_history": [{"loss": 0.0037, "grad_norm": 0.068692147731781, "learning_rate": 0.00016548463356973994, "epoch": 62.765957446808514, "step": 5900}, {"eval_loss": 3.8434479236602783, "eval_runtime": 0.6278, "eval_samples_per_second": 7.964, "eval_steps_per_second": 3.186, "epoch": 62.765957446808514, "step": 5900}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 62.0, "global_step": 5828, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.34879129305088e+17, "log_history": [{"loss": 0.0036, "grad_norm": 0.02571929432451725, "learning_rate": 0.00017021276595744682, "epoch": 61.702127659574465, "step": 5800}, {"eval_loss": 3.850118637084961, "eval_runtime": 0.6283, "eval_samples_per_second": 7.958, "eval_steps_per_second": 3.183, "epoch": 61.702127659574465, "step": 5800}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 61.0, "global_step": 5734, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.25657075351552e+17, "log_history": [{"loss": 0.0038, "grad_norm": 0.010136082768440247, "learning_rate": 0.0001749408983451537, "epoch": 60.638297872340424, "step": 5700}, {"eval_loss": 3.870070219039917, "eval_runtime": 0.6265, "eval_samples_per_second": 7.981, "eval_steps_per_second": 3.193, "epoch": 60.638297872340424, "step": 5700}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 60.0, "global_step": 5640, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.16435021398016e+17, "log_history": [{"loss": 0.0033, "grad_norm": 0.17537516355514526, "learning_rate": 0.00017966903073286051, "epoch": 59.57446808510638, "step": 5600}, {"eval_loss": 3.8757247924804688, "eval_runtime": 0.6272, "eval_samples_per_second": 7.972, "eval_steps_per_second": 3.189, "epoch": 59.57446808510638, "step": 5600}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 59.0, "global_step": 5546, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 5.0721296744448e+17, "log_history": [{"loss": 0.0032, "grad_norm": 0.005753560457378626, "learning_rate": 0.0001843971631205674, "epoch": 58.51063829787234, "step": 5500}, {"eval_loss": 3.8856005668640137, "eval_runtime": 0.6268, "eval_samples_per_second": 7.978, "eval_steps_per_second": 3.191, "epoch": 58.51063829787234, "step": 5500}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 58.0, "global_step": 5452, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.97990913490944e+17, "log_history": [{"loss": 0.0032, "grad_norm": 0.005327151156961918, "learning_rate": 0.00018912529550827424, "epoch": 57.4468085106383, "step": 5400}, {"eval_loss": 3.890810012817383, "eval_runtime": 0.6261, "eval_samples_per_second": 7.986, "eval_steps_per_second": 3.195, "epoch": 57.4468085106383, "step": 5400}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 57.0, "global_step": 5358, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.88768859537408e+17, "log_history": [{"loss": 0.0033, "grad_norm": 0.02381683699786663, "learning_rate": 0.0001938534278959811, "epoch": 56.38297872340426, "step": 5300}, {"eval_loss": 3.8764052391052246, "eval_runtime": 0.6263, "eval_samples_per_second": 7.983, "eval_steps_per_second": 3.193, "epoch": 56.38297872340426, "step": 5300}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 56.0, "global_step": 5264, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.79546805583872e+17, "log_history": [{"loss": 0.0033, "grad_norm": 0.03640938550233841, "learning_rate": 0.00019858156028368796, "epoch": 55.319148936170215, "step": 5200}, {"eval_loss": 3.858956813812256, "eval_runtime": 0.6257, "eval_samples_per_second": 7.992, "eval_steps_per_second": 3.197, "epoch": 55.319148936170215, "step": 5200}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 55.0, "global_step": 5170, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.70324751630336e+17, "log_history": [{"loss": 0.0033, "grad_norm": 0.024650810286402702, "learning_rate": 0.00020330969267139478, "epoch": 54.255319148936174, "step": 5100}, {"eval_loss": 3.8754374980926514, "eval_runtime": 0.6261, "eval_samples_per_second": 7.986, "eval_steps_per_second": 3.194, "epoch": 54.255319148936174, "step": 5100}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 54.0, "global_step": 5076, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.611026976768e+17, "log_history": [{"loss": 0.0039, "grad_norm": 0.008501242846250534, "learning_rate": 0.00020803782505910166, "epoch": 53.191489361702125, "step": 5000}, {"eval_loss": 3.802658796310425, "eval_runtime": 0.6251, "eval_samples_per_second": 7.999, "eval_steps_per_second": 3.2, "epoch": 53.191489361702125, "step": 5000}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 53.0, "global_step": 4982, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.51880643723264e+17, "log_history": [{"loss": 0.0038, "grad_norm": 0.12982383370399475, "learning_rate": 0.0002127659574468085, "epoch": 52.12765957446808, "step": 4900}, {"eval_loss": 3.8134658336639404, "eval_runtime": 0.6238, "eval_samples_per_second": 8.015, "eval_steps_per_second": 3.206, "epoch": 52.12765957446808, "step": 4900}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 52.0, "global_step": 4888, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.42658589769728e+17, "log_history": [{"loss": 0.0048, "grad_norm": 0.021629171445965767, "learning_rate": 0.00021749408983451538, "epoch": 51.06382978723404, "step": 4800}, {"eval_loss": 3.7666335105895996, "eval_runtime": 0.6223, "eval_samples_per_second": 8.034, "eval_steps_per_second": 3.214, "epoch": 51.06382978723404, "step": 4800}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 51.0, "global_step": 4794, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.33436535816192e+17, "log_history": [], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
{"epoch": 50.0, "global_step": 4700, "max_steps": 9400, "logging_steps": 100, "eval_steps": 100, "save_steps": 500, "train_batch_size": 1, "num_train_epochs": 100, "num_input_tokens_seen": 0, "total_flos": 4.33436535816192e+17, "log_history": [{"loss": 0.0063, "grad_norm": 0.10369780659675598, "learning_rate": 0.00022222222222222223, "epoch": 50.0, "step": 4700}, {"eval_loss": 3.6965904235839844, "eval_runtime": 0.6254, "eval_samples_per_second": 7.995, "eval_steps_per_second": 3.198, "epoch": 50.0, "step": 4700}], "best_metric": null, "best_model_checkpoint": null, "is_local_process_zero": true, "is_world_process_zero": true, "is_hyper_param_search": false, "trial_name": null, "trial_params": null, "stateful_callbacks": {"TrainerControl": {"args": {"should_training_stop": false, "should_epoch_stop": false, "should_save": true, "should_evaluate": false, "should_log": false}, "attributes": {}}}} (Trained with Unsloth)
