{ "best_global_step": 14000, "best_metric": 0.8463211795322131, "best_model_checkpoint": "xnli-xlm-roberta-base/checkpoint-10000", "epoch": 3.0, "eval_steps": 1000, "global_step": 18408, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.16297262059973924, "grad_norm": 10.51728343963623, "learning_rate": 1.8081447963800906e-05, "loss": 0.9575, "step": 1000 }, { "epoch": 0.16297262059973924, "eval_accuracy": 0.7164658634538152, "eval_loss": 0.6793871521949768, "eval_macro_f1": 0.7179694771560841, "eval_macro_precision": 0.7238898844951175, "eval_macro_recall": 0.7164658634538151, "eval_runtime": 4.5345, "eval_samples_per_second": 549.125, "eval_steps_per_second": 8.601, "eval_weighted_f1": 0.7179694771560841, "step": 1000 }, { "epoch": 0.3259452411994785, "grad_norm": 6.724602699279785, "learning_rate": 1.8966653181529214e-05, "loss": 0.6483, "step": 2000 }, { "epoch": 0.3259452411994785, "eval_accuracy": 0.7967871485943775, "eval_loss": 0.5350644588470459, "eval_macro_f1": 0.7972864852344191, "eval_macro_precision": 0.8018465694414347, "eval_macro_recall": 0.7967871485943775, "eval_runtime": 4.5631, "eval_samples_per_second": 545.684, "eval_steps_per_second": 8.547, "eval_weighted_f1": 0.7972864852344191, "step": 2000 }, { "epoch": 0.48891786179921776, "grad_norm": 6.1638946533203125, "learning_rate": 1.781078425706525e-05, "loss": 0.5616, "step": 3000 }, { "epoch": 0.48891786179921776, "eval_accuracy": 0.7947791164658634, "eval_loss": 0.509804368019104, "eval_macro_f1": 0.7951670773482286, "eval_macro_precision": 0.8064539329297533, "eval_macro_recall": 0.7947791164658634, "eval_runtime": 4.6567, "eval_samples_per_second": 534.712, "eval_steps_per_second": 8.375, "eval_weighted_f1": 0.7951670773482287, "step": 3000 }, { "epoch": 0.651890482398957, "grad_norm": 5.407867908477783, "learning_rate": 1.6654915332601286e-05, "loss": 0.5226, "step": 4000 }, { "epoch": 0.651890482398957, "eval_accuracy": 0.8004016064257028, "eval_loss": 0.49269911646842957, "eval_macro_f1": 0.8015680893541245, "eval_macro_precision": 0.8123398526926758, "eval_macro_recall": 0.8004016064257028, "eval_runtime": 4.6437, "eval_samples_per_second": 536.212, "eval_steps_per_second": 8.399, "eval_weighted_f1": 0.8015680893541245, "step": 4000 }, { "epoch": 0.8148631029986962, "grad_norm": 8.23536205291748, "learning_rate": 1.549904640813732e-05, "loss": 0.4966, "step": 5000 }, { "epoch": 0.8148631029986962, "eval_accuracy": 0.8124497991967872, "eval_loss": 0.480131596326828, "eval_macro_f1": 0.8128197553956924, "eval_macro_precision": 0.8202401283021422, "eval_macro_recall": 0.8124497991967873, "eval_runtime": 4.5688, "eval_samples_per_second": 545.006, "eval_steps_per_second": 8.536, "eval_weighted_f1": 0.8128197553956925, "step": 5000 }, { "epoch": 0.9778357235984355, "grad_norm": 9.736433029174805, "learning_rate": 1.4343177483673352e-05, "loss": 0.4799, "step": 6000 }, { "epoch": 0.9778357235984355, "eval_accuracy": 0.8092369477911646, "eval_loss": 0.4666927456855774, "eval_macro_f1": 0.8108832750227813, "eval_macro_precision": 0.8254810350822899, "eval_macro_recall": 0.8092369477911646, "eval_runtime": 4.542, "eval_samples_per_second": 548.221, "eval_steps_per_second": 8.587, "eval_weighted_f1": 0.8108832750227812, "step": 6000 }, { "epoch": 1.1408083441981747, "grad_norm": 8.493484497070312, "learning_rate": 1.3187308559209387e-05, "loss": 0.4251, "step": 7000 }, { "epoch": 1.1408083441981747, "eval_accuracy": 0.8180722891566266, "eval_loss": 0.45433178544044495, "eval_macro_f1": 0.8191191956693326, "eval_macro_precision": 0.8269376625195844, "eval_macro_recall": 0.8180722891566266, "eval_runtime": 4.4157, "eval_samples_per_second": 563.894, "eval_steps_per_second": 8.832, "eval_weighted_f1": 0.8191191956693327, "step": 7000 }, { "epoch": 1.303780964797914, "grad_norm": 9.21502685546875, "learning_rate": 1.2031439634745421e-05, "loss": 0.4186, "step": 8000 }, { "epoch": 1.303780964797914, "eval_accuracy": 0.8176706827309237, "eval_loss": 0.46454402804374695, "eval_macro_f1": 0.8173393684861902, "eval_macro_precision": 0.8258790100555838, "eval_macro_recall": 0.8176706827309238, "eval_runtime": 4.6094, "eval_samples_per_second": 540.202, "eval_steps_per_second": 8.461, "eval_weighted_f1": 0.8173393684861902, "step": 8000 }, { "epoch": 1.4667535853976532, "grad_norm": 7.096667289733887, "learning_rate": 1.0875570710281456e-05, "loss": 0.4129, "step": 9000 }, { "epoch": 1.4667535853976532, "eval_accuracy": 0.8257028112449799, "eval_loss": 0.44398775696754456, "eval_macro_f1": 0.8268290877462207, "eval_macro_precision": 0.8358894256319416, "eval_macro_recall": 0.8257028112449799, "eval_runtime": 4.7765, "eval_samples_per_second": 521.303, "eval_steps_per_second": 8.165, "eval_weighted_f1": 0.8268290877462207, "step": 9000 }, { "epoch": 1.6297262059973925, "grad_norm": 6.999719142913818, "learning_rate": 9.719701785817489e-06, "loss": 0.4053, "step": 10000 }, { "epoch": 1.6297262059973925, "eval_accuracy": 0.8309236947791164, "eval_loss": 0.4421282708644867, "eval_macro_f1": 0.8314919406349293, "eval_macro_precision": 0.836586446573221, "eval_macro_recall": 0.8309236947791164, "eval_runtime": 4.5642, "eval_samples_per_second": 545.553, "eval_steps_per_second": 8.545, "eval_weighted_f1": 0.8314919406349294, "step": 10000 }, { "epoch": 1.7926988265971318, "grad_norm": 7.709704399108887, "learning_rate": 8.563832861353523e-06, "loss": 0.3971, "step": 11000 }, { "epoch": 1.7926988265971318, "eval_accuracy": 0.8248995983935743, "eval_loss": 0.4437423646450043, "eval_macro_f1": 0.825940758187211, "eval_macro_precision": 0.8357952618825585, "eval_macro_recall": 0.8248995983935744, "eval_runtime": 4.5323, "eval_samples_per_second": 549.394, "eval_steps_per_second": 8.605, "eval_weighted_f1": 0.8259407581872109, "step": 11000 }, { "epoch": 1.9556714471968708, "grad_norm": 5.534423828125, "learning_rate": 7.407963936889557e-06, "loss": 0.3947, "step": 12000 }, { "epoch": 1.9556714471968708, "eval_accuracy": 0.834136546184739, "eval_loss": 0.4154554307460785, "eval_macro_f1": 0.8350152412898564, "eval_macro_precision": 0.8416677147812893, "eval_macro_recall": 0.8341365461847389, "eval_runtime": 4.5044, "eval_samples_per_second": 552.797, "eval_steps_per_second": 8.658, "eval_weighted_f1": 0.8350152412898562, "step": 12000 }, { "epoch": 2.1186440677966103, "grad_norm": 6.122025489807129, "learning_rate": 6.252095012425592e-06, "loss": 0.3437, "step": 13000 }, { "epoch": 2.1186440677966103, "eval_accuracy": 0.8236947791164658, "eval_loss": 0.4527803659439087, "eval_macro_f1": 0.8249615968184654, "eval_macro_precision": 0.8339980704173974, "eval_macro_recall": 0.8236947791164658, "eval_runtime": 4.5511, "eval_samples_per_second": 547.117, "eval_steps_per_second": 8.569, "eval_weighted_f1": 0.8249615968184654, "step": 13000 }, { "epoch": 2.2816166883963493, "grad_norm": 10.657154083251953, "learning_rate": 5.096226087961625e-06, "loss": 0.3296, "step": 14000 }, { "epoch": 2.2816166883963493, "eval_accuracy": 0.8461847389558232, "eval_loss": 0.4210074543952942, "eval_macro_f1": 0.8463211795322131, "eval_macro_precision": 0.8503350839590045, "eval_macro_recall": 0.8461847389558232, "eval_runtime": 4.5213, "eval_samples_per_second": 550.73, "eval_steps_per_second": 8.626, "eval_weighted_f1": 0.846321179532213, "step": 14000 }, { "epoch": 2.444589308996089, "grad_norm": 7.961305141448975, "learning_rate": 3.940357163497659e-06, "loss": 0.3219, "step": 15000 }, { "epoch": 2.444589308996089, "eval_accuracy": 0.8337349397590361, "eval_loss": 0.4486163258552551, "eval_macro_f1": 0.8349888002365645, "eval_macro_precision": 0.8443748814531276, "eval_macro_recall": 0.8337349397590362, "eval_runtime": 4.5481, "eval_samples_per_second": 547.482, "eval_steps_per_second": 8.575, "eval_weighted_f1": 0.8349888002365645, "step": 15000 }, { "epoch": 2.607561929595828, "grad_norm": 7.545483589172363, "learning_rate": 2.7844882390336937e-06, "loss": 0.3241, "step": 16000 }, { "epoch": 2.607561929595828, "eval_accuracy": 0.8333333333333334, "eval_loss": 0.46160411834716797, "eval_macro_f1": 0.8337624688566216, "eval_macro_precision": 0.8404933913764827, "eval_macro_recall": 0.8333333333333334, "eval_runtime": 4.5462, "eval_samples_per_second": 547.708, "eval_steps_per_second": 8.579, "eval_weighted_f1": 0.8337624688566218, "step": 16000 }, { "epoch": 2.770534550195567, "grad_norm": 7.061276435852051, "learning_rate": 1.6286193145697278e-06, "loss": 0.326, "step": 17000 }, { "epoch": 2.770534550195567, "eval_accuracy": 0.8345381526104417, "eval_loss": 0.4480307400226593, "eval_macro_f1": 0.8351454373443175, "eval_macro_precision": 0.8421626579409135, "eval_macro_recall": 0.8345381526104418, "eval_runtime": 4.5496, "eval_samples_per_second": 547.299, "eval_steps_per_second": 8.572, "eval_weighted_f1": 0.8351454373443173, "step": 17000 }, { "epoch": 2.9335071707953064, "grad_norm": 6.060895919799805, "learning_rate": 4.72750390105762e-07, "loss": 0.3128, "step": 18000 }, { "epoch": 2.9335071707953064, "eval_accuracy": 0.834136546184739, "eval_loss": 0.45053839683532715, "eval_macro_f1": 0.8350207810106501, "eval_macro_precision": 0.8411309111788473, "eval_macro_recall": 0.8341365461847391, "eval_runtime": 4.5608, "eval_samples_per_second": 545.951, "eval_steps_per_second": 8.551, "eval_weighted_f1": 0.8350207810106502, "step": 18000 }, { "epoch": 3.0, "step": 18408, "total_flos": 3.099754961058632e+17, "train_loss": 0.4458606608895207, "train_runtime": 5493.4622, "train_samples_per_second": 214.456, "train_steps_per_second": 3.351 } ], "logging_steps": 1000, "max_steps": 18408, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 10000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.099754961058632e+17, "train_batch_size": 64, "trial_name": null, "trial_params": null }