{ "best_global_step": 1500, "best_metric": 63.903743315508024, "best_model_checkpoint": "./whisper-tiny-maithili/checkpoint-1500", "epoch": 13.69982847341338, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.17152658662092624, "grad_norm": 18.268054962158203, "learning_rate": 1.2000000000000002e-06, "loss": 9.723193969726562, "step": 25 }, { "epoch": 0.34305317324185247, "grad_norm": 13.877284049987793, "learning_rate": 2.4500000000000003e-06, "loss": 8.318059692382812, "step": 50 }, { "epoch": 0.5145797598627787, "grad_norm": 11.479126930236816, "learning_rate": 3.7e-06, "loss": 6.970803833007812, "step": 75 }, { "epoch": 0.6861063464837049, "grad_norm": 10.104531288146973, "learning_rate": 4.95e-06, "loss": 5.796900634765625, "step": 100 }, { "epoch": 0.8576329331046312, "grad_norm": 10.247244834899902, "learning_rate": 6.200000000000001e-06, "loss": 4.848861389160156, "step": 125 }, { "epoch": 1.0274442538593482, "grad_norm": 7.673226356506348, "learning_rate": 7.450000000000001e-06, "loss": 3.985304870605469, "step": 150 }, { "epoch": 1.1989708404802744, "grad_norm": 7.689826488494873, "learning_rate": 8.700000000000001e-06, "loss": 3.524297180175781, "step": 175 }, { "epoch": 1.3704974271012007, "grad_norm": 8.599395751953125, "learning_rate": 9.950000000000001e-06, "loss": 3.220665283203125, "step": 200 }, { "epoch": 1.542024013722127, "grad_norm": 8.532909393310547, "learning_rate": 9.866666666666668e-06, "loss": 3.0051885986328126, "step": 225 }, { "epoch": 1.7135506003430532, "grad_norm": 8.584299087524414, "learning_rate": 9.727777777777777e-06, "loss": 2.7648504638671874, "step": 250 }, { "epoch": 1.8850771869639793, "grad_norm": 8.186919212341309, "learning_rate": 9.58888888888889e-06, "loss": 2.6434637451171876, "step": 275 }, { "epoch": 2.0548885077186965, "grad_norm": 7.06594181060791, "learning_rate": 9.450000000000001e-06, "loss": 2.485320739746094, "step": 300 }, { "epoch": 2.2264150943396226, "grad_norm": 7.2849907875061035, "learning_rate": 9.311111111111112e-06, "loss": 2.2979925537109374, "step": 325 }, { "epoch": 2.3979416809605487, "grad_norm": 7.386153221130371, "learning_rate": 9.172222222222223e-06, "loss": 2.249031982421875, "step": 350 }, { "epoch": 2.5694682675814753, "grad_norm": 8.004015922546387, "learning_rate": 9.033333333333334e-06, "loss": 2.181380310058594, "step": 375 }, { "epoch": 2.7409948542024014, "grad_norm": 6.979090213775635, "learning_rate": 8.894444444444445e-06, "loss": 2.1656195068359376, "step": 400 }, { "epoch": 2.9125214408233275, "grad_norm": 6.589767932891846, "learning_rate": 8.755555555555556e-06, "loss": 2.2088014221191408, "step": 425 }, { "epoch": 3.0823327615780447, "grad_norm": 8.118329048156738, "learning_rate": 8.616666666666668e-06, "loss": 2.0147331237792967, "step": 450 }, { "epoch": 3.253859348198971, "grad_norm": 7.051534652709961, "learning_rate": 8.477777777777778e-06, "loss": 1.896328887939453, "step": 475 }, { "epoch": 3.425385934819897, "grad_norm": 6.275884628295898, "learning_rate": 8.33888888888889e-06, "loss": 1.886772918701172, "step": 500 }, { "epoch": 3.425385934819897, "eval_loss": 0.5728768110275269, "eval_runtime": 92.9426, "eval_samples_per_second": 2.797, "eval_steps_per_second": 0.699, "eval_wer": 68.77599524658348, "step": 500 }, { "epoch": 3.5969125214408235, "grad_norm": 7.222710609436035, "learning_rate": 8.2e-06, "loss": 1.8691773986816407, "step": 525 }, { "epoch": 3.7684391080617496, "grad_norm": 6.063198566436768, "learning_rate": 8.061111111111112e-06, "loss": 1.8207814025878906, "step": 550 }, { "epoch": 3.9399656946826758, "grad_norm": 6.641396522521973, "learning_rate": 7.922222222222223e-06, "loss": 1.7857606506347656, "step": 575 }, { "epoch": 4.109777015437393, "grad_norm": 6.6834397315979, "learning_rate": 7.783333333333334e-06, "loss": 1.713679656982422, "step": 600 }, { "epoch": 4.281303602058319, "grad_norm": 6.873757362365723, "learning_rate": 7.644444444444445e-06, "loss": 1.6278848266601562, "step": 625 }, { "epoch": 4.452830188679245, "grad_norm": 6.53254508972168, "learning_rate": 7.505555555555556e-06, "loss": 1.5813905334472655, "step": 650 }, { "epoch": 4.624356775300171, "grad_norm": 7.650671482086182, "learning_rate": 7.3666666666666676e-06, "loss": 1.6567597961425782, "step": 675 }, { "epoch": 4.795883361921097, "grad_norm": 6.784526348114014, "learning_rate": 7.227777777777778e-06, "loss": 1.6283486938476563, "step": 700 }, { "epoch": 4.967409948542024, "grad_norm": 7.425609588623047, "learning_rate": 7.0888888888888894e-06, "loss": 1.580086669921875, "step": 725 }, { "epoch": 5.137221269296741, "grad_norm": 7.560032367706299, "learning_rate": 6.95e-06, "loss": 1.4196165466308595, "step": 750 }, { "epoch": 5.308747855917667, "grad_norm": 7.114623069763184, "learning_rate": 6.811111111111111e-06, "loss": 1.4393228149414063, "step": 775 }, { "epoch": 5.480274442538594, "grad_norm": 6.174019813537598, "learning_rate": 6.672222222222223e-06, "loss": 1.4180364990234375, "step": 800 }, { "epoch": 5.65180102915952, "grad_norm": 6.444286346435547, "learning_rate": 6.533333333333334e-06, "loss": 1.4367037963867189, "step": 825 }, { "epoch": 5.823327615780446, "grad_norm": 6.457458019256592, "learning_rate": 6.394444444444445e-06, "loss": 1.4541001892089844, "step": 850 }, { "epoch": 5.994854202401372, "grad_norm": 6.65748929977417, "learning_rate": 6.255555555555556e-06, "loss": 1.4775286865234376, "step": 875 }, { "epoch": 6.164665523156089, "grad_norm": 6.2816057205200195, "learning_rate": 6.116666666666668e-06, "loss": 1.2730085754394531, "step": 900 }, { "epoch": 6.3361921097770155, "grad_norm": 6.40878963470459, "learning_rate": 5.977777777777778e-06, "loss": 1.2837075805664062, "step": 925 }, { "epoch": 6.507718696397942, "grad_norm": 6.427629470825195, "learning_rate": 5.8388888888888895e-06, "loss": 1.2479456329345704, "step": 950 }, { "epoch": 6.679245283018868, "grad_norm": 5.938961982727051, "learning_rate": 5.7e-06, "loss": 1.3641961669921876, "step": 975 }, { "epoch": 6.850771869639794, "grad_norm": 6.981799125671387, "learning_rate": 5.561111111111111e-06, "loss": 1.2829299926757813, "step": 1000 }, { "epoch": 6.850771869639794, "eval_loss": 0.5365099906921387, "eval_runtime": 92.6416, "eval_samples_per_second": 2.807, "eval_steps_per_second": 0.702, "eval_wer": 64.67617349970291, "step": 1000 }, { "epoch": 7.020583190394511, "grad_norm": 6.462595462799072, "learning_rate": 5.422222222222223e-06, "loss": 1.266632080078125, "step": 1025 }, { "epoch": 7.192109777015437, "grad_norm": 6.442847728729248, "learning_rate": 5.283333333333333e-06, "loss": 1.1616410827636718, "step": 1050 }, { "epoch": 7.363636363636363, "grad_norm": 5.910035133361816, "learning_rate": 5.144444444444445e-06, "loss": 1.1423403167724608, "step": 1075 }, { "epoch": 7.535162950257289, "grad_norm": 6.2111334800720215, "learning_rate": 5.005555555555556e-06, "loss": 1.1994317626953126, "step": 1100 }, { "epoch": 7.7066895368782165, "grad_norm": 5.6760783195495605, "learning_rate": 4.866666666666667e-06, "loss": 1.1873680877685546, "step": 1125 }, { "epoch": 7.878216123499143, "grad_norm": 6.996194839477539, "learning_rate": 4.727777777777779e-06, "loss": 1.1682706451416016, "step": 1150 }, { "epoch": 8.04802744425386, "grad_norm": 5.388121604919434, "learning_rate": 4.58888888888889e-06, "loss": 1.1501982879638672, "step": 1175 }, { "epoch": 8.219554030874786, "grad_norm": 6.324208736419678, "learning_rate": 4.450000000000001e-06, "loss": 1.0414784240722657, "step": 1200 }, { "epoch": 8.391080617495712, "grad_norm": 6.224495887756348, "learning_rate": 4.3111111111111115e-06, "loss": 1.0576978302001954, "step": 1225 }, { "epoch": 8.562607204116638, "grad_norm": 5.9399094581604, "learning_rate": 4.1722222222222225e-06, "loss": 1.0483750915527343, "step": 1250 }, { "epoch": 8.734133790737564, "grad_norm": 6.331912994384766, "learning_rate": 4.033333333333333e-06, "loss": 1.0921112060546876, "step": 1275 }, { "epoch": 8.90566037735849, "grad_norm": 7.319565296173096, "learning_rate": 3.894444444444444e-06, "loss": 1.0816537475585937, "step": 1300 }, { "epoch": 9.075471698113208, "grad_norm": 6.406201362609863, "learning_rate": 3.7555555555555557e-06, "loss": 1.0307456207275392, "step": 1325 }, { "epoch": 9.246998284734135, "grad_norm": 6.348610877990723, "learning_rate": 3.616666666666667e-06, "loss": 0.9632396697998047, "step": 1350 }, { "epoch": 9.41852487135506, "grad_norm": 6.033849239349365, "learning_rate": 3.4777777777777784e-06, "loss": 0.9932768249511719, "step": 1375 }, { "epoch": 9.590051457975987, "grad_norm": 6.423510551452637, "learning_rate": 3.3388888888888893e-06, "loss": 0.978936538696289, "step": 1400 }, { "epoch": 9.761578044596913, "grad_norm": 5.581418514251709, "learning_rate": 3.2000000000000003e-06, "loss": 0.9529872894287109, "step": 1425 }, { "epoch": 9.933104631217839, "grad_norm": 7.128633499145508, "learning_rate": 3.0611111111111112e-06, "loss": 1.00614990234375, "step": 1450 }, { "epoch": 10.102915951972555, "grad_norm": 6.873051643371582, "learning_rate": 2.9222222222222226e-06, "loss": 0.9351605224609375, "step": 1475 }, { "epoch": 10.274442538593481, "grad_norm": 6.594143390655518, "learning_rate": 2.7833333333333335e-06, "loss": 0.8834098815917969, "step": 1500 }, { "epoch": 10.274442538593481, "eval_loss": 0.5569483637809753, "eval_runtime": 93.3641, "eval_samples_per_second": 2.785, "eval_steps_per_second": 0.696, "eval_wer": 63.903743315508024, "step": 1500 }, { "epoch": 10.445969125214408, "grad_norm": 6.543798446655273, "learning_rate": 2.6444444444444444e-06, "loss": 0.9357952880859375, "step": 1525 }, { "epoch": 10.617495711835334, "grad_norm": 5.903841018676758, "learning_rate": 2.5055555555555554e-06, "loss": 0.8977721405029296, "step": 1550 }, { "epoch": 10.78902229845626, "grad_norm": 5.874545574188232, "learning_rate": 2.3666666666666667e-06, "loss": 0.8883360290527343, "step": 1575 }, { "epoch": 10.960548885077188, "grad_norm": 6.661474227905273, "learning_rate": 2.2277777777777777e-06, "loss": 0.920865249633789, "step": 1600 }, { "epoch": 11.130360205831904, "grad_norm": 5.809503555297852, "learning_rate": 2.088888888888889e-06, "loss": 0.8493796539306641, "step": 1625 }, { "epoch": 11.30188679245283, "grad_norm": 5.753544807434082, "learning_rate": 1.9500000000000004e-06, "loss": 0.825905532836914, "step": 1650 }, { "epoch": 11.473413379073756, "grad_norm": 6.0916972160339355, "learning_rate": 1.8111111111111113e-06, "loss": 0.8476572418212891, "step": 1675 }, { "epoch": 11.644939965694682, "grad_norm": 6.63301420211792, "learning_rate": 1.6722222222222223e-06, "loss": 0.8341015625, "step": 1700 }, { "epoch": 11.816466552315608, "grad_norm": 5.515976428985596, "learning_rate": 1.5333333333333334e-06, "loss": 0.8632970428466797, "step": 1725 }, { "epoch": 11.987993138936535, "grad_norm": 5.419062614440918, "learning_rate": 1.3944444444444446e-06, "loss": 0.8705248260498046, "step": 1750 }, { "epoch": 12.157804459691253, "grad_norm": 5.655745506286621, "learning_rate": 1.2555555555555557e-06, "loss": 0.7931866455078125, "step": 1775 }, { "epoch": 12.329331046312179, "grad_norm": 5.437541961669922, "learning_rate": 1.1166666666666666e-06, "loss": 0.813487548828125, "step": 1800 }, { "epoch": 12.500857632933105, "grad_norm": 5.816484451293945, "learning_rate": 9.77777777777778e-07, "loss": 0.8068718719482422, "step": 1825 }, { "epoch": 12.672384219554031, "grad_norm": 5.428255081176758, "learning_rate": 8.388888888888889e-07, "loss": 0.7925386810302735, "step": 1850 }, { "epoch": 12.843910806174957, "grad_norm": 5.579376220703125, "learning_rate": 7.000000000000001e-07, "loss": 0.8237639617919922, "step": 1875 }, { "epoch": 13.013722126929673, "grad_norm": 5.45307731628418, "learning_rate": 5.611111111111111e-07, "loss": 0.7975894165039062, "step": 1900 }, { "epoch": 13.1852487135506, "grad_norm": 5.217875003814697, "learning_rate": 4.2222222222222226e-07, "loss": 0.8227002716064453, "step": 1925 }, { "epoch": 13.356775300171527, "grad_norm": 5.0090155601501465, "learning_rate": 2.8333333333333336e-07, "loss": 0.7616297149658203, "step": 1950 }, { "epoch": 13.528301886792454, "grad_norm": 5.426841735839844, "learning_rate": 1.4444444444444445e-07, "loss": 0.7497710418701172, "step": 1975 }, { "epoch": 13.69982847341338, "grad_norm": 5.744300365447998, "learning_rate": 5.555555555555556e-09, "loss": 0.8125200653076172, "step": 2000 }, { "epoch": 13.69982847341338, "eval_loss": 0.5726562738418579, "eval_runtime": 93.1097, "eval_samples_per_second": 2.792, "eval_steps_per_second": 0.698, "eval_wer": 64.20083184789067, "step": 2000 } ], "logging_steps": 25, "max_steps": 2000, "num_input_tokens_seen": 0, "num_train_epochs": 14, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.8652414181376e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }