VLAC-8b / trainer_state.json
futurefantasy's picture
Upload folder using huggingface_hub
a1da91b verified
Raw
History Blame Contribute Delete
188 kB
{
"best_metric": 0.59685546,
"best_model_checkpoint": "/cpfs04/user/zhangqi/zhangqi/data/model_garden/0619_intern8b_v7-1-part15-19-resize-decay/v1-20250624-140732/checkpoint-3125",
"epoch": 0.999960001599936,
"eval_steps": 250,
"global_step": 3125,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0003199872005119795,
"grad_norm": 0.034520456918049065,
"learning_rate": 2.0000000000000002e-07,
"loss": 0.40204745531082153,
"memory(GiB)": 40.4,
"step": 1,
"token_acc": 0.8817829457364341,
"train_speed(iter/s)": 0.010771
},
{
"epoch": 0.0015999360025598975,
"grad_norm": 0.03420916628520123,
"learning_rate": 1.0000000000000002e-06,
"loss": 0.39483457803726196,
"memory(GiB)": 60.23,
"step": 5,
"token_acc": 0.9005736137667304,
"train_speed(iter/s)": 0.01352
},
{
"epoch": 0.003199872005119795,
"grad_norm": 0.03272073151772668,
"learning_rate": 2.0000000000000003e-06,
"loss": 0.39301304817199706,
"memory(GiB)": 60.23,
"step": 10,
"token_acc": 0.9103283749649173,
"train_speed(iter/s)": 0.014045
},
{
"epoch": 0.004799808007679693,
"grad_norm": 0.03294824977638289,
"learning_rate": 3e-06,
"loss": 0.38296959400177,
"memory(GiB)": 60.23,
"step": 15,
"token_acc": 0.8657198192382182,
"train_speed(iter/s)": 0.014012
},
{
"epoch": 0.00639974401023959,
"grad_norm": 0.0334494683427454,
"learning_rate": 4.000000000000001e-06,
"loss": 0.3897198915481567,
"memory(GiB)": 60.23,
"step": 20,
"token_acc": 0.8978738236319275,
"train_speed(iter/s)": 0.014066
},
{
"epoch": 0.007999680012799487,
"grad_norm": 0.03136602849258215,
"learning_rate": 5e-06,
"loss": 0.3881317138671875,
"memory(GiB)": 60.23,
"step": 25,
"token_acc": 0.9188261541101768,
"train_speed(iter/s)": 0.014214
},
{
"epoch": 0.009599616015359386,
"grad_norm": 0.03265063244675712,
"learning_rate": 6e-06,
"loss": 0.3901845693588257,
"memory(GiB)": 60.23,
"step": 30,
"token_acc": 0.896212961495801,
"train_speed(iter/s)": 0.01427
},
{
"epoch": 0.011199552017919284,
"grad_norm": 0.032203046144693825,
"learning_rate": 7e-06,
"loss": 0.3953768014907837,
"memory(GiB)": 60.23,
"step": 35,
"token_acc": 0.8888367729831145,
"train_speed(iter/s)": 0.014326
},
{
"epoch": 0.01279948802047918,
"grad_norm": 0.032390202609314425,
"learning_rate": 8.000000000000001e-06,
"loss": 0.38478689193725585,
"memory(GiB)": 60.23,
"step": 40,
"token_acc": 0.8951841359773371,
"train_speed(iter/s)": 0.014412
},
{
"epoch": 0.014399424023039079,
"grad_norm": 0.033801877503161194,
"learning_rate": 9e-06,
"loss": 0.38552730083465575,
"memory(GiB)": 60.23,
"step": 45,
"token_acc": 0.9022271714922049,
"train_speed(iter/s)": 0.014478
},
{
"epoch": 0.015999360025598975,
"grad_norm": 0.03301429535272696,
"learning_rate": 1e-05,
"loss": 0.38529186248779296,
"memory(GiB)": 60.23,
"step": 50,
"token_acc": 0.8758992805755396,
"train_speed(iter/s)": 0.014599
},
{
"epoch": 0.017599296028158875,
"grad_norm": 0.03149429825234287,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.3803748607635498,
"memory(GiB)": 76.07,
"step": 55,
"token_acc": 0.8477023180154535,
"train_speed(iter/s)": 0.014592
},
{
"epoch": 0.01919923203071877,
"grad_norm": 0.033808759949065646,
"learning_rate": 1.2e-05,
"loss": 0.3867351055145264,
"memory(GiB)": 76.07,
"step": 60,
"token_acc": 0.8850377977463986,
"train_speed(iter/s)": 0.014608
},
{
"epoch": 0.020799168033278668,
"grad_norm": 0.03275791011215982,
"learning_rate": 1.3000000000000001e-05,
"loss": 0.39216411113739014,
"memory(GiB)": 76.07,
"step": 65,
"token_acc": 0.901587826662256,
"train_speed(iter/s)": 0.014547
},
{
"epoch": 0.022399104035838568,
"grad_norm": 0.03324158836650574,
"learning_rate": 1.4e-05,
"loss": 0.3974705457687378,
"memory(GiB)": 76.07,
"step": 70,
"token_acc": 0.9116919816319322,
"train_speed(iter/s)": 0.014544
},
{
"epoch": 0.023999040038398464,
"grad_norm": 0.031459981925064155,
"learning_rate": 1.5000000000000002e-05,
"loss": 0.37577147483825685,
"memory(GiB)": 76.07,
"step": 75,
"token_acc": 0.9071523767214571,
"train_speed(iter/s)": 0.014546
},
{
"epoch": 0.02559897604095836,
"grad_norm": 0.03366771334434494,
"learning_rate": 1.6000000000000003e-05,
"loss": 0.381273889541626,
"memory(GiB)": 76.07,
"step": 80,
"token_acc": 0.8764924894081397,
"train_speed(iter/s)": 0.014586
},
{
"epoch": 0.02719891204351826,
"grad_norm": 0.033717224619741304,
"learning_rate": 1.7e-05,
"loss": 0.3805533409118652,
"memory(GiB)": 76.07,
"step": 85,
"token_acc": 0.8912507701786815,
"train_speed(iter/s)": 0.014606
},
{
"epoch": 0.028798848046078157,
"grad_norm": 0.033563527084085734,
"learning_rate": 1.8e-05,
"loss": 0.3851145029067993,
"memory(GiB)": 76.07,
"step": 90,
"token_acc": 0.8561311210036423,
"train_speed(iter/s)": 0.0146
},
{
"epoch": 0.030398784048638054,
"grad_norm": 0.03128576112566358,
"learning_rate": 1.9e-05,
"loss": 0.37614123821258544,
"memory(GiB)": 76.07,
"step": 95,
"token_acc": 0.8939516782876601,
"train_speed(iter/s)": 0.014631
},
{
"epoch": 0.03199872005119795,
"grad_norm": 0.03419951138083408,
"learning_rate": 2e-05,
"loss": 0.3880021333694458,
"memory(GiB)": 76.07,
"step": 100,
"token_acc": 0.8853078862081383,
"train_speed(iter/s)": 0.014644
},
{
"epoch": 0.03359865605375785,
"grad_norm": 0.032374666409375384,
"learning_rate": 1.9999865178850847e-05,
"loss": 0.3888866901397705,
"memory(GiB)": 76.07,
"step": 105,
"token_acc": 0.8903958366188298,
"train_speed(iter/s)": 0.014639
},
{
"epoch": 0.03519859205631775,
"grad_norm": 0.034788552767827836,
"learning_rate": 1.999946071903873e-05,
"loss": 0.38006932735443116,
"memory(GiB)": 76.07,
"step": 110,
"token_acc": 0.886074321717886,
"train_speed(iter/s)": 0.014607
},
{
"epoch": 0.03679852805887764,
"grad_norm": 0.03501245967543382,
"learning_rate": 1.9998786631469602e-05,
"loss": 0.3911449432373047,
"memory(GiB)": 76.07,
"step": 115,
"token_acc": 0.8798465266558966,
"train_speed(iter/s)": 0.014604
},
{
"epoch": 0.03839846406143754,
"grad_norm": 0.03242661684377351,
"learning_rate": 1.999784293431971e-05,
"loss": 0.3861077070236206,
"memory(GiB)": 76.07,
"step": 120,
"token_acc": 0.8665442301805938,
"train_speed(iter/s)": 0.01425
},
{
"epoch": 0.03999840006399744,
"grad_norm": 0.03463389128587641,
"learning_rate": 1.9996629653035128e-05,
"loss": 0.3905928373336792,
"memory(GiB)": 76.07,
"step": 125,
"token_acc": 0.8998435054773083,
"train_speed(iter/s)": 0.014271
},
{
"epoch": 0.041598336066557336,
"grad_norm": 0.032645290740144876,
"learning_rate": 1.999514682033104e-05,
"loss": 0.3899507761001587,
"memory(GiB)": 76.07,
"step": 130,
"token_acc": 0.8884783798576902,
"train_speed(iter/s)": 0.01428
},
{
"epoch": 0.043198272069117236,
"grad_norm": 0.033852879217125625,
"learning_rate": 1.99933944761909e-05,
"loss": 0.3912219047546387,
"memory(GiB)": 76.07,
"step": 135,
"token_acc": 0.8862394436164928,
"train_speed(iter/s)": 0.014311
},
{
"epoch": 0.044798208071677136,
"grad_norm": 0.03314594743128617,
"learning_rate": 1.999137266786531e-05,
"loss": 0.38516685962677,
"memory(GiB)": 76.07,
"step": 140,
"token_acc": 0.8981660231660231,
"train_speed(iter/s)": 0.014301
},
{
"epoch": 0.04639814407423703,
"grad_norm": 0.03523216491858916,
"learning_rate": 1.998908144987078e-05,
"loss": 0.3815142631530762,
"memory(GiB)": 76.07,
"step": 145,
"token_acc": 0.8799054994093713,
"train_speed(iter/s)": 0.014302
},
{
"epoch": 0.04799808007679693,
"grad_norm": 0.0357431601404605,
"learning_rate": 1.9986520883988233e-05,
"loss": 0.3848976373672485,
"memory(GiB)": 76.07,
"step": 150,
"token_acc": 0.8563193851409052,
"train_speed(iter/s)": 0.014282
},
{
"epoch": 0.04959801607935683,
"grad_norm": 0.03262403168423455,
"learning_rate": 1.9983691039261358e-05,
"loss": 0.3893115043640137,
"memory(GiB)": 76.07,
"step": 155,
"token_acc": 0.8972887393627548,
"train_speed(iter/s)": 0.014299
},
{
"epoch": 0.05119795208191672,
"grad_norm": 0.03531346626165974,
"learning_rate": 1.998059199199474e-05,
"loss": 0.38597636222839354,
"memory(GiB)": 76.07,
"step": 160,
"token_acc": 0.8945444319460067,
"train_speed(iter/s)": 0.014311
},
{
"epoch": 0.05279788808447662,
"grad_norm": 0.03357647993148674,
"learning_rate": 1.9977223825751802e-05,
"loss": 0.38405232429504393,
"memory(GiB)": 76.07,
"step": 165,
"token_acc": 0.9117782909930716,
"train_speed(iter/s)": 0.014301
},
{
"epoch": 0.05439782408703652,
"grad_norm": 0.03440413120355411,
"learning_rate": 1.997358663135255e-05,
"loss": 0.3781674146652222,
"memory(GiB)": 76.07,
"step": 170,
"token_acc": 0.9056845887334788,
"train_speed(iter/s)": 0.014302
},
{
"epoch": 0.055997760089596414,
"grad_norm": 0.033442118491656826,
"learning_rate": 1.9969680506871138e-05,
"loss": 0.3843045949935913,
"memory(GiB)": 76.07,
"step": 175,
"token_acc": 0.900383810188416,
"train_speed(iter/s)": 0.014315
},
{
"epoch": 0.057597696092156314,
"grad_norm": 0.033662777739076964,
"learning_rate": 1.9965505557633188e-05,
"loss": 0.389201283454895,
"memory(GiB)": 76.07,
"step": 180,
"token_acc": 0.8900032883919763,
"train_speed(iter/s)": 0.014316
},
{
"epoch": 0.059197632094716214,
"grad_norm": 0.03251706827553148,
"learning_rate": 1.9961061896213006e-05,
"loss": 0.38699405193328856,
"memory(GiB)": 76.07,
"step": 185,
"token_acc": 0.876270255424334,
"train_speed(iter/s)": 0.014313
},
{
"epoch": 0.06079756809727611,
"grad_norm": 0.03283605185775851,
"learning_rate": 1.9956349642430494e-05,
"loss": 0.3966814517974854,
"memory(GiB)": 76.07,
"step": 190,
"token_acc": 0.879168042258171,
"train_speed(iter/s)": 0.014349
},
{
"epoch": 0.06239750409983601,
"grad_norm": 0.03449933751162301,
"learning_rate": 1.9951368923347945e-05,
"loss": 0.39047400951385497,
"memory(GiB)": 76.07,
"step": 195,
"token_acc": 0.8665105386416861,
"train_speed(iter/s)": 0.014346
},
{
"epoch": 0.0639974401023959,
"grad_norm": 0.03280827137817534,
"learning_rate": 1.9946119873266615e-05,
"loss": 0.37484734058380126,
"memory(GiB)": 76.07,
"step": 200,
"token_acc": 0.9069767441860465,
"train_speed(iter/s)": 0.014353
},
{
"epoch": 0.0655973761049558,
"grad_norm": 0.03584807348524717,
"learning_rate": 1.9940602633723097e-05,
"loss": 0.3874636173248291,
"memory(GiB)": 76.07,
"step": 205,
"token_acc": 0.8897243107769424,
"train_speed(iter/s)": 0.014347
},
{
"epoch": 0.0671973121075157,
"grad_norm": 0.03414995299732699,
"learning_rate": 1.99348173534855e-05,
"loss": 0.3874980926513672,
"memory(GiB)": 76.07,
"step": 210,
"token_acc": 0.881191672648959,
"train_speed(iter/s)": 0.014354
},
{
"epoch": 0.06879724811007559,
"grad_norm": 0.03286991072544723,
"learning_rate": 1.9928764188549462e-05,
"loss": 0.38269970417022703,
"memory(GiB)": 76.07,
"step": 215,
"token_acc": 0.8929658134956148,
"train_speed(iter/s)": 0.014357
},
{
"epoch": 0.0703971841126355,
"grad_norm": 0.03359781387973185,
"learning_rate": 1.9922443302133906e-05,
"loss": 0.38327147960662844,
"memory(GiB)": 76.07,
"step": 220,
"token_acc": 0.9165275459098498,
"train_speed(iter/s)": 0.014351
},
{
"epoch": 0.07199712011519539,
"grad_norm": 0.03275039662042973,
"learning_rate": 1.9915854864676665e-05,
"loss": 0.3898788928985596,
"memory(GiB)": 76.07,
"step": 225,
"token_acc": 0.8592750533049041,
"train_speed(iter/s)": 0.014343
},
{
"epoch": 0.07359705611775529,
"grad_norm": 0.03395724860978424,
"learning_rate": 1.990899905382988e-05,
"loss": 0.3836425065994263,
"memory(GiB)": 76.07,
"step": 230,
"token_acc": 0.9050742813042639,
"train_speed(iter/s)": 0.014331
},
{
"epoch": 0.07519699212031519,
"grad_norm": 0.03323014361282172,
"learning_rate": 1.9901876054455217e-05,
"loss": 0.40008840560913084,
"memory(GiB)": 76.07,
"step": 235,
"token_acc": 0.8920118343195266,
"train_speed(iter/s)": 0.014328
},
{
"epoch": 0.07679692812287509,
"grad_norm": 0.03344217991905355,
"learning_rate": 1.9894486058618863e-05,
"loss": 0.3800571203231812,
"memory(GiB)": 76.07,
"step": 240,
"token_acc": 0.9098188751191612,
"train_speed(iter/s)": 0.014319
},
{
"epoch": 0.07839686412543498,
"grad_norm": 0.03473900387731426,
"learning_rate": 1.9886829265586368e-05,
"loss": 0.39225742816925047,
"memory(GiB)": 76.07,
"step": 245,
"token_acc": 0.8883210297179632,
"train_speed(iter/s)": 0.014313
},
{
"epoch": 0.07999680012799489,
"grad_norm": 0.03513961345431388,
"learning_rate": 1.9878905881817254e-05,
"loss": 0.3903574228286743,
"memory(GiB)": 76.07,
"step": 250,
"token_acc": 0.8576667430666972,
"train_speed(iter/s)": 0.014314
},
{
"epoch": 0.07999680012799489,
"eval_loss": 0.622439444065094,
"eval_runtime": 157.3342,
"eval_samples_per_second": 127.677,
"eval_steps_per_second": 0.642,
"eval_token_acc": 0.8873306398781322,
"step": 250
},
{
"epoch": 0.08159673613055478,
"grad_norm": 0.03372251695955875,
"learning_rate": 1.9870716120959462e-05,
"loss": 0.38556718826293945,
"memory(GiB)": 76.07,
"step": 255,
"token_acc": 0.8786027360871298,
"train_speed(iter/s)": 0.014206
},
{
"epoch": 0.08319667213311467,
"grad_norm": 0.03264986549168058,
"learning_rate": 1.986226020384359e-05,
"loss": 0.37873091697692873,
"memory(GiB)": 76.07,
"step": 260,
"token_acc": 0.889001778003556,
"train_speed(iter/s)": 0.014217
},
{
"epoch": 0.08479660813567458,
"grad_norm": 0.03141933647884167,
"learning_rate": 1.9853538358476933e-05,
"loss": 0.38749330043792723,
"memory(GiB)": 76.07,
"step": 265,
"token_acc": 0.9063093880653744,
"train_speed(iter/s)": 0.014225
},
{
"epoch": 0.08639654413823447,
"grad_norm": 0.03386011981593799,
"learning_rate": 1.9844550820037326e-05,
"loss": 0.387894868850708,
"memory(GiB)": 76.07,
"step": 270,
"token_acc": 0.8854422161304285,
"train_speed(iter/s)": 0.014241
},
{
"epoch": 0.08799648014079436,
"grad_norm": 0.03711364422068592,
"learning_rate": 1.9835297830866827e-05,
"loss": 0.38588383197784426,
"memory(GiB)": 76.07,
"step": 275,
"token_acc": 0.8868660598179454,
"train_speed(iter/s)": 0.014246
},
{
"epoch": 0.08959641614335427,
"grad_norm": 0.03341834892330089,
"learning_rate": 1.9825779640465157e-05,
"loss": 0.38894240856170653,
"memory(GiB)": 76.07,
"step": 280,
"token_acc": 0.9306718179866924,
"train_speed(iter/s)": 0.014256
},
{
"epoch": 0.09119635214591416,
"grad_norm": 0.03387819973021305,
"learning_rate": 1.9815996505483e-05,
"loss": 0.38292522430419923,
"memory(GiB)": 76.07,
"step": 285,
"token_acc": 0.8671353884982873,
"train_speed(iter/s)": 0.014257
},
{
"epoch": 0.09279628814847406,
"grad_norm": 0.03429150627328532,
"learning_rate": 1.9805948689715043e-05,
"loss": 0.376310133934021,
"memory(GiB)": 76.07,
"step": 290,
"token_acc": 0.8656910569105691,
"train_speed(iter/s)": 0.014265
},
{
"epoch": 0.09439622415103396,
"grad_norm": 0.03450246959931839,
"learning_rate": 1.979563646409291e-05,
"loss": 0.39239072799682617,
"memory(GiB)": 76.07,
"step": 295,
"token_acc": 0.8977094446187637,
"train_speed(iter/s)": 0.014273
},
{
"epoch": 0.09599616015359386,
"grad_norm": 0.031824087341643076,
"learning_rate": 1.9785060106677818e-05,
"loss": 0.3861429691314697,
"memory(GiB)": 76.07,
"step": 300,
"token_acc": 0.9000577700751011,
"train_speed(iter/s)": 0.014282
},
{
"epoch": 0.09759609615615375,
"grad_norm": 0.03346845050772549,
"learning_rate": 1.97742199026531e-05,
"loss": 0.38443379402160643,
"memory(GiB)": 76.07,
"step": 305,
"token_acc": 0.8890675241157556,
"train_speed(iter/s)": 0.014289
},
{
"epoch": 0.09919603215871366,
"grad_norm": 0.03191677416839948,
"learning_rate": 1.9763116144316506e-05,
"loss": 0.3867342948913574,
"memory(GiB)": 76.07,
"step": 310,
"token_acc": 0.8610453181746408,
"train_speed(iter/s)": 0.0143
},
{
"epoch": 0.10079596816127355,
"grad_norm": 0.03421794121376898,
"learning_rate": 1.9751749131072335e-05,
"loss": 0.38043770790100095,
"memory(GiB)": 76.07,
"step": 315,
"token_acc": 0.895057390489576,
"train_speed(iter/s)": 0.014318
},
{
"epoch": 0.10239590416383344,
"grad_norm": 0.0335963955600723,
"learning_rate": 1.9740119169423337e-05,
"loss": 0.3925303936004639,
"memory(GiB)": 76.07,
"step": 320,
"token_acc": 0.8879252835223482,
"train_speed(iter/s)": 0.014325
},
{
"epoch": 0.10399584016639335,
"grad_norm": 0.03247377224618784,
"learning_rate": 1.9728226572962474e-05,
"loss": 0.39456634521484374,
"memory(GiB)": 76.07,
"step": 325,
"token_acc": 0.9204545454545454,
"train_speed(iter/s)": 0.014349
},
{
"epoch": 0.10559577616895324,
"grad_norm": 0.03372138735130045,
"learning_rate": 1.9716071662364454e-05,
"loss": 0.39053902626037595,
"memory(GiB)": 76.07,
"step": 330,
"token_acc": 0.8667469395946217,
"train_speed(iter/s)": 0.014349
},
{
"epoch": 0.10719571217151314,
"grad_norm": 0.03514032505290493,
"learning_rate": 1.970365476537707e-05,
"loss": 0.38283843994140626,
"memory(GiB)": 76.07,
"step": 335,
"token_acc": 0.8957358294331773,
"train_speed(iter/s)": 0.01436
},
{
"epoch": 0.10879564817407304,
"grad_norm": 0.03192284784230212,
"learning_rate": 1.9690976216812397e-05,
"loss": 0.3861492156982422,
"memory(GiB)": 76.07,
"step": 340,
"token_acc": 0.8877259752616555,
"train_speed(iter/s)": 0.014363
},
{
"epoch": 0.11039558417663294,
"grad_norm": 0.033562102316210984,
"learning_rate": 1.9678036358537726e-05,
"loss": 0.38447730541229247,
"memory(GiB)": 76.07,
"step": 345,
"token_acc": 0.8906195309765488,
"train_speed(iter/s)": 0.014357
},
{
"epoch": 0.11199552017919283,
"grad_norm": 0.03449736551982357,
"learning_rate": 1.966483553946637e-05,
"loss": 0.3902695894241333,
"memory(GiB)": 76.07,
"step": 350,
"token_acc": 0.8884874759152216,
"train_speed(iter/s)": 0.014363
},
{
"epoch": 0.11359545618175274,
"grad_norm": 0.03299602135964767,
"learning_rate": 1.9651374115548255e-05,
"loss": 0.3823978424072266,
"memory(GiB)": 76.07,
"step": 355,
"token_acc": 0.9103085026335591,
"train_speed(iter/s)": 0.014362
},
{
"epoch": 0.11519539218431263,
"grad_norm": 0.03433798775900007,
"learning_rate": 1.9637652449760297e-05,
"loss": 0.3836047172546387,
"memory(GiB)": 76.07,
"step": 360,
"token_acc": 0.8500127323656735,
"train_speed(iter/s)": 0.014367
},
{
"epoch": 0.11679532818687252,
"grad_norm": 0.03345845540162246,
"learning_rate": 1.9623670912096656e-05,
"loss": 0.3858953475952148,
"memory(GiB)": 76.07,
"step": 365,
"token_acc": 0.8927587882715049,
"train_speed(iter/s)": 0.014364
},
{
"epoch": 0.11839526418943243,
"grad_norm": 0.03341419963683031,
"learning_rate": 1.9609429879558726e-05,
"loss": 0.37838385105133054,
"memory(GiB)": 76.07,
"step": 370,
"token_acc": 0.8884803921568627,
"train_speed(iter/s)": 0.014369
},
{
"epoch": 0.11999520019199232,
"grad_norm": 0.03318506660752264,
"learning_rate": 1.9594929736144978e-05,
"loss": 0.39080846309661865,
"memory(GiB)": 76.07,
"step": 375,
"token_acc": 0.8838375667367739,
"train_speed(iter/s)": 0.014371
},
{
"epoch": 0.12159513619455221,
"grad_norm": 0.032615752382225055,
"learning_rate": 1.958017087284061e-05,
"loss": 0.3769553184509277,
"memory(GiB)": 76.07,
"step": 380,
"token_acc": 0.9018950192855945,
"train_speed(iter/s)": 0.014386
},
{
"epoch": 0.12319507219711212,
"grad_norm": 0.03133189034498934,
"learning_rate": 1.9565153687607006e-05,
"loss": 0.3848905563354492,
"memory(GiB)": 76.07,
"step": 385,
"token_acc": 0.8868577075098815,
"train_speed(iter/s)": 0.014386
},
{
"epoch": 0.12479500819967201,
"grad_norm": 0.03197313383191992,
"learning_rate": 1.9549878585371006e-05,
"loss": 0.38284108638763426,
"memory(GiB)": 76.07,
"step": 390,
"token_acc": 0.8899135446685879,
"train_speed(iter/s)": 0.014394
},
{
"epoch": 0.1263949442022319,
"grad_norm": 0.031847003037153106,
"learning_rate": 1.9534345978013972e-05,
"loss": 0.3859133720397949,
"memory(GiB)": 76.07,
"step": 395,
"token_acc": 0.8742560659240043,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.1279948802047918,
"grad_norm": 0.03422769575373828,
"learning_rate": 1.9518556284360696e-05,
"loss": 0.38266074657440186,
"memory(GiB)": 76.07,
"step": 400,
"token_acc": 0.9119344878507182,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.1295948162073517,
"grad_norm": 0.03221204648449897,
"learning_rate": 1.9502509930168113e-05,
"loss": 0.38048243522644043,
"memory(GiB)": 76.07,
"step": 405,
"token_acc": 0.9020516214427532,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.1311947522099116,
"grad_norm": 0.034549366769104535,
"learning_rate": 1.9486207348113803e-05,
"loss": 0.37532615661621094,
"memory(GiB)": 76.07,
"step": 410,
"token_acc": 0.8943346070775876,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.1327946882124715,
"grad_norm": 0.03556652976821217,
"learning_rate": 1.946964897778433e-05,
"loss": 0.38798692226409914,
"memory(GiB)": 76.07,
"step": 415,
"token_acc": 0.9074051332432764,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.1343946242150314,
"grad_norm": 0.032782000611636754,
"learning_rate": 1.9452835265663404e-05,
"loss": 0.38746092319488523,
"memory(GiB)": 76.07,
"step": 420,
"token_acc": 0.8914526484751204,
"train_speed(iter/s)": 0.014394
},
{
"epoch": 0.1359945602175913,
"grad_norm": 0.03634421691537427,
"learning_rate": 1.9435766665119823e-05,
"loss": 0.3850360870361328,
"memory(GiB)": 76.07,
"step": 425,
"token_acc": 0.8656546489563567,
"train_speed(iter/s)": 0.014387
},
{
"epoch": 0.13759449622015119,
"grad_norm": 0.03409209090353386,
"learning_rate": 1.941844363639525e-05,
"loss": 0.3924290895462036,
"memory(GiB)": 76.07,
"step": 430,
"token_acc": 0.8879083449450379,
"train_speed(iter/s)": 0.014389
},
{
"epoch": 0.13919443222271108,
"grad_norm": 0.03586613576277069,
"learning_rate": 1.9400866646591816e-05,
"loss": 0.3824719667434692,
"memory(GiB)": 76.07,
"step": 435,
"token_acc": 0.8478456014362658,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.140794368225271,
"grad_norm": 0.03612177033189357,
"learning_rate": 1.9383036169659513e-05,
"loss": 0.3880664587020874,
"memory(GiB)": 76.07,
"step": 440,
"token_acc": 0.8917012448132781,
"train_speed(iter/s)": 0.014389
},
{
"epoch": 0.1423943042278309,
"grad_norm": 0.03585757877860267,
"learning_rate": 1.936495268638342e-05,
"loss": 0.39356892108917235,
"memory(GiB)": 76.07,
"step": 445,
"token_acc": 0.8592846433925894,
"train_speed(iter/s)": 0.014396
},
{
"epoch": 0.14399424023039079,
"grad_norm": 0.032095810341158305,
"learning_rate": 1.934661668437073e-05,
"loss": 0.3881976842880249,
"memory(GiB)": 76.07,
"step": 450,
"token_acc": 0.8775109170305677,
"train_speed(iter/s)": 0.014397
},
{
"epoch": 0.14559417623295068,
"grad_norm": 0.035715492914310906,
"learning_rate": 1.932802865803763e-05,
"loss": 0.3885905981063843,
"memory(GiB)": 76.07,
"step": 455,
"token_acc": 0.8691340534797237,
"train_speed(iter/s)": 0.014403
},
{
"epoch": 0.14719411223551057,
"grad_norm": 0.03359573622491741,
"learning_rate": 1.930918910859592e-05,
"loss": 0.38143932819366455,
"memory(GiB)": 76.07,
"step": 460,
"token_acc": 0.8709529627367135,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.14879404823807046,
"grad_norm": 0.03406432480471397,
"learning_rate": 1.9290098544039546e-05,
"loss": 0.38104383945465087,
"memory(GiB)": 76.07,
"step": 465,
"token_acc": 0.8818467648518947,
"train_speed(iter/s)": 0.014388
},
{
"epoch": 0.15039398424063039,
"grad_norm": 0.0334674901088086,
"learning_rate": 1.927075747913088e-05,
"loss": 0.38691911697387693,
"memory(GiB)": 76.07,
"step": 470,
"token_acc": 0.8903258526689489,
"train_speed(iter/s)": 0.014384
},
{
"epoch": 0.15199392024319028,
"grad_norm": 0.03139039879037341,
"learning_rate": 1.9251166435386837e-05,
"loss": 0.3794668197631836,
"memory(GiB)": 76.07,
"step": 475,
"token_acc": 0.881838481577968,
"train_speed(iter/s)": 0.014384
},
{
"epoch": 0.15359385624575017,
"grad_norm": 0.032712134906697395,
"learning_rate": 1.923132594106483e-05,
"loss": 0.3873713254928589,
"memory(GiB)": 76.07,
"step": 480,
"token_acc": 0.8821567537520845,
"train_speed(iter/s)": 0.014377
},
{
"epoch": 0.15519379224831006,
"grad_norm": 0.035229518924756134,
"learning_rate": 1.92112365311485e-05,
"loss": 0.38217613697052,
"memory(GiB)": 76.07,
"step": 485,
"token_acc": 0.8820149162489301,
"train_speed(iter/s)": 0.014383
},
{
"epoch": 0.15679372825086996,
"grad_norm": 0.03274511624533184,
"learning_rate": 1.919089874733332e-05,
"loss": 0.38786864280700684,
"memory(GiB)": 76.07,
"step": 490,
"token_acc": 0.8996381941167217,
"train_speed(iter/s)": 0.014387
},
{
"epoch": 0.15839366425342985,
"grad_norm": 0.03284065009666707,
"learning_rate": 1.9170313138011964e-05,
"loss": 0.3825819730758667,
"memory(GiB)": 76.07,
"step": 495,
"token_acc": 0.9057554964290716,
"train_speed(iter/s)": 0.014388
},
{
"epoch": 0.15999360025598977,
"grad_norm": 0.03419542960956006,
"learning_rate": 1.9149480258259535e-05,
"loss": 0.38258953094482423,
"memory(GiB)": 76.07,
"step": 500,
"token_acc": 0.8961057623221728,
"train_speed(iter/s)": 0.01439
},
{
"epoch": 0.15999360025598977,
"eval_loss": 0.6193732619285583,
"eval_runtime": 168.67,
"eval_samples_per_second": 119.096,
"eval_steps_per_second": 0.599,
"eval_token_acc": 0.8881378895176241,
"step": 500
},
{
"epoch": 0.16159353625854966,
"grad_norm": 0.03206404175508866,
"learning_rate": 1.9128400669818586e-05,
"loss": 0.3774104118347168,
"memory(GiB)": 76.07,
"step": 505,
"token_acc": 0.8925198620896417,
"train_speed(iter/s)": 0.014323
},
{
"epoch": 0.16319347226110956,
"grad_norm": 0.03264569403840349,
"learning_rate": 1.9107074941083987e-05,
"loss": 0.3852546215057373,
"memory(GiB)": 76.07,
"step": 510,
"token_acc": 0.8948775055679288,
"train_speed(iter/s)": 0.014323
},
{
"epoch": 0.16479340826366945,
"grad_norm": 0.033527933798423434,
"learning_rate": 1.9085503647087588e-05,
"loss": 0.37959980964660645,
"memory(GiB)": 76.07,
"step": 515,
"token_acc": 0.8879507475813544,
"train_speed(iter/s)": 0.014326
},
{
"epoch": 0.16639334426622934,
"grad_norm": 0.03295561806491276,
"learning_rate": 1.906368736948272e-05,
"loss": 0.3861686706542969,
"memory(GiB)": 76.07,
"step": 520,
"token_acc": 0.889853813865972,
"train_speed(iter/s)": 0.014325
},
{
"epoch": 0.16799328026878924,
"grad_norm": 0.03184366828026341,
"learning_rate": 1.9041626696528503e-05,
"loss": 0.38342669010162356,
"memory(GiB)": 76.07,
"step": 525,
"token_acc": 0.8992944194996793,
"train_speed(iter/s)": 0.014338
},
{
"epoch": 0.16959321627134916,
"grad_norm": 0.033738127296183994,
"learning_rate": 1.9019322223073997e-05,
"loss": 0.3832501173019409,
"memory(GiB)": 76.56,
"step": 530,
"token_acc": 0.9125608082823999,
"train_speed(iter/s)": 0.014338
},
{
"epoch": 0.17119315227390905,
"grad_norm": 0.0333234741433263,
"learning_rate": 1.899677455054215e-05,
"loss": 0.38559613227844236,
"memory(GiB)": 76.56,
"step": 535,
"token_acc": 0.8407811400422238,
"train_speed(iter/s)": 0.014346
},
{
"epoch": 0.17279308827646894,
"grad_norm": 0.03099693893435516,
"learning_rate": 1.8973984286913584e-05,
"loss": 0.38624236583709715,
"memory(GiB)": 76.56,
"step": 540,
"token_acc": 0.9047673619069447,
"train_speed(iter/s)": 0.014351
},
{
"epoch": 0.17439302427902884,
"grad_norm": 0.03564589208589755,
"learning_rate": 1.895095204671021e-05,
"loss": 0.3812048673629761,
"memory(GiB)": 76.56,
"step": 545,
"token_acc": 0.9132128940843075,
"train_speed(iter/s)": 0.014351
},
{
"epoch": 0.17599296028158873,
"grad_norm": 0.03306838339780197,
"learning_rate": 1.892767845097864e-05,
"loss": 0.38694233894348146,
"memory(GiB)": 76.56,
"step": 550,
"token_acc": 0.8896024995660475,
"train_speed(iter/s)": 0.014362
},
{
"epoch": 0.17759289628414862,
"grad_norm": 0.03511437169806579,
"learning_rate": 1.890416412727346e-05,
"loss": 0.3801495790481567,
"memory(GiB)": 76.56,
"step": 555,
"token_acc": 0.8592943801422396,
"train_speed(iter/s)": 0.01437
},
{
"epoch": 0.17919283228670854,
"grad_norm": 0.033895161074874745,
"learning_rate": 1.88804097096403e-05,
"loss": 0.37548644542694093,
"memory(GiB)": 76.56,
"step": 560,
"token_acc": 0.9068198850861854,
"train_speed(iter/s)": 0.014382
},
{
"epoch": 0.18079276828926844,
"grad_norm": 0.033440476927491095,
"learning_rate": 1.8856415838598738e-05,
"loss": 0.3744084596633911,
"memory(GiB)": 76.56,
"step": 565,
"token_acc": 0.8932863323185387,
"train_speed(iter/s)": 0.01439
},
{
"epoch": 0.18239270429182833,
"grad_norm": 0.035885470124335045,
"learning_rate": 1.8832183161125026e-05,
"loss": 0.3785930395126343,
"memory(GiB)": 76.56,
"step": 570,
"token_acc": 0.848502994011976,
"train_speed(iter/s)": 0.014392
},
{
"epoch": 0.18399264029438822,
"grad_norm": 0.03324044359853696,
"learning_rate": 1.8807712330634645e-05,
"loss": 0.3850206136703491,
"memory(GiB)": 76.56,
"step": 575,
"token_acc": 0.9094766619519095,
"train_speed(iter/s)": 0.014389
},
{
"epoch": 0.18559257629694811,
"grad_norm": 0.03263482668047798,
"learning_rate": 1.87830040069647e-05,
"loss": 0.37779667377471926,
"memory(GiB)": 76.56,
"step": 580,
"token_acc": 0.9197788863421869,
"train_speed(iter/s)": 0.014394
},
{
"epoch": 0.187192512299508,
"grad_norm": 0.03550703857977458,
"learning_rate": 1.87580588563561e-05,
"loss": 0.3798608541488647,
"memory(GiB)": 76.56,
"step": 585,
"token_acc": 0.8933184500079732,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.18879244830206793,
"grad_norm": 0.03391669539615144,
"learning_rate": 1.873287755143563e-05,
"loss": 0.3751659393310547,
"memory(GiB)": 76.56,
"step": 590,
"token_acc": 0.9166312809624911,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.19039238430462782,
"grad_norm": 0.03459224478752944,
"learning_rate": 1.8707460771197773e-05,
"loss": 0.38129582405090334,
"memory(GiB)": 76.56,
"step": 595,
"token_acc": 0.9053976730879267,
"train_speed(iter/s)": 0.014401
},
{
"epoch": 0.1919923203071877,
"grad_norm": 0.03339910116296889,
"learning_rate": 1.868180920098644e-05,
"loss": 0.38383800983428956,
"memory(GiB)": 76.56,
"step": 600,
"token_acc": 0.872634898388227,
"train_speed(iter/s)": 0.014405
},
{
"epoch": 0.1935922563097476,
"grad_norm": 0.033692221359167995,
"learning_rate": 1.8655923532476463e-05,
"loss": 0.3776890516281128,
"memory(GiB)": 76.56,
"step": 605,
"token_acc": 0.9167274052478134,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.1951921923123075,
"grad_norm": 0.0332686161147481,
"learning_rate": 1.8629804463654956e-05,
"loss": 0.3806722402572632,
"memory(GiB)": 76.56,
"step": 610,
"token_acc": 0.8899387576552931,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.1967921283148674,
"grad_norm": 0.034972178070293056,
"learning_rate": 1.8603452698802498e-05,
"loss": 0.38915410041809084,
"memory(GiB)": 77.28,
"step": 615,
"token_acc": 0.8858360966366651,
"train_speed(iter/s)": 0.014415
},
{
"epoch": 0.1983920643174273,
"grad_norm": 0.032230881125325274,
"learning_rate": 1.857686894847413e-05,
"loss": 0.37490866184234617,
"memory(GiB)": 77.28,
"step": 620,
"token_acc": 0.8671481128219103,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.1999920003199872,
"grad_norm": 0.03461719194107402,
"learning_rate": 1.8550053929480202e-05,
"loss": 0.3814939737319946,
"memory(GiB)": 77.28,
"step": 625,
"token_acc": 0.9177888022678952,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.2015919363225471,
"grad_norm": 0.03369236467656219,
"learning_rate": 1.8523008364867056e-05,
"loss": 0.38451409339904785,
"memory(GiB)": 77.28,
"step": 630,
"token_acc": 0.870737913486005,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.203191872325107,
"grad_norm": 0.03255294220837347,
"learning_rate": 1.8495732983897504e-05,
"loss": 0.37762107849121096,
"memory(GiB)": 77.28,
"step": 635,
"token_acc": 0.8674445294567712,
"train_speed(iter/s)": 0.014415
},
{
"epoch": 0.20479180832766689,
"grad_norm": 0.03474015187119267,
"learning_rate": 1.8468228522031197e-05,
"loss": 0.3729959726333618,
"memory(GiB)": 77.28,
"step": 640,
"token_acc": 0.8980558325024925,
"train_speed(iter/s)": 0.014415
},
{
"epoch": 0.20639174433022678,
"grad_norm": 0.034565861862923035,
"learning_rate": 1.8440495720904758e-05,
"loss": 0.380579400062561,
"memory(GiB)": 77.28,
"step": 645,
"token_acc": 0.8993572889278411,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.2079916803327867,
"grad_norm": 0.03667995528577527,
"learning_rate": 1.8412535328311813e-05,
"loss": 0.3839728593826294,
"memory(GiB)": 77.28,
"step": 650,
"token_acc": 0.8749459108610991,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.2095916163353466,
"grad_norm": 0.03454743457582257,
"learning_rate": 1.8384348098182815e-05,
"loss": 0.3817548990249634,
"memory(GiB)": 77.28,
"step": 655,
"token_acc": 0.838635049161365,
"train_speed(iter/s)": 0.014414
},
{
"epoch": 0.21119155233790649,
"grad_norm": 0.03545621066201229,
"learning_rate": 1.8355934790564718e-05,
"loss": 0.38348143100738524,
"memory(GiB)": 77.28,
"step": 660,
"token_acc": 0.905241935483871,
"train_speed(iter/s)": 0.014419
},
{
"epoch": 0.21279148834046638,
"grad_norm": 0.03572649708176257,
"learning_rate": 1.832729617160047e-05,
"loss": 0.3777714967727661,
"memory(GiB)": 77.28,
"step": 665,
"token_acc": 0.9266425992779783,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.21439142434302627,
"grad_norm": 0.033679470408814874,
"learning_rate": 1.8298433013508384e-05,
"loss": 0.38007168769836425,
"memory(GiB)": 77.28,
"step": 670,
"token_acc": 0.8724329548200048,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.21599136034558616,
"grad_norm": 0.034843072179395064,
"learning_rate": 1.826934609456129e-05,
"loss": 0.3841479063034058,
"memory(GiB)": 77.28,
"step": 675,
"token_acc": 0.9051177216974482,
"train_speed(iter/s)": 0.014421
},
{
"epoch": 0.21759129634814608,
"grad_norm": 0.0365705080123855,
"learning_rate": 1.8240036199065546e-05,
"loss": 0.38644914627075194,
"memory(GiB)": 77.28,
"step": 680,
"token_acc": 0.8996160175534833,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.21919123235070598,
"grad_norm": 0.03502298426190971,
"learning_rate": 1.8210504117339917e-05,
"loss": 0.38111186027526855,
"memory(GiB)": 77.28,
"step": 685,
"token_acc": 0.9016673362796304,
"train_speed(iter/s)": 0.014421
},
{
"epoch": 0.22079116835326587,
"grad_norm": 0.03495070664363774,
"learning_rate": 1.8180750645694236e-05,
"loss": 0.3825707912445068,
"memory(GiB)": 77.28,
"step": 690,
"token_acc": 0.889507494646681,
"train_speed(iter/s)": 0.014427
},
{
"epoch": 0.22239110435582576,
"grad_norm": 0.03462540294483746,
"learning_rate": 1.8150776586407957e-05,
"loss": 0.3783039808273315,
"memory(GiB)": 77.28,
"step": 695,
"token_acc": 0.912316715542522,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.22399104035838566,
"grad_norm": 0.03365404014142329,
"learning_rate": 1.8120582747708503e-05,
"loss": 0.3824033498764038,
"memory(GiB)": 77.28,
"step": 700,
"token_acc": 0.8982280781462971,
"train_speed(iter/s)": 0.014425
},
{
"epoch": 0.22559097636094555,
"grad_norm": 0.03525313113291282,
"learning_rate": 1.8090169943749477e-05,
"loss": 0.3850820779800415,
"memory(GiB)": 77.28,
"step": 705,
"token_acc": 0.8981919931123548,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.22719091236350547,
"grad_norm": 0.03679372138793972,
"learning_rate": 1.8059538994588715e-05,
"loss": 0.3753945827484131,
"memory(GiB)": 77.28,
"step": 710,
"token_acc": 0.8688331368917326,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.22879084836606536,
"grad_norm": 0.034266978650896916,
"learning_rate": 1.8028690726166172e-05,
"loss": 0.37668046951293943,
"memory(GiB)": 77.28,
"step": 715,
"token_acc": 0.8903355032548823,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.23039078436862526,
"grad_norm": 0.036082400513325966,
"learning_rate": 1.7997625970281652e-05,
"loss": 0.3769336223602295,
"memory(GiB)": 77.28,
"step": 720,
"token_acc": 0.9020576131687242,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.23199072037118515,
"grad_norm": 0.03522824011355726,
"learning_rate": 1.796634556457236e-05,
"loss": 0.38350567817687986,
"memory(GiB)": 77.28,
"step": 725,
"token_acc": 0.9060884549109707,
"train_speed(iter/s)": 0.014425
},
{
"epoch": 0.23359065637374504,
"grad_norm": 0.03384650643032488,
"learning_rate": 1.793485035249036e-05,
"loss": 0.3775055408477783,
"memory(GiB)": 77.28,
"step": 730,
"token_acc": 0.8859484777517564,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.23519059237630494,
"grad_norm": 0.03311621627978966,
"learning_rate": 1.7903141183279776e-05,
"loss": 0.3862148284912109,
"memory(GiB)": 77.28,
"step": 735,
"token_acc": 0.8621900826446282,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.23679052837886486,
"grad_norm": 0.03335783787305468,
"learning_rate": 1.7871218911953942e-05,
"loss": 0.37302775382995607,
"memory(GiB)": 77.28,
"step": 740,
"token_acc": 0.8644029170464904,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.23839046438142475,
"grad_norm": 0.03535545477880254,
"learning_rate": 1.7839084399272317e-05,
"loss": 0.3812894821166992,
"memory(GiB)": 77.28,
"step": 745,
"token_acc": 0.8859926610148045,
"train_speed(iter/s)": 0.014425
},
{
"epoch": 0.23999040038398464,
"grad_norm": 0.03536304324563333,
"learning_rate": 1.780673851171728e-05,
"loss": 0.38368926048278806,
"memory(GiB)": 77.28,
"step": 750,
"token_acc": 0.915541118139853,
"train_speed(iter/s)": 0.014421
},
{
"epoch": 0.23999040038398464,
"eval_loss": 0.6164008378982544,
"eval_runtime": 169.1145,
"eval_samples_per_second": 118.783,
"eval_steps_per_second": 0.597,
"eval_token_acc": 0.8890133389641892,
"step": 750
},
{
"epoch": 0.24159033638654454,
"grad_norm": 0.03680542582321454,
"learning_rate": 1.777418212147079e-05,
"loss": 0.3746520519256592,
"memory(GiB)": 77.28,
"step": 755,
"token_acc": 0.906258484930763,
"train_speed(iter/s)": 0.014378
},
{
"epoch": 0.24319027238910443,
"grad_norm": 0.03617919710711229,
"learning_rate": 1.7741416106390828e-05,
"loss": 0.37985007762908934,
"memory(GiB)": 77.28,
"step": 760,
"token_acc": 0.9109599395313681,
"train_speed(iter/s)": 0.014379
},
{
"epoch": 0.24479020839166432,
"grad_norm": 0.03522579073367174,
"learning_rate": 1.7708441349987753e-05,
"loss": 0.3773144960403442,
"memory(GiB)": 77.28,
"step": 765,
"token_acc": 0.8976910828025477,
"train_speed(iter/s)": 0.014379
},
{
"epoch": 0.24639014439422424,
"grad_norm": 0.035862654993067136,
"learning_rate": 1.767525874140048e-05,
"loss": 0.38391575813293455,
"memory(GiB)": 77.28,
"step": 770,
"token_acc": 0.8621361746361746,
"train_speed(iter/s)": 0.014384
},
{
"epoch": 0.24799008039678413,
"grad_norm": 0.03436492411019931,
"learning_rate": 1.7641869175372493e-05,
"loss": 0.3757505416870117,
"memory(GiB)": 77.28,
"step": 775,
"token_acc": 0.8865568083261058,
"train_speed(iter/s)": 0.014384
},
{
"epoch": 0.24959001639934403,
"grad_norm": 0.03460527205552933,
"learning_rate": 1.7608273552227723e-05,
"loss": 0.3736558437347412,
"memory(GiB)": 77.28,
"step": 780,
"token_acc": 0.9036800600826136,
"train_speed(iter/s)": 0.014387
},
{
"epoch": 0.25118995240190395,
"grad_norm": 0.032946309550249894,
"learning_rate": 1.7574472777846276e-05,
"loss": 0.3870768308639526,
"memory(GiB)": 77.28,
"step": 785,
"token_acc": 0.8922848664688428,
"train_speed(iter/s)": 0.014391
},
{
"epoch": 0.2527898884044638,
"grad_norm": 0.033912193247707154,
"learning_rate": 1.7540467763639994e-05,
"loss": 0.3805867910385132,
"memory(GiB)": 77.28,
"step": 790,
"token_acc": 0.8922994076467421,
"train_speed(iter/s)": 0.014395
},
{
"epoch": 0.25438982440702373,
"grad_norm": 0.03576586207074456,
"learning_rate": 1.7506259426527903e-05,
"loss": 0.3851534128189087,
"memory(GiB)": 77.28,
"step": 795,
"token_acc": 0.9005177922220998,
"train_speed(iter/s)": 0.014396
},
{
"epoch": 0.2559897604095836,
"grad_norm": 0.03520759857550378,
"learning_rate": 1.7471848688911465e-05,
"loss": 0.3831015586853027,
"memory(GiB)": 77.28,
"step": 800,
"token_acc": 0.9037107258938245,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.2575896964121435,
"grad_norm": 0.0354593082946657,
"learning_rate": 1.7437236478649718e-05,
"loss": 0.37855699062347414,
"memory(GiB)": 77.28,
"step": 805,
"token_acc": 0.8879225143308954,
"train_speed(iter/s)": 0.014398
},
{
"epoch": 0.2591896324147034,
"grad_norm": 0.0337808522927956,
"learning_rate": 1.7402423729034252e-05,
"loss": 0.3711889982223511,
"memory(GiB)": 77.28,
"step": 810,
"token_acc": 0.8532670454545455,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.2607895684172633,
"grad_norm": 0.03492768229901829,
"learning_rate": 1.736741137876405e-05,
"loss": 0.3790097951889038,
"memory(GiB)": 77.28,
"step": 815,
"token_acc": 0.9026868367577331,
"train_speed(iter/s)": 0.014404
},
{
"epoch": 0.2623895044198232,
"grad_norm": 0.034967340753827056,
"learning_rate": 1.7332200371920173e-05,
"loss": 0.38438780307769777,
"memory(GiB)": 77.28,
"step": 820,
"token_acc": 0.8772080999569152,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.2639894404223831,
"grad_norm": 0.034264119000574224,
"learning_rate": 1.72967916579403e-05,
"loss": 0.37496380805969237,
"memory(GiB)": 77.28,
"step": 825,
"token_acc": 0.8874313065059387,
"train_speed(iter/s)": 0.014415
},
{
"epoch": 0.265589376424943,
"grad_norm": 0.033897273321268885,
"learning_rate": 1.7261186191593135e-05,
"loss": 0.3849215269088745,
"memory(GiB)": 77.28,
"step": 830,
"token_acc": 0.8913907284768212,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.2671893124275029,
"grad_norm": 0.03586062681802787,
"learning_rate": 1.7225384932952655e-05,
"loss": 0.3776970148086548,
"memory(GiB)": 77.28,
"step": 835,
"token_acc": 0.8961673537944724,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.2687892484300628,
"grad_norm": 0.03463767475104641,
"learning_rate": 1.7189388847372227e-05,
"loss": 0.3832270622253418,
"memory(GiB)": 77.28,
"step": 840,
"token_acc": 0.8957481602616517,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.2703891844326227,
"grad_norm": 0.03322572736677012,
"learning_rate": 1.715319890545857e-05,
"loss": 0.373725152015686,
"memory(GiB)": 77.28,
"step": 845,
"token_acc": 0.87657254682695,
"train_speed(iter/s)": 0.014419
},
{
"epoch": 0.2719891204351826,
"grad_norm": 0.03432594388504518,
"learning_rate": 1.7116816083045603e-05,
"loss": 0.38315093517303467,
"memory(GiB)": 77.28,
"step": 850,
"token_acc": 0.8969713732540451,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.2735890564377425,
"grad_norm": 0.0333573566270864,
"learning_rate": 1.7080241361168108e-05,
"loss": 0.3734123229980469,
"memory(GiB)": 77.28,
"step": 855,
"token_acc": 0.8995640238979493,
"train_speed(iter/s)": 0.014422
},
{
"epoch": 0.27518899244030237,
"grad_norm": 0.03455173370569199,
"learning_rate": 1.704347572603529e-05,
"loss": 0.38244330883026123,
"memory(GiB)": 77.28,
"step": 860,
"token_acc": 0.8684960263907633,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.2767889284428623,
"grad_norm": 0.035362819343963146,
"learning_rate": 1.700652016900419e-05,
"loss": 0.38104417324066164,
"memory(GiB)": 77.28,
"step": 865,
"token_acc": 0.8948292371528886,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.27838886444542216,
"grad_norm": 0.034943075348089055,
"learning_rate": 1.696937568655294e-05,
"loss": 0.375447678565979,
"memory(GiB)": 77.28,
"step": 870,
"token_acc": 0.8895320791123975,
"train_speed(iter/s)": 0.014425
},
{
"epoch": 0.2799888004479821,
"grad_norm": 0.03518132486138768,
"learning_rate": 1.6932043280253892e-05,
"loss": 0.3870342969894409,
"memory(GiB)": 77.28,
"step": 875,
"token_acc": 0.8991515927645269,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.281588736450542,
"grad_norm": 0.03358472672640051,
"learning_rate": 1.689452395674664e-05,
"loss": 0.3791643619537354,
"memory(GiB)": 77.28,
"step": 880,
"token_acc": 0.882903981264637,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.28318867245310186,
"grad_norm": 0.0335812057163469,
"learning_rate": 1.6856818727710847e-05,
"loss": 0.37133069038391114,
"memory(GiB)": 77.28,
"step": 885,
"token_acc": 0.8640576725025747,
"train_speed(iter/s)": 0.014429
},
{
"epoch": 0.2847886084556618,
"grad_norm": 0.033689064925450846,
"learning_rate": 1.6818928609838967e-05,
"loss": 0.3744334697723389,
"memory(GiB)": 77.28,
"step": 890,
"token_acc": 0.904192992533027,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.28638854445822165,
"grad_norm": 0.03324735662329384,
"learning_rate": 1.678085462480885e-05,
"loss": 0.3733969688415527,
"memory(GiB)": 77.28,
"step": 895,
"token_acc": 0.8976343135087331,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.28798848046078157,
"grad_norm": 0.034296406767401026,
"learning_rate": 1.6742597799256182e-05,
"loss": 0.37558152675628664,
"memory(GiB)": 77.28,
"step": 900,
"token_acc": 0.9029866553696251,
"train_speed(iter/s)": 0.014431
},
{
"epoch": 0.2895884164633415,
"grad_norm": 0.037582572024316786,
"learning_rate": 1.6704159164746797e-05,
"loss": 0.3907860040664673,
"memory(GiB)": 77.28,
"step": 905,
"token_acc": 0.9069654950016124,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.29118835246590136,
"grad_norm": 0.033743665763862556,
"learning_rate": 1.6665539757748866e-05,
"loss": 0.373353385925293,
"memory(GiB)": 77.28,
"step": 910,
"token_acc": 0.8887350534927627,
"train_speed(iter/s)": 0.014432
},
{
"epoch": 0.2927882884684613,
"grad_norm": 0.03614831200848796,
"learning_rate": 1.6626740619604967e-05,
"loss": 0.37723698616027834,
"memory(GiB)": 77.28,
"step": 915,
"token_acc": 0.8396020383402086,
"train_speed(iter/s)": 0.014431
},
{
"epoch": 0.29438822447102114,
"grad_norm": 0.0345492804244864,
"learning_rate": 1.658776279650397e-05,
"loss": 0.38145616054534914,
"memory(GiB)": 77.28,
"step": 920,
"token_acc": 0.9019520851818988,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.29598816047358106,
"grad_norm": 0.03512572590148749,
"learning_rate": 1.6548607339452853e-05,
"loss": 0.37775335311889646,
"memory(GiB)": 77.28,
"step": 925,
"token_acc": 0.897300230633564,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.29758809647614093,
"grad_norm": 0.0369285958635259,
"learning_rate": 1.6509275304248366e-05,
"loss": 0.3776986837387085,
"memory(GiB)": 77.28,
"step": 930,
"token_acc": 0.8829104695246428,
"train_speed(iter/s)": 0.014433
},
{
"epoch": 0.29918803247870085,
"grad_norm": 0.03462506767370347,
"learning_rate": 1.6469767751448538e-05,
"loss": 0.3799281597137451,
"memory(GiB)": 77.28,
"step": 935,
"token_acc": 0.8700686947988224,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.30078796848126077,
"grad_norm": 0.03338974052579205,
"learning_rate": 1.6430085746344107e-05,
"loss": 0.37139339447021485,
"memory(GiB)": 77.28,
"step": 940,
"token_acc": 0.8986585010207058,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.30238790448382064,
"grad_norm": 0.03046768581019517,
"learning_rate": 1.639023035892978e-05,
"loss": 0.36957426071166993,
"memory(GiB)": 77.28,
"step": 945,
"token_acc": 0.9041682898324893,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.30398784048638056,
"grad_norm": 0.03387287029515358,
"learning_rate": 1.6350202663875385e-05,
"loss": 0.3741326808929443,
"memory(GiB)": 77.28,
"step": 950,
"token_acc": 0.887836853605244,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.3055877764889404,
"grad_norm": 0.03266389732849567,
"learning_rate": 1.6310003740496887e-05,
"loss": 0.37487266063690183,
"memory(GiB)": 77.28,
"step": 955,
"token_acc": 0.8825019485580671,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.30718771249150034,
"grad_norm": 0.03351674125437608,
"learning_rate": 1.6269634672727296e-05,
"loss": 0.37188766002655027,
"memory(GiB)": 77.28,
"step": 960,
"token_acc": 0.900720576461169,
"train_speed(iter/s)": 0.014434
},
{
"epoch": 0.30878764849406026,
"grad_norm": 0.031488337411913495,
"learning_rate": 1.6229096549087434e-05,
"loss": 0.3766692399978638,
"memory(GiB)": 77.28,
"step": 965,
"token_acc": 0.8986156351791531,
"train_speed(iter/s)": 0.014434
},
{
"epoch": 0.31038758449662013,
"grad_norm": 0.03332048991285344,
"learning_rate": 1.618839046265658e-05,
"loss": 0.3791315793991089,
"memory(GiB)": 77.28,
"step": 970,
"token_acc": 0.8830157184587565,
"train_speed(iter/s)": 0.014434
},
{
"epoch": 0.31198752049918005,
"grad_norm": 0.03451155538352893,
"learning_rate": 1.614751751104301e-05,
"loss": 0.3785123825073242,
"memory(GiB)": 77.28,
"step": 975,
"token_acc": 0.8958753965964811,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.3135874565017399,
"grad_norm": 0.033059221136730675,
"learning_rate": 1.6106478796354382e-05,
"loss": 0.37357268333435056,
"memory(GiB)": 77.28,
"step": 980,
"token_acc": 0.9054635545703481,
"train_speed(iter/s)": 0.014433
},
{
"epoch": 0.31518739250429983,
"grad_norm": 0.037287525323499084,
"learning_rate": 1.6065275425168034e-05,
"loss": 0.37153091430664065,
"memory(GiB)": 77.28,
"step": 985,
"token_acc": 0.9115008156606852,
"train_speed(iter/s)": 0.014434
},
{
"epoch": 0.3167873285068597,
"grad_norm": 0.033380291242419424,
"learning_rate": 1.602390850850113e-05,
"loss": 0.3818410634994507,
"memory(GiB)": 77.28,
"step": 990,
"token_acc": 0.8696263559662515,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.3183872645094196,
"grad_norm": 0.03439438956072722,
"learning_rate": 1.5982379161780722e-05,
"loss": 0.366620135307312,
"memory(GiB)": 77.28,
"step": 995,
"token_acc": 0.8729515742957098,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.31998720051197954,
"grad_norm": 0.034020697710137944,
"learning_rate": 1.5940688504813664e-05,
"loss": 0.3724443197250366,
"memory(GiB)": 77.28,
"step": 1000,
"token_acc": 0.9151111111111111,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.31998720051197954,
"eval_loss": 0.6141124963760376,
"eval_runtime": 158.9547,
"eval_samples_per_second": 126.376,
"eval_steps_per_second": 0.635,
"eval_token_acc": 0.8899123960362797,
"step": 1000
},
{
"epoch": 0.3215871365145394,
"grad_norm": 0.033011811195180485,
"learning_rate": 1.5898837661756405e-05,
"loss": 0.37675890922546384,
"memory(GiB)": 77.28,
"step": 1005,
"token_acc": 0.9039758494444088,
"train_speed(iter/s)": 0.014394
},
{
"epoch": 0.3231870725170993,
"grad_norm": 0.035486853244652936,
"learning_rate": 1.5856827761084698e-05,
"loss": 0.36834869384765623,
"memory(GiB)": 77.28,
"step": 1010,
"token_acc": 0.8983255653374763,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.3247870085196592,
"grad_norm": 0.03406105920529523,
"learning_rate": 1.5814659935563165e-05,
"loss": 0.3808779239654541,
"memory(GiB)": 77.28,
"step": 1015,
"token_acc": 0.8966199971715457,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.3263869445222191,
"grad_norm": 0.03308081465556082,
"learning_rate": 1.577233532221474e-05,
"loss": 0.37457520961761476,
"memory(GiB)": 77.28,
"step": 1020,
"token_acc": 0.8870108821486455,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.32798688052477903,
"grad_norm": 0.033407344837741056,
"learning_rate": 1.5729855062290024e-05,
"loss": 0.3800173044204712,
"memory(GiB)": 77.28,
"step": 1025,
"token_acc": 0.8932816214187413,
"train_speed(iter/s)": 0.014398
},
{
"epoch": 0.3295868165273389,
"grad_norm": 0.03687625272041186,
"learning_rate": 1.568722030123651e-05,
"loss": 0.3687458515167236,
"memory(GiB)": 77.28,
"step": 1030,
"token_acc": 0.8835139318885449,
"train_speed(iter/s)": 0.014397
},
{
"epoch": 0.3311867525298988,
"grad_norm": 0.03432528592893544,
"learning_rate": 1.5644432188667695e-05,
"loss": 0.3709027528762817,
"memory(GiB)": 77.28,
"step": 1035,
"token_acc": 0.8903526550466153,
"train_speed(iter/s)": 0.014398
},
{
"epoch": 0.3327866885324587,
"grad_norm": 0.03319653665975899,
"learning_rate": 1.5601491878332077e-05,
"loss": 0.3777631759643555,
"memory(GiB)": 77.28,
"step": 1040,
"token_acc": 0.8910492205289893,
"train_speed(iter/s)": 0.014398
},
{
"epoch": 0.3343866245350186,
"grad_norm": 0.034202821127900754,
"learning_rate": 1.5558400528082057e-05,
"loss": 0.3790686845779419,
"memory(GiB)": 77.28,
"step": 1045,
"token_acc": 0.9055801594331266,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.33598656053757847,
"grad_norm": 0.03691156666887596,
"learning_rate": 1.551515929984271e-05,
"loss": 0.3713582992553711,
"memory(GiB)": 77.28,
"step": 1050,
"token_acc": 0.9086751254057244,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.3375864965401384,
"grad_norm": 0.03449412127363822,
"learning_rate": 1.547176935958044e-05,
"loss": 0.3742972373962402,
"memory(GiB)": 77.28,
"step": 1055,
"token_acc": 0.8761001100110011,
"train_speed(iter/s)": 0.014401
},
{
"epoch": 0.3391864325426983,
"grad_norm": 0.03434565900369347,
"learning_rate": 1.5428231877271584e-05,
"loss": 0.3786214828491211,
"memory(GiB)": 77.28,
"step": 1060,
"token_acc": 0.871280724450194,
"train_speed(iter/s)": 0.014397
},
{
"epoch": 0.3407863685452582,
"grad_norm": 0.033670135783735435,
"learning_rate": 1.538454802687081e-05,
"loss": 0.3775958776473999,
"memory(GiB)": 77.28,
"step": 1065,
"token_acc": 0.8966864910790144,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.3423863045478181,
"grad_norm": 0.03556691326509067,
"learning_rate": 1.5340718986279505e-05,
"loss": 0.38387582302093504,
"memory(GiB)": 77.28,
"step": 1070,
"token_acc": 0.8821359223300971,
"train_speed(iter/s)": 0.014401
},
{
"epoch": 0.34398624055037796,
"grad_norm": 0.03410584414537992,
"learning_rate": 1.529674593731399e-05,
"loss": 0.367924427986145,
"memory(GiB)": 77.28,
"step": 1075,
"token_acc": 0.8812294182217344,
"train_speed(iter/s)": 0.014403
},
{
"epoch": 0.3455861765529379,
"grad_norm": 0.03472114991770262,
"learning_rate": 1.5252630065673662e-05,
"loss": 0.38024375438690183,
"memory(GiB)": 77.28,
"step": 1080,
"token_acc": 0.9087554085008908,
"train_speed(iter/s)": 0.014402
},
{
"epoch": 0.3471861125554978,
"grad_norm": 0.034826116899087524,
"learning_rate": 1.5208372560909031e-05,
"loss": 0.37552039623260497,
"memory(GiB)": 77.28,
"step": 1085,
"token_acc": 0.914223331253899,
"train_speed(iter/s)": 0.014403
},
{
"epoch": 0.34878604855805767,
"grad_norm": 0.03415469833651797,
"learning_rate": 1.5163974616389621e-05,
"loss": 0.37450971603393557,
"memory(GiB)": 77.28,
"step": 1090,
"token_acc": 0.8556051457075348,
"train_speed(iter/s)": 0.014403
},
{
"epoch": 0.3503859845606176,
"grad_norm": 0.03655513507503648,
"learning_rate": 1.5119437429271813e-05,
"loss": 0.3794886589050293,
"memory(GiB)": 77.28,
"step": 1095,
"token_acc": 0.8877699941622884,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.35198592056317746,
"grad_norm": 0.034995454028194976,
"learning_rate": 1.5074762200466557e-05,
"loss": 0.3700634717941284,
"memory(GiB)": 77.28,
"step": 1100,
"token_acc": 0.9116356483582992,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.3535858565657374,
"grad_norm": 0.034538306373934693,
"learning_rate": 1.5029950134606991e-05,
"loss": 0.3690228223800659,
"memory(GiB)": 77.28,
"step": 1105,
"token_acc": 0.8942924687605539,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.35518579256829724,
"grad_norm": 0.0331069504176894,
"learning_rate": 1.4985002440015959e-05,
"loss": 0.36534135341644286,
"memory(GiB)": 77.28,
"step": 1110,
"token_acc": 0.8909802740551122,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.35678572857085716,
"grad_norm": 0.034796730271752487,
"learning_rate": 1.4939920328673422e-05,
"loss": 0.38107268810272216,
"memory(GiB)": 77.28,
"step": 1115,
"token_acc": 0.9336683417085427,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.3583856645734171,
"grad_norm": 0.03428619908077693,
"learning_rate": 1.4894705016183803e-05,
"loss": 0.36655797958374026,
"memory(GiB)": 77.28,
"step": 1120,
"token_acc": 0.8758409785932721,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.35998560057597695,
"grad_norm": 0.03650887961633004,
"learning_rate": 1.4849357721743169e-05,
"loss": 0.37060978412628176,
"memory(GiB)": 77.28,
"step": 1125,
"token_acc": 0.8783166728372208,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.36158553657853687,
"grad_norm": 0.0365625802848291,
"learning_rate": 1.4803879668106393e-05,
"loss": 0.38014461994171145,
"memory(GiB)": 77.28,
"step": 1130,
"token_acc": 0.9106974995299868,
"train_speed(iter/s)": 0.014407
},
{
"epoch": 0.36318547258109674,
"grad_norm": 0.03441102167916761,
"learning_rate": 1.4758272081554168e-05,
"loss": 0.3692239999771118,
"memory(GiB)": 77.28,
"step": 1135,
"token_acc": 0.875740776142229,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.36478540858365666,
"grad_norm": 0.03330407208979561,
"learning_rate": 1.4712536191859934e-05,
"loss": 0.37282414436340333,
"memory(GiB)": 77.28,
"step": 1140,
"token_acc": 0.9172197640117994,
"train_speed(iter/s)": 0.014412
},
{
"epoch": 0.3663853445862166,
"grad_norm": 0.035699108901044725,
"learning_rate": 1.4666673232256738e-05,
"loss": 0.37760913372039795,
"memory(GiB)": 77.28,
"step": 1145,
"token_acc": 0.8891951488423374,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.36798528058877644,
"grad_norm": 0.03532503045003448,
"learning_rate": 1.4620684439403962e-05,
"loss": 0.37476723194122313,
"memory(GiB)": 77.28,
"step": 1150,
"token_acc": 0.9057826520438684,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.36958521659133636,
"grad_norm": 0.0344910408139177,
"learning_rate": 1.4574571053353987e-05,
"loss": 0.374307918548584,
"memory(GiB)": 77.28,
"step": 1155,
"token_acc": 0.9003899902502438,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.37118515259389623,
"grad_norm": 0.035041872884459944,
"learning_rate": 1.452833431751875e-05,
"loss": 0.3697278738021851,
"memory(GiB)": 77.28,
"step": 1160,
"token_acc": 0.9063315478643044,
"train_speed(iter/s)": 0.014412
},
{
"epoch": 0.37278508859645615,
"grad_norm": 0.03519132694721856,
"learning_rate": 1.448197547863622e-05,
"loss": 0.36422038078308105,
"memory(GiB)": 77.28,
"step": 1165,
"token_acc": 0.9000765696784073,
"train_speed(iter/s)": 0.014412
},
{
"epoch": 0.374385024599016,
"grad_norm": 0.03547211442268733,
"learning_rate": 1.4435495786736796e-05,
"loss": 0.3784764289855957,
"memory(GiB)": 77.28,
"step": 1170,
"token_acc": 0.8931984260820686,
"train_speed(iter/s)": 0.014412
},
{
"epoch": 0.37598496060157593,
"grad_norm": 0.033084975573475006,
"learning_rate": 1.438889649510956e-05,
"loss": 0.3620013236999512,
"memory(GiB)": 77.28,
"step": 1175,
"token_acc": 0.8830564784053156,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.37758489660413586,
"grad_norm": 0.03494219380332394,
"learning_rate": 1.4342178860268523e-05,
"loss": 0.3709207773208618,
"memory(GiB)": 77.28,
"step": 1180,
"token_acc": 0.8974101081216997,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.3791848326066957,
"grad_norm": 0.03635733513697145,
"learning_rate": 1.4295344141918734e-05,
"loss": 0.37572057247161866,
"memory(GiB)": 77.28,
"step": 1185,
"token_acc": 0.8881118881118881,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.38078476860925564,
"grad_norm": 0.036630394189626006,
"learning_rate": 1.4248393602922299e-05,
"loss": 0.38127038478851316,
"memory(GiB)": 77.28,
"step": 1190,
"token_acc": 0.8691920686593667,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.3823847046118155,
"grad_norm": 0.03496102213628827,
"learning_rate": 1.420132850926434e-05,
"loss": 0.37142717838287354,
"memory(GiB)": 77.28,
"step": 1195,
"token_acc": 0.8981158408932309,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.3839846406143754,
"grad_norm": 0.03318251083183633,
"learning_rate": 1.4154150130018867e-05,
"loss": 0.37023210525512695,
"memory(GiB)": 77.28,
"step": 1200,
"token_acc": 0.8824277666727239,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.38558457661693535,
"grad_norm": 0.03307058094990319,
"learning_rate": 1.4106859737314532e-05,
"loss": 0.36745152473449705,
"memory(GiB)": 77.28,
"step": 1205,
"token_acc": 0.8875419619544946,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.3871845126194952,
"grad_norm": 0.035424472590586585,
"learning_rate": 1.4059458606300358e-05,
"loss": 0.3661919832229614,
"memory(GiB)": 77.28,
"step": 1210,
"token_acc": 0.8780977896851976,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.38878444862205513,
"grad_norm": 0.03420289825157965,
"learning_rate": 1.4011948015111334e-05,
"loss": 0.37414982318878176,
"memory(GiB)": 77.28,
"step": 1215,
"token_acc": 0.8649971756731313,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.390384384624615,
"grad_norm": 0.03335207107599188,
"learning_rate": 1.396432924483396e-05,
"loss": 0.3709057569503784,
"memory(GiB)": 77.28,
"step": 1220,
"token_acc": 0.8992544446568533,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.3919843206271749,
"grad_norm": 0.03659090220095111,
"learning_rate": 1.3916603579471705e-05,
"loss": 0.3810150146484375,
"memory(GiB)": 77.28,
"step": 1225,
"token_acc": 0.8939136988882608,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.3935842566297348,
"grad_norm": 0.03381760469834974,
"learning_rate": 1.3868772305910376e-05,
"loss": 0.3754213809967041,
"memory(GiB)": 77.28,
"step": 1230,
"token_acc": 0.8942501005227181,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.3951841926322947,
"grad_norm": 0.03498771807662288,
"learning_rate": 1.3820836713883424e-05,
"loss": 0.3726653099060059,
"memory(GiB)": 77.28,
"step": 1235,
"token_acc": 0.8871177618737801,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.3967841286348546,
"grad_norm": 0.03417566824022459,
"learning_rate": 1.3772798095937172e-05,
"loss": 0.363895320892334,
"memory(GiB)": 77.28,
"step": 1240,
"token_acc": 0.8693128333856291,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.3983840646374145,
"grad_norm": 0.03427076519706647,
"learning_rate": 1.3724657747395957e-05,
"loss": 0.3746422052383423,
"memory(GiB)": 77.28,
"step": 1245,
"token_acc": 0.8969516235917826,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.3999840006399744,
"grad_norm": 0.034195401871935746,
"learning_rate": 1.3676416966327201e-05,
"loss": 0.37307212352752683,
"memory(GiB)": 77.28,
"step": 1250,
"token_acc": 0.8579698957931301,
"train_speed(iter/s)": 0.014414
},
{
"epoch": 0.3999840006399744,
"eval_loss": 0.6099496483802795,
"eval_runtime": 171.3813,
"eval_samples_per_second": 117.212,
"eval_steps_per_second": 0.589,
"eval_token_acc": 0.8910344140161096,
"step": 1250
},
{
"epoch": 0.4015839366425343,
"grad_norm": 0.03442247514389261,
"learning_rate": 1.362807705350641e-05,
"loss": 0.37490437030792234,
"memory(GiB)": 77.28,
"step": 1255,
"token_acc": 0.8993468545892059,
"train_speed(iter/s)": 0.014386
},
{
"epoch": 0.4031838726450942,
"grad_norm": 0.03543108584022621,
"learning_rate": 1.3579639312382105e-05,
"loss": 0.3771961212158203,
"memory(GiB)": 77.28,
"step": 1260,
"token_acc": 0.8801626016260162,
"train_speed(iter/s)": 0.014386
},
{
"epoch": 0.4047838086476541,
"grad_norm": 0.0351732239969475,
"learning_rate": 1.3531105049040667e-05,
"loss": 0.37178664207458495,
"memory(GiB)": 77.28,
"step": 1265,
"token_acc": 0.9065207478340174,
"train_speed(iter/s)": 0.014385
},
{
"epoch": 0.406383744650214,
"grad_norm": 0.0345010504737042,
"learning_rate": 1.3482475572171132e-05,
"loss": 0.3657317399978638,
"memory(GiB)": 77.28,
"step": 1270,
"token_acc": 0.877511961722488,
"train_speed(iter/s)": 0.014385
},
{
"epoch": 0.4079836806527739,
"grad_norm": 0.03426174629461238,
"learning_rate": 1.3433752193029888e-05,
"loss": 0.37921135425567626,
"memory(GiB)": 77.28,
"step": 1275,
"token_acc": 0.9078838174273859,
"train_speed(iter/s)": 0.014385
},
{
"epoch": 0.40958361665533377,
"grad_norm": 0.03606013606177771,
"learning_rate": 1.3384936225405326e-05,
"loss": 0.37555053234100344,
"memory(GiB)": 77.28,
"step": 1280,
"token_acc": 0.8769176512078999,
"train_speed(iter/s)": 0.014388
},
{
"epoch": 0.4111835526578937,
"grad_norm": 0.03638594766243525,
"learning_rate": 1.333602898558242e-05,
"loss": 0.37437245845794676,
"memory(GiB)": 77.28,
"step": 1285,
"token_acc": 0.9019975868078831,
"train_speed(iter/s)": 0.014389
},
{
"epoch": 0.41278348866045356,
"grad_norm": 0.03480203069849946,
"learning_rate": 1.3287031792307226e-05,
"loss": 0.37502617835998536,
"memory(GiB)": 77.28,
"step": 1290,
"token_acc": 0.8862950291809217,
"train_speed(iter/s)": 0.014388
},
{
"epoch": 0.4143834246630135,
"grad_norm": 0.034125749594009575,
"learning_rate": 1.323794596675132e-05,
"loss": 0.36830193996429444,
"memory(GiB)": 77.28,
"step": 1295,
"token_acc": 0.8786538933922869,
"train_speed(iter/s)": 0.01439
},
{
"epoch": 0.4159833606655734,
"grad_norm": 0.03467851818797935,
"learning_rate": 1.318877283247619e-05,
"loss": 0.36499571800231934,
"memory(GiB)": 77.28,
"step": 1300,
"token_acc": 0.9122148024485254,
"train_speed(iter/s)": 0.014391
},
{
"epoch": 0.41758329666813326,
"grad_norm": 0.03351147905784924,
"learning_rate": 1.3139513715397521e-05,
"loss": 0.36349053382873536,
"memory(GiB)": 77.28,
"step": 1305,
"token_acc": 0.8831595210505987,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.4191832326706932,
"grad_norm": 0.036200622491475404,
"learning_rate": 1.3090169943749475e-05,
"loss": 0.3686731576919556,
"memory(GiB)": 77.28,
"step": 1310,
"token_acc": 0.8656188048711413,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.42078316867325305,
"grad_norm": 0.03434195756254507,
"learning_rate": 1.304074284804885e-05,
"loss": 0.37625932693481445,
"memory(GiB)": 77.28,
"step": 1315,
"token_acc": 0.8982833717653087,
"train_speed(iter/s)": 0.014397
},
{
"epoch": 0.42238310467581297,
"grad_norm": 0.034749866744640846,
"learning_rate": 1.2991233761059214e-05,
"loss": 0.37158203125,
"memory(GiB)": 77.28,
"step": 1320,
"token_acc": 0.8929796780153074,
"train_speed(iter/s)": 0.014398
},
{
"epoch": 0.4239830406783729,
"grad_norm": 0.03548467311511409,
"learning_rate": 1.2941644017754964e-05,
"loss": 0.37488343715667727,
"memory(GiB)": 77.28,
"step": 1325,
"token_acc": 0.904258943781942,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.42558297668093276,
"grad_norm": 0.0341920805825176,
"learning_rate": 1.289197495528534e-05,
"loss": 0.3711984872817993,
"memory(GiB)": 77.28,
"step": 1330,
"token_acc": 0.9195646027707096,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.4271829126834927,
"grad_norm": 0.03554475718209227,
"learning_rate": 1.284222791293836e-05,
"loss": 0.368884015083313,
"memory(GiB)": 77.28,
"step": 1335,
"token_acc": 0.8715034965034965,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.42878284868605254,
"grad_norm": 0.03575254500276844,
"learning_rate": 1.2792404232104699e-05,
"loss": 0.36724443435668946,
"memory(GiB)": 77.28,
"step": 1340,
"token_acc": 0.8930875576036866,
"train_speed(iter/s)": 0.014401
},
{
"epoch": 0.43038278468861246,
"grad_norm": 0.03441881916218118,
"learning_rate": 1.2742505256241543e-05,
"loss": 0.3715341806411743,
"memory(GiB)": 77.28,
"step": 1345,
"token_acc": 0.853706238998631,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.43198272069117233,
"grad_norm": 0.03496918226927363,
"learning_rate": 1.2692532330836346e-05,
"loss": 0.3687546491622925,
"memory(GiB)": 77.28,
"step": 1350,
"token_acc": 0.8844972353061642,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.43358265669373225,
"grad_norm": 0.0342197412687382,
"learning_rate": 1.2642486803370553e-05,
"loss": 0.3681937217712402,
"memory(GiB)": 77.28,
"step": 1355,
"token_acc": 0.8881036513545347,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.43518259269629217,
"grad_norm": 0.03574024280169566,
"learning_rate": 1.2592370023283268e-05,
"loss": 0.36503190994262696,
"memory(GiB)": 77.28,
"step": 1360,
"token_acc": 0.8921713441654358,
"train_speed(iter/s)": 0.014403
},
{
"epoch": 0.43678252869885204,
"grad_norm": 0.03347504729151743,
"learning_rate": 1.2542183341934873e-05,
"loss": 0.3655604362487793,
"memory(GiB)": 77.28,
"step": 1365,
"token_acc": 0.8905417406749556,
"train_speed(iter/s)": 0.014404
},
{
"epoch": 0.43838246470141196,
"grad_norm": 0.03600326432455147,
"learning_rate": 1.2491928112570568e-05,
"loss": 0.366928768157959,
"memory(GiB)": 77.28,
"step": 1370,
"token_acc": 0.896969696969697,
"train_speed(iter/s)": 0.014405
},
{
"epoch": 0.4399824007039718,
"grad_norm": 0.03491325824773157,
"learning_rate": 1.2441605690283915e-05,
"loss": 0.37325053215026854,
"memory(GiB)": 77.28,
"step": 1375,
"token_acc": 0.9224045391811072,
"train_speed(iter/s)": 0.014404
},
{
"epoch": 0.44158233670653174,
"grad_norm": 0.03780738973130896,
"learning_rate": 1.2391217431980273e-05,
"loss": 0.3637607336044312,
"memory(GiB)": 77.28,
"step": 1380,
"token_acc": 0.918383623554433,
"train_speed(iter/s)": 0.014407
},
{
"epoch": 0.44318227270909166,
"grad_norm": 0.035690154757200145,
"learning_rate": 1.234076469634022e-05,
"loss": 0.3695350170135498,
"memory(GiB)": 77.28,
"step": 1385,
"token_acc": 0.9101499423298731,
"train_speed(iter/s)": 0.014405
},
{
"epoch": 0.4447822087116515,
"grad_norm": 0.03590046624532822,
"learning_rate": 1.2290248843782915e-05,
"loss": 0.364530086517334,
"memory(GiB)": 77.28,
"step": 1390,
"token_acc": 0.9150886503437462,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.44638214471421145,
"grad_norm": 0.03472603260778397,
"learning_rate": 1.2239671236429413e-05,
"loss": 0.3661569833755493,
"memory(GiB)": 77.28,
"step": 1395,
"token_acc": 0.8987637821583695,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.4479820807167713,
"grad_norm": 0.03445762563216705,
"learning_rate": 1.218903323806595e-05,
"loss": 0.3707982778549194,
"memory(GiB)": 77.28,
"step": 1400,
"token_acc": 0.8745701357466064,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.44958201671933123,
"grad_norm": 0.035218814155010984,
"learning_rate": 1.2138336214107148e-05,
"loss": 0.3614500045776367,
"memory(GiB)": 77.28,
"step": 1405,
"token_acc": 0.8926116838487973,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.4511819527218911,
"grad_norm": 0.03368066952337403,
"learning_rate": 1.2087581531559208e-05,
"loss": 0.3688710451126099,
"memory(GiB)": 77.28,
"step": 1410,
"token_acc": 0.8967142129393785,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.452781888724451,
"grad_norm": 0.03439504879116651,
"learning_rate": 1.2036770558983067e-05,
"loss": 0.3658963441848755,
"memory(GiB)": 77.28,
"step": 1415,
"token_acc": 0.8647400820793434,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.45438182472701094,
"grad_norm": 0.03294429069191412,
"learning_rate": 1.1985904666457455e-05,
"loss": 0.36890151500701907,
"memory(GiB)": 77.28,
"step": 1420,
"token_acc": 0.9237490071485306,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.4559817607295708,
"grad_norm": 0.03476827611852477,
"learning_rate": 1.1934985225541998e-05,
"loss": 0.3723160266876221,
"memory(GiB)": 77.28,
"step": 1425,
"token_acc": 0.9109958092197166,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.4575816967321307,
"grad_norm": 0.03464210636372699,
"learning_rate": 1.18840136092402e-05,
"loss": 0.3672841310501099,
"memory(GiB)": 77.28,
"step": 1430,
"token_acc": 0.8790931989924433,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.4591816327346906,
"grad_norm": 0.03405244756060422,
"learning_rate": 1.1832991191962435e-05,
"loss": 0.3602238416671753,
"memory(GiB)": 77.28,
"step": 1435,
"token_acc": 0.8997259591429995,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.4607815687372505,
"grad_norm": 0.03479537032371878,
"learning_rate": 1.1781919349488894e-05,
"loss": 0.3703394889831543,
"memory(GiB)": 77.28,
"step": 1440,
"token_acc": 0.8827277423798864,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.46238150473981043,
"grad_norm": 0.03630153249015714,
"learning_rate": 1.1730799458932473e-05,
"loss": 0.37370154857635496,
"memory(GiB)": 77.28,
"step": 1445,
"token_acc": 0.9269114990969296,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.4639814407423703,
"grad_norm": 0.03556854160517035,
"learning_rate": 1.1679632898701649e-05,
"loss": 0.36541726589202883,
"memory(GiB)": 77.28,
"step": 1450,
"token_acc": 0.9014066496163683,
"train_speed(iter/s)": 0.014415
},
{
"epoch": 0.4655813767449302,
"grad_norm": 0.03600309817806044,
"learning_rate": 1.1628421048463315e-05,
"loss": 0.37421836853027346,
"memory(GiB)": 77.28,
"step": 1455,
"token_acc": 0.8827207275483138,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.4671813127474901,
"grad_norm": 0.03322462203870746,
"learning_rate": 1.1577165289105565e-05,
"loss": 0.36063060760498045,
"memory(GiB)": 77.28,
"step": 1460,
"token_acc": 0.8796332422941865,
"train_speed(iter/s)": 0.014414
},
{
"epoch": 0.46878124875005,
"grad_norm": 0.03627115996462612,
"learning_rate": 1.1525867002700484e-05,
"loss": 0.3762346744537354,
"memory(GiB)": 77.28,
"step": 1465,
"token_acc": 0.89023396577814,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.47038118475260987,
"grad_norm": 0.035647939753576684,
"learning_rate": 1.1474527572466847e-05,
"loss": 0.3616278409957886,
"memory(GiB)": 77.28,
"step": 1470,
"token_acc": 0.8720430107526882,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.4719811207551698,
"grad_norm": 0.035285173854949954,
"learning_rate": 1.1423148382732854e-05,
"loss": 0.37021946907043457,
"memory(GiB)": 77.28,
"step": 1475,
"token_acc": 0.9171724384148519,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.4735810567577297,
"grad_norm": 0.035629576623768464,
"learning_rate": 1.1371730818898785e-05,
"loss": 0.3663011074066162,
"memory(GiB)": 77.28,
"step": 1480,
"token_acc": 0.9093475533249686,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.4751809927602896,
"grad_norm": 0.036145329500511955,
"learning_rate": 1.132027626739965e-05,
"loss": 0.3670144557952881,
"memory(GiB)": 77.28,
"step": 1485,
"token_acc": 0.9013305685156385,
"train_speed(iter/s)": 0.014419
},
{
"epoch": 0.4767809287628495,
"grad_norm": 0.03762454278136116,
"learning_rate": 1.1268786115667798e-05,
"loss": 0.370996880531311,
"memory(GiB)": 77.28,
"step": 1490,
"token_acc": 0.8893922824558663,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.47838086476540936,
"grad_norm": 0.03489585116510581,
"learning_rate": 1.1217261752095518e-05,
"loss": 0.3688071250915527,
"memory(GiB)": 77.28,
"step": 1495,
"token_acc": 0.8983111749910169,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.4799808007679693,
"grad_norm": 0.03446273860874737,
"learning_rate": 1.1165704565997593e-05,
"loss": 0.36016933917999266,
"memory(GiB)": 77.28,
"step": 1500,
"token_acc": 0.8913821585903083,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.4799808007679693,
"eval_loss": 0.6074870824813843,
"eval_runtime": 172.104,
"eval_samples_per_second": 116.72,
"eval_steps_per_second": 0.587,
"eval_token_acc": 0.8923138161661085,
"step": 1500
},
{
"epoch": 0.4815807367705292,
"grad_norm": 0.03567717193695566,
"learning_rate": 1.1114115947573834e-05,
"loss": 0.3687129497528076,
"memory(GiB)": 77.28,
"step": 1505,
"token_acc": 0.8902910121040433,
"train_speed(iter/s)": 0.014394
},
{
"epoch": 0.48318067277308907,
"grad_norm": 0.035522027399690424,
"learning_rate": 1.1062497287871606e-05,
"loss": 0.3638231039047241,
"memory(GiB)": 77.28,
"step": 1510,
"token_acc": 0.8678424740275429,
"train_speed(iter/s)": 0.014394
},
{
"epoch": 0.484780608775649,
"grad_norm": 0.03466224643090752,
"learning_rate": 1.1010849978748314e-05,
"loss": 0.3652355194091797,
"memory(GiB)": 77.28,
"step": 1515,
"token_acc": 0.8848318880267763,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.48638054477820886,
"grad_norm": 0.0354542903926529,
"learning_rate": 1.0959175412833869e-05,
"loss": 0.3614229917526245,
"memory(GiB)": 77.28,
"step": 1520,
"token_acc": 0.8956547443097842,
"train_speed(iter/s)": 0.014394
},
{
"epoch": 0.4879804807807688,
"grad_norm": 0.03440586258662547,
"learning_rate": 1.0907474983493144e-05,
"loss": 0.3634510517120361,
"memory(GiB)": 77.28,
"step": 1525,
"token_acc": 0.9006639427987743,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.48958041678332864,
"grad_norm": 0.0360801859171815,
"learning_rate": 1.08557500847884e-05,
"loss": 0.36115612983703616,
"memory(GiB)": 77.28,
"step": 1530,
"token_acc": 0.9074234296591106,
"train_speed(iter/s)": 0.014393
},
{
"epoch": 0.49118035278588856,
"grad_norm": 0.03497423282601686,
"learning_rate": 1.080400211144169e-05,
"loss": 0.3642597675323486,
"memory(GiB)": 77.28,
"step": 1535,
"token_acc": 0.8553005879006258,
"train_speed(iter/s)": 0.014394
},
{
"epoch": 0.4927802887884485,
"grad_norm": 0.03446763731370447,
"learning_rate": 1.0752232458797262e-05,
"loss": 0.3559999942779541,
"memory(GiB)": 77.28,
"step": 1540,
"token_acc": 0.8824950269963058,
"train_speed(iter/s)": 0.014397
},
{
"epoch": 0.49438022479100835,
"grad_norm": 0.035387308834996176,
"learning_rate": 1.070044252278393e-05,
"loss": 0.3755119562149048,
"memory(GiB)": 77.28,
"step": 1545,
"token_acc": 0.8683636363636363,
"train_speed(iter/s)": 0.014398
},
{
"epoch": 0.49598016079356827,
"grad_norm": 0.035623508164582596,
"learning_rate": 1.064863369987743e-05,
"loss": 0.36371660232543945,
"memory(GiB)": 77.28,
"step": 1550,
"token_acc": 0.9095354523227384,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.49758009679612814,
"grad_norm": 0.03586927734844086,
"learning_rate": 1.0596807387062772e-05,
"loss": 0.3677802562713623,
"memory(GiB)": 77.28,
"step": 1555,
"token_acc": 0.9039025142680858,
"train_speed(iter/s)": 0.0144
},
{
"epoch": 0.49918003279868806,
"grad_norm": 0.03653622777112098,
"learning_rate": 1.0544964981796563e-05,
"loss": 0.3684211254119873,
"memory(GiB)": 77.28,
"step": 1560,
"token_acc": 0.868405540819334,
"train_speed(iter/s)": 0.014403
},
{
"epoch": 0.500779968801248,
"grad_norm": 0.0370656544294769,
"learning_rate": 1.0493107881969335e-05,
"loss": 0.3586920738220215,
"memory(GiB)": 77.28,
"step": 1565,
"token_acc": 0.9100284977608902,
"train_speed(iter/s)": 0.014404
},
{
"epoch": 0.5023799048038079,
"grad_norm": 0.03616388731261157,
"learning_rate": 1.0441237485867845e-05,
"loss": 0.36218621730804446,
"memory(GiB)": 77.28,
"step": 1570,
"token_acc": 0.902942631058358,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.5039798408063677,
"grad_norm": 0.03609161295790287,
"learning_rate": 1.0389355192137379e-05,
"loss": 0.3653876304626465,
"memory(GiB)": 77.28,
"step": 1575,
"token_acc": 0.9041706462909901,
"train_speed(iter/s)": 0.014407
},
{
"epoch": 0.5055797768089276,
"grad_norm": 0.03748808681261972,
"learning_rate": 1.0337462399744025e-05,
"loss": 0.37090017795562746,
"memory(GiB)": 77.28,
"step": 1580,
"token_acc": 0.8675850435760473,
"train_speed(iter/s)": 0.014405
},
{
"epoch": 0.5071797128114875,
"grad_norm": 0.0345478093663887,
"learning_rate": 1.0285560507936962e-05,
"loss": 0.3756566047668457,
"memory(GiB)": 77.28,
"step": 1585,
"token_acc": 0.8505338078291815,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.5087796488140475,
"grad_norm": 0.03650247257124013,
"learning_rate": 1.0233650916210736e-05,
"loss": 0.3637782096862793,
"memory(GiB)": 77.28,
"step": 1590,
"token_acc": 0.9002235318024792,
"train_speed(iter/s)": 0.014405
},
{
"epoch": 0.5103795848166074,
"grad_norm": 0.03633358814639768,
"learning_rate": 1.0181735024267504e-05,
"loss": 0.3628427028656006,
"memory(GiB)": 77.28,
"step": 1595,
"token_acc": 0.8564662273476112,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.5119795208191672,
"grad_norm": 0.037908299488290956,
"learning_rate": 1.012981423197931e-05,
"loss": 0.3728133201599121,
"memory(GiB)": 77.28,
"step": 1600,
"token_acc": 0.8976991588322613,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.5135794568217271,
"grad_norm": 0.03477409396173477,
"learning_rate": 1.007788993935033e-05,
"loss": 0.36496148109436033,
"memory(GiB)": 77.28,
"step": 1605,
"token_acc": 0.8824123989218329,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.515179392824287,
"grad_norm": 0.03591338948302039,
"learning_rate": 1.002596354647912e-05,
"loss": 0.3671183347702026,
"memory(GiB)": 77.28,
"step": 1610,
"token_acc": 0.9008127633955448,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.516779328826847,
"grad_norm": 0.035196111530376294,
"learning_rate": 9.974036453520881e-06,
"loss": 0.3602726459503174,
"memory(GiB)": 77.28,
"step": 1615,
"token_acc": 0.8955383382313652,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.5183792648294068,
"grad_norm": 0.03748636943340592,
"learning_rate": 9.922110060649672e-06,
"loss": 0.36945409774780275,
"memory(GiB)": 77.28,
"step": 1620,
"token_acc": 0.9212632180623035,
"train_speed(iter/s)": 0.014412
},
{
"epoch": 0.5199792008319667,
"grad_norm": 0.03548428460759863,
"learning_rate": 9.870185768020694e-06,
"loss": 0.3491816997528076,
"memory(GiB)": 77.28,
"step": 1625,
"token_acc": 0.9078094620868438,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.5215791368345266,
"grad_norm": 0.03518573566978696,
"learning_rate": 9.818264975732497e-06,
"loss": 0.3619969367980957,
"memory(GiB)": 77.28,
"step": 1630,
"token_acc": 0.9038128249566725,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.5231790728370865,
"grad_norm": 0.03522651488263579,
"learning_rate": 9.766349083789266e-06,
"loss": 0.36349639892578123,
"memory(GiB)": 77.28,
"step": 1635,
"token_acc": 0.8999687890137328,
"train_speed(iter/s)": 0.014409
},
{
"epoch": 0.5247790088396465,
"grad_norm": 0.03809564693798896,
"learning_rate": 9.71443949206304e-06,
"loss": 0.3725806713104248,
"memory(GiB)": 77.28,
"step": 1640,
"token_acc": 0.9121447028423773,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.5263789448422063,
"grad_norm": 0.034721878832050516,
"learning_rate": 9.662537600255979e-06,
"loss": 0.363213849067688,
"memory(GiB)": 77.28,
"step": 1645,
"token_acc": 0.9216789268714842,
"train_speed(iter/s)": 0.01441
},
{
"epoch": 0.5279788808447662,
"grad_norm": 0.03790554016155405,
"learning_rate": 9.610644807862625e-06,
"loss": 0.3574589729309082,
"memory(GiB)": 77.28,
"step": 1650,
"token_acc": 0.8960802187784868,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.5295788168473261,
"grad_norm": 0.03479166503013798,
"learning_rate": 9.558762514132157e-06,
"loss": 0.36415691375732423,
"memory(GiB)": 77.28,
"step": 1655,
"token_acc": 0.8750883808625972,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.531178752849886,
"grad_norm": 0.035643614279757305,
"learning_rate": 9.506892118030668e-06,
"loss": 0.35752391815185547,
"memory(GiB)": 77.28,
"step": 1660,
"token_acc": 0.8826297984997794,
"train_speed(iter/s)": 0.014414
},
{
"epoch": 0.532778688852446,
"grad_norm": 0.0354932657107638,
"learning_rate": 9.455035018203439e-06,
"loss": 0.3576699495315552,
"memory(GiB)": 77.28,
"step": 1665,
"token_acc": 0.9069622618009715,
"train_speed(iter/s)": 0.014412
},
{
"epoch": 0.5343786248550058,
"grad_norm": 0.03500590822032312,
"learning_rate": 9.40319261293723e-06,
"loss": 0.3677717447280884,
"memory(GiB)": 77.28,
"step": 1670,
"token_acc": 0.9211569519894288,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.5359785608575657,
"grad_norm": 0.0342264071437337,
"learning_rate": 9.351366300122569e-06,
"loss": 0.36440818309783934,
"memory(GiB)": 77.28,
"step": 1675,
"token_acc": 0.8545367258761402,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.5375784968601256,
"grad_norm": 0.035171456175800336,
"learning_rate": 9.299557477216073e-06,
"loss": 0.3585089445114136,
"memory(GiB)": 77.28,
"step": 1680,
"token_acc": 0.8948815566835872,
"train_speed(iter/s)": 0.014414
},
{
"epoch": 0.5391784328626855,
"grad_norm": 0.035301103192222384,
"learning_rate": 9.247767541202738e-06,
"loss": 0.364825439453125,
"memory(GiB)": 77.28,
"step": 1685,
"token_acc": 0.9007202881152461,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.5407783688652454,
"grad_norm": 0.0364786603543792,
"learning_rate": 9.195997888558312e-06,
"loss": 0.36471312046051024,
"memory(GiB)": 77.28,
"step": 1690,
"token_acc": 0.9036003130707018,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.5423783048678052,
"grad_norm": 0.03610181518648113,
"learning_rate": 9.144249915211605e-06,
"loss": 0.363938045501709,
"memory(GiB)": 77.28,
"step": 1695,
"token_acc": 0.8853854642913448,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.5439782408703652,
"grad_norm": 0.03450955343562785,
"learning_rate": 9.092525016506858e-06,
"loss": 0.3608727931976318,
"memory(GiB)": 77.28,
"step": 1700,
"token_acc": 0.9012345679012346,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.5455781768729251,
"grad_norm": 0.03928334892137232,
"learning_rate": 9.040824587166136e-06,
"loss": 0.36118714809417723,
"memory(GiB)": 77.28,
"step": 1705,
"token_acc": 0.910617705664674,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.547178112875485,
"grad_norm": 0.03595714484013575,
"learning_rate": 8.98915002125169e-06,
"loss": 0.35936105251312256,
"memory(GiB)": 77.28,
"step": 1710,
"token_acc": 0.8989370970552361,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.5487780488780449,
"grad_norm": 0.037004676299287526,
"learning_rate": 8.9375027121284e-06,
"loss": 0.36121673583984376,
"memory(GiB)": 77.28,
"step": 1715,
"token_acc": 0.8800587685321224,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.5503779848806047,
"grad_norm": 0.03719630007378892,
"learning_rate": 8.885884052426168e-06,
"loss": 0.3646020650863647,
"memory(GiB)": 77.28,
"step": 1720,
"token_acc": 0.886611426079372,
"train_speed(iter/s)": 0.014419
},
{
"epoch": 0.5519779208831647,
"grad_norm": 0.03665089520428984,
"learning_rate": 8.83429543400241e-06,
"loss": 0.36258678436279296,
"memory(GiB)": 77.28,
"step": 1725,
"token_acc": 0.9009743487770928,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.5535778568857246,
"grad_norm": 0.036346266670361026,
"learning_rate": 8.78273824790448e-06,
"loss": 0.34870684146881104,
"memory(GiB)": 77.28,
"step": 1730,
"token_acc": 0.8874141161773891,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.5551777928882845,
"grad_norm": 0.03699883692335831,
"learning_rate": 8.731213884332205e-06,
"loss": 0.3484686851501465,
"memory(GiB)": 77.28,
"step": 1735,
"token_acc": 0.8768292682926829,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.5567777288908443,
"grad_norm": 0.034484229533255854,
"learning_rate": 8.679723732600355e-06,
"loss": 0.3594592809677124,
"memory(GiB)": 77.28,
"step": 1740,
"token_acc": 0.9233852496564361,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.5583776648934042,
"grad_norm": 0.03539114391370881,
"learning_rate": 8.628269181101216e-06,
"loss": 0.3632354736328125,
"memory(GiB)": 77.28,
"step": 1745,
"token_acc": 0.9032677848467322,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.5599776008959642,
"grad_norm": 0.037092075176258815,
"learning_rate": 8.576851617267151e-06,
"loss": 0.36093626022338865,
"memory(GiB)": 77.28,
"step": 1750,
"token_acc": 0.8888888888888888,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.5599776008959642,
"eval_loss": 0.6050233244895935,
"eval_runtime": 160.4027,
"eval_samples_per_second": 125.235,
"eval_steps_per_second": 0.63,
"eval_token_acc": 0.8933715689431194,
"step": 1750
},
{
"epoch": 0.5615775368985241,
"grad_norm": 0.03548048223547666,
"learning_rate": 8.525472427533156e-06,
"loss": 0.3627908229827881,
"memory(GiB)": 77.28,
"step": 1755,
"token_acc": 0.8926028719681429,
"train_speed(iter/s)": 0.014398
},
{
"epoch": 0.563177472901084,
"grad_norm": 0.03655306695315087,
"learning_rate": 8.474132997299521e-06,
"loss": 0.36844007968902587,
"memory(GiB)": 77.28,
"step": 1760,
"token_acc": 0.9042783419344098,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.5647774089036438,
"grad_norm": 0.035314820603192965,
"learning_rate": 8.422834710894434e-06,
"loss": 0.3652467966079712,
"memory(GiB)": 77.28,
"step": 1765,
"token_acc": 0.9266847055791779,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.5663773449062037,
"grad_norm": 0.03577687703884473,
"learning_rate": 8.371578951536689e-06,
"loss": 0.3631904602050781,
"memory(GiB)": 77.28,
"step": 1770,
"token_acc": 0.9114650595494332,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.5679772809087636,
"grad_norm": 0.034291004661375586,
"learning_rate": 8.320367101298351e-06,
"loss": 0.3591639280319214,
"memory(GiB)": 77.28,
"step": 1775,
"token_acc": 0.8908784817875727,
"train_speed(iter/s)": 0.014399
},
{
"epoch": 0.5695772169113236,
"grad_norm": 0.03531566113853678,
"learning_rate": 8.26920054106753e-06,
"loss": 0.36348772048950195,
"memory(GiB)": 77.28,
"step": 1780,
"token_acc": 0.9099979214300561,
"train_speed(iter/s)": 0.014401
},
{
"epoch": 0.5711771529138835,
"grad_norm": 0.034798094575765916,
"learning_rate": 8.218080650511107e-06,
"loss": 0.35968499183654784,
"memory(GiB)": 77.28,
"step": 1785,
"token_acc": 0.8964790217162134,
"train_speed(iter/s)": 0.014402
},
{
"epoch": 0.5727770889164433,
"grad_norm": 0.03657750435790097,
"learning_rate": 8.167008808037568e-06,
"loss": 0.3568159341812134,
"memory(GiB)": 77.28,
"step": 1790,
"token_acc": 0.905320813771518,
"train_speed(iter/s)": 0.014402
},
{
"epoch": 0.5743770249190032,
"grad_norm": 0.034079547262996786,
"learning_rate": 8.115986390759805e-06,
"loss": 0.3550254821777344,
"memory(GiB)": 77.28,
"step": 1795,
"token_acc": 0.8698279018674479,
"train_speed(iter/s)": 0.014402
},
{
"epoch": 0.5759769609215631,
"grad_norm": 0.0358502386641742,
"learning_rate": 8.065014774458004e-06,
"loss": 0.3728140592575073,
"memory(GiB)": 77.28,
"step": 1800,
"token_acc": 0.8613029680791487,
"train_speed(iter/s)": 0.014403
},
{
"epoch": 0.5775768969241231,
"grad_norm": 0.03701314908573154,
"learning_rate": 8.014095333542548e-06,
"loss": 0.36500091552734376,
"memory(GiB)": 77.28,
"step": 1805,
"token_acc": 0.8857192859642982,
"train_speed(iter/s)": 0.014405
},
{
"epoch": 0.579176832926683,
"grad_norm": 0.03679183269002458,
"learning_rate": 7.963229441016938e-06,
"loss": 0.3736963987350464,
"memory(GiB)": 77.28,
"step": 1810,
"token_acc": 0.9040948275862069,
"train_speed(iter/s)": 0.014406
},
{
"epoch": 0.5807767689292428,
"grad_norm": 0.03681323611591806,
"learning_rate": 7.912418468440794e-06,
"loss": 0.35898847579956056,
"memory(GiB)": 77.28,
"step": 1815,
"token_acc": 0.9207317073170732,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.5823767049318027,
"grad_norm": 0.0357736878813674,
"learning_rate": 7.861663785892857e-06,
"loss": 0.361141300201416,
"memory(GiB)": 77.28,
"step": 1820,
"token_acc": 0.9049714034315882,
"train_speed(iter/s)": 0.014408
},
{
"epoch": 0.5839766409343626,
"grad_norm": 0.0351745332589475,
"learning_rate": 7.810966761934053e-06,
"loss": 0.3606626272201538,
"memory(GiB)": 77.28,
"step": 1825,
"token_acc": 0.8948683015440508,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.5855765769369226,
"grad_norm": 0.037435806949626366,
"learning_rate": 7.760328763570589e-06,
"loss": 0.3612012147903442,
"memory(GiB)": 77.28,
"step": 1830,
"token_acc": 0.8970428858956495,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.5871765129394825,
"grad_norm": 0.03532540907383151,
"learning_rate": 7.709751156217088e-06,
"loss": 0.3607369661331177,
"memory(GiB)": 77.28,
"step": 1835,
"token_acc": 0.8445970365016263,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.5887764489420423,
"grad_norm": 0.037979717396771834,
"learning_rate": 7.659235303659784e-06,
"loss": 0.36890883445739747,
"memory(GiB)": 77.28,
"step": 1840,
"token_acc": 0.9026708176306735,
"train_speed(iter/s)": 0.014411
},
{
"epoch": 0.5903763849446022,
"grad_norm": 0.036073467557711535,
"learning_rate": 7.608782568019729e-06,
"loss": 0.35541131496429446,
"memory(GiB)": 77.28,
"step": 1845,
"token_acc": 0.8726491133799033,
"train_speed(iter/s)": 0.014415
},
{
"epoch": 0.5919763209471621,
"grad_norm": 0.03583872104637772,
"learning_rate": 7.558394309716088e-06,
"loss": 0.36942641735076903,
"memory(GiB)": 77.28,
"step": 1850,
"token_acc": 0.8708656432979902,
"train_speed(iter/s)": 0.014415
},
{
"epoch": 0.593576256949722,
"grad_norm": 0.036236485857737255,
"learning_rate": 7.508071887429433e-06,
"loss": 0.3710246801376343,
"memory(GiB)": 77.28,
"step": 1855,
"token_acc": 0.921398891966759,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.5951761929522819,
"grad_norm": 0.03640169386223587,
"learning_rate": 7.4578166580651335e-06,
"loss": 0.3630064010620117,
"memory(GiB)": 77.28,
"step": 1860,
"token_acc": 0.9057997783524196,
"train_speed(iter/s)": 0.014416
},
{
"epoch": 0.5967761289548418,
"grad_norm": 0.03390146765654374,
"learning_rate": 7.4076299767167325e-06,
"loss": 0.3687079429626465,
"memory(GiB)": 77.28,
"step": 1865,
"token_acc": 0.8828963051251489,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.5983760649574017,
"grad_norm": 0.034010107936428,
"learning_rate": 7.35751319662945e-06,
"loss": 0.36475975513458253,
"memory(GiB)": 77.28,
"step": 1870,
"token_acc": 0.9084216196803735,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.5999760009599616,
"grad_norm": 0.03677793324767255,
"learning_rate": 7.307467669163655e-06,
"loss": 0.36134514808654783,
"memory(GiB)": 77.28,
"step": 1875,
"token_acc": 0.8969276511397423,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.6015759369625215,
"grad_norm": 0.03620375763366839,
"learning_rate": 7.25749474375846e-06,
"loss": 0.3645354747772217,
"memory(GiB)": 77.28,
"step": 1880,
"token_acc": 0.9285598836269597,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.6031758729650813,
"grad_norm": 0.03789666553237776,
"learning_rate": 7.207595767895303e-06,
"loss": 0.3591428756713867,
"memory(GiB)": 77.28,
"step": 1885,
"token_acc": 0.8843816469158311,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.6047758089676413,
"grad_norm": 0.03881137375316804,
"learning_rate": 7.157772087061645e-06,
"loss": 0.3609945297241211,
"memory(GiB)": 77.28,
"step": 1890,
"token_acc": 0.8922645477915401,
"train_speed(iter/s)": 0.014419
},
{
"epoch": 0.6063757449702012,
"grad_norm": 0.036554160329644855,
"learning_rate": 7.108025044714661e-06,
"loss": 0.35931782722473143,
"memory(GiB)": 77.28,
"step": 1895,
"token_acc": 0.9164502825721704,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.6079756809727611,
"grad_norm": 0.035159911064239865,
"learning_rate": 7.058355982245038e-06,
"loss": 0.35569937229156495,
"memory(GiB)": 77.28,
"step": 1900,
"token_acc": 0.8982567884679853,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.609575616975321,
"grad_norm": 0.03716807984128876,
"learning_rate": 7.00876623894079e-06,
"loss": 0.35586116313934324,
"memory(GiB)": 77.28,
"step": 1905,
"token_acc": 0.8946164199192463,
"train_speed(iter/s)": 0.014419
},
{
"epoch": 0.6111755529778808,
"grad_norm": 0.037084671519224476,
"learning_rate": 6.959257151951153e-06,
"loss": 0.3600043773651123,
"memory(GiB)": 77.28,
"step": 1910,
"token_acc": 0.9071520500091929,
"train_speed(iter/s)": 0.014421
},
{
"epoch": 0.6127754889804408,
"grad_norm": 0.03475843599873702,
"learning_rate": 6.909830056250527e-06,
"loss": 0.36089887619018557,
"memory(GiB)": 77.28,
"step": 1915,
"token_acc": 0.9130308318789995,
"train_speed(iter/s)": 0.014422
},
{
"epoch": 0.6143754249830007,
"grad_norm": 0.0383438952624416,
"learning_rate": 6.860486284602479e-06,
"loss": 0.35850651264190675,
"memory(GiB)": 77.28,
"step": 1920,
"token_acc": 0.9072142546718818,
"train_speed(iter/s)": 0.014423
},
{
"epoch": 0.6159753609855606,
"grad_norm": 0.038359374478266664,
"learning_rate": 6.8112271675238154e-06,
"loss": 0.3597878456115723,
"memory(GiB)": 77.28,
"step": 1925,
"token_acc": 0.8963350785340314,
"train_speed(iter/s)": 0.014425
},
{
"epoch": 0.6175752969881205,
"grad_norm": 0.03627563124845106,
"learning_rate": 6.762054033248681e-06,
"loss": 0.35578844547271726,
"memory(GiB)": 77.28,
"step": 1930,
"token_acc": 0.8670747704416266,
"train_speed(iter/s)": 0.014425
},
{
"epoch": 0.6191752329906803,
"grad_norm": 0.03684144075866297,
"learning_rate": 6.712968207692778e-06,
"loss": 0.3531275033950806,
"memory(GiB)": 77.28,
"step": 1935,
"token_acc": 0.8941378235110695,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.6207751689932403,
"grad_norm": 0.03687953126630672,
"learning_rate": 6.663971014417585e-06,
"loss": 0.3559092044830322,
"memory(GiB)": 77.28,
"step": 1940,
"token_acc": 0.8794438073394495,
"train_speed(iter/s)": 0.014427
},
{
"epoch": 0.6223751049958002,
"grad_norm": 0.03271894900825819,
"learning_rate": 6.615063774594677e-06,
"loss": 0.3499966859817505,
"memory(GiB)": 77.28,
"step": 1945,
"token_acc": 0.9143808777429467,
"train_speed(iter/s)": 0.014427
},
{
"epoch": 0.6239750409983601,
"grad_norm": 0.03670229290341502,
"learning_rate": 6.566247806970119e-06,
"loss": 0.3593435525894165,
"memory(GiB)": 77.28,
"step": 1950,
"token_acc": 0.8722057635335309,
"train_speed(iter/s)": 0.014427
},
{
"epoch": 0.62557497700092,
"grad_norm": 0.03589472224235785,
"learning_rate": 6.5175244278288705e-06,
"loss": 0.35672483444213865,
"memory(GiB)": 77.28,
"step": 1955,
"token_acc": 0.8869902912621359,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.6271749130034798,
"grad_norm": 0.0354115189065044,
"learning_rate": 6.468894950959336e-06,
"loss": 0.3563361167907715,
"memory(GiB)": 77.28,
"step": 1960,
"token_acc": 0.872582685703958,
"train_speed(iter/s)": 0.014427
},
{
"epoch": 0.6287748490060397,
"grad_norm": 0.03855982219631724,
"learning_rate": 6.420360687617897e-06,
"loss": 0.35960986614227297,
"memory(GiB)": 77.28,
"step": 1965,
"token_acc": 0.9085308941571775,
"train_speed(iter/s)": 0.014429
},
{
"epoch": 0.6303747850085997,
"grad_norm": 0.0363939489470217,
"learning_rate": 6.3719229464935915e-06,
"loss": 0.36258764266967775,
"memory(GiB)": 77.28,
"step": 1970,
"token_acc": 0.8915779283639884,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.6319747210111596,
"grad_norm": 0.03622652969014867,
"learning_rate": 6.323583033672799e-06,
"loss": 0.35306107997894287,
"memory(GiB)": 77.28,
"step": 1975,
"token_acc": 0.892795055051188,
"train_speed(iter/s)": 0.014429
},
{
"epoch": 0.6335746570137194,
"grad_norm": 0.0359741868188003,
"learning_rate": 6.275342252604044e-06,
"loss": 0.3589993715286255,
"memory(GiB)": 77.28,
"step": 1980,
"token_acc": 0.8946890603722197,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.6351745930162793,
"grad_norm": 0.03712206781639858,
"learning_rate": 6.22720190406283e-06,
"loss": 0.3716681241989136,
"memory(GiB)": 77.28,
"step": 1985,
"token_acc": 0.9078609119199026,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.6367745290188392,
"grad_norm": 0.0356723794869841,
"learning_rate": 6.179163286116581e-06,
"loss": 0.35133976936340333,
"memory(GiB)": 77.28,
"step": 1990,
"token_acc": 0.9327153762268267,
"train_speed(iter/s)": 0.014431
},
{
"epoch": 0.6383744650213992,
"grad_norm": 0.03536609511126974,
"learning_rate": 6.13122769408963e-06,
"loss": 0.35833446979522704,
"memory(GiB)": 77.28,
"step": 1995,
"token_acc": 0.882003614768913,
"train_speed(iter/s)": 0.014432
},
{
"epoch": 0.6399744010239591,
"grad_norm": 0.03362321620964987,
"learning_rate": 6.083396420528298e-06,
"loss": 0.3585667610168457,
"memory(GiB)": 77.28,
"step": 2000,
"token_acc": 0.9170406167299505,
"train_speed(iter/s)": 0.014433
},
{
"epoch": 0.6399744010239591,
"eval_loss": 0.6020672917366028,
"eval_runtime": 164.3521,
"eval_samples_per_second": 122.225,
"eval_steps_per_second": 0.615,
"eval_token_acc": 0.8943001355471165,
"step": 2000
},
{
"epoch": 0.6415743370265189,
"grad_norm": 0.03472639275538625,
"learning_rate": 6.0356707551660434e-06,
"loss": 0.36132421493530276,
"memory(GiB)": 77.28,
"step": 2005,
"token_acc": 0.915687276443536,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.6431742730290788,
"grad_norm": 0.0354392362366712,
"learning_rate": 5.988051984888668e-06,
"loss": 0.35641605854034425,
"memory(GiB)": 77.28,
"step": 2010,
"token_acc": 0.9036523929471033,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.6447742090316387,
"grad_norm": 0.036793660802490545,
"learning_rate": 5.940541393699646e-06,
"loss": 0.35499589443206786,
"memory(GiB)": 77.28,
"step": 2015,
"token_acc": 0.9017251405311106,
"train_speed(iter/s)": 0.014413
},
{
"epoch": 0.6463741450341987,
"grad_norm": 0.0356096679234017,
"learning_rate": 5.893140262685469e-06,
"loss": 0.3537860870361328,
"memory(GiB)": 77.28,
"step": 2020,
"token_acc": 0.9089422028353326,
"train_speed(iter/s)": 0.014415
},
{
"epoch": 0.6479740810367586,
"grad_norm": 0.038785732749065785,
"learning_rate": 5.845849869981137e-06,
"loss": 0.36054995059967043,
"memory(GiB)": 77.28,
"step": 2025,
"token_acc": 0.8981469809655868,
"train_speed(iter/s)": 0.014417
},
{
"epoch": 0.6495740170393184,
"grad_norm": 0.03604630935256211,
"learning_rate": 5.7986714907356614e-06,
"loss": 0.3670691728591919,
"memory(GiB)": 77.28,
"step": 2030,
"token_acc": 0.9045626349892009,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.6511739530418783,
"grad_norm": 0.03791812035130847,
"learning_rate": 5.751606397077703e-06,
"loss": 0.35528743267059326,
"memory(GiB)": 77.28,
"step": 2035,
"token_acc": 0.9075596816976127,
"train_speed(iter/s)": 0.014418
},
{
"epoch": 0.6527738890444382,
"grad_norm": 0.035478901481675915,
"learning_rate": 5.704655858081268e-06,
"loss": 0.34533185958862306,
"memory(GiB)": 77.28,
"step": 2040,
"token_acc": 0.9188615123194562,
"train_speed(iter/s)": 0.01442
},
{
"epoch": 0.6543738250469981,
"grad_norm": 0.03751046597155776,
"learning_rate": 5.6578211397314765e-06,
"loss": 0.3631927967071533,
"memory(GiB)": 77.28,
"step": 2045,
"token_acc": 0.8758772533370028,
"train_speed(iter/s)": 0.014419
},
{
"epoch": 0.6559737610495581,
"grad_norm": 0.035283669234402425,
"learning_rate": 5.611103504890444e-06,
"loss": 0.3572983264923096,
"memory(GiB)": 77.28,
"step": 2050,
"token_acc": 0.894204990719736,
"train_speed(iter/s)": 0.014419
},
{
"epoch": 0.6575736970521179,
"grad_norm": 0.035514482756984364,
"learning_rate": 5.564504213263205e-06,
"loss": 0.34580564498901367,
"memory(GiB)": 77.28,
"step": 2055,
"token_acc": 0.8778079008520526,
"train_speed(iter/s)": 0.01442
},
{
"epoch": 0.6591736330546778,
"grad_norm": 0.03510405358704929,
"learning_rate": 5.5180245213637785e-06,
"loss": 0.35724987983703616,
"memory(GiB)": 77.28,
"step": 2060,
"token_acc": 0.9040819075845345,
"train_speed(iter/s)": 0.014421
},
{
"epoch": 0.6607735690572377,
"grad_norm": 0.03558952127633272,
"learning_rate": 5.4716656824812505e-06,
"loss": 0.3560892343521118,
"memory(GiB)": 77.28,
"step": 2065,
"token_acc": 0.9103578154425612,
"train_speed(iter/s)": 0.014421
},
{
"epoch": 0.6623735050597976,
"grad_norm": 0.0352867930448959,
"learning_rate": 5.425428946646016e-06,
"loss": 0.3594446897506714,
"memory(GiB)": 77.28,
"step": 2070,
"token_acc": 0.9159539473684211,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.6639734410623576,
"grad_norm": 0.035189795121078615,
"learning_rate": 5.379315560596038e-06,
"loss": 0.3580685377120972,
"memory(GiB)": 77.28,
"step": 2075,
"token_acc": 0.872678750138997,
"train_speed(iter/s)": 0.014425
},
{
"epoch": 0.6655733770649174,
"grad_norm": 0.03660603391888094,
"learning_rate": 5.333326767743263e-06,
"loss": 0.35906505584716797,
"memory(GiB)": 77.28,
"step": 2080,
"token_acc": 0.8538508186779866,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.6671733130674773,
"grad_norm": 0.0357681196465874,
"learning_rate": 5.287463808140069e-06,
"loss": 0.3485325813293457,
"memory(GiB)": 77.28,
"step": 2085,
"token_acc": 0.8672191853288662,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.6687732490700372,
"grad_norm": 0.03662434567811883,
"learning_rate": 5.241727918445836e-06,
"loss": 0.3556757688522339,
"memory(GiB)": 77.28,
"step": 2090,
"token_acc": 0.915863277826468,
"train_speed(iter/s)": 0.014427
},
{
"epoch": 0.6703731850725971,
"grad_norm": 0.036729664500264415,
"learning_rate": 5.1961203318936116e-06,
"loss": 0.3540231466293335,
"memory(GiB)": 77.28,
"step": 2095,
"token_acc": 0.8912253374870197,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.6719731210751569,
"grad_norm": 0.03638060418817606,
"learning_rate": 5.1506422782568345e-06,
"loss": 0.36181719303131105,
"memory(GiB)": 77.28,
"step": 2100,
"token_acc": 0.9020928899082569,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.6735730570777169,
"grad_norm": 0.035195041704010034,
"learning_rate": 5.105294983816203e-06,
"loss": 0.35322787761688235,
"memory(GiB)": 77.28,
"step": 2105,
"token_acc": 0.8900983606557377,
"train_speed(iter/s)": 0.014429
},
{
"epoch": 0.6751729930802768,
"grad_norm": 0.03617857368359474,
"learning_rate": 5.060079671326577e-06,
"loss": 0.355142879486084,
"memory(GiB)": 77.28,
"step": 2110,
"token_acc": 0.8857596191987307,
"train_speed(iter/s)": 0.014429
},
{
"epoch": 0.6767729290828367,
"grad_norm": 0.035676130230209005,
"learning_rate": 5.014997559984045e-06,
"loss": 0.35041203498840334,
"memory(GiB)": 77.28,
"step": 2115,
"token_acc": 0.8745164003364172,
"train_speed(iter/s)": 0.014431
},
{
"epoch": 0.6783728650853966,
"grad_norm": 0.03733616225344439,
"learning_rate": 4.970049865393009e-06,
"loss": 0.35726475715637207,
"memory(GiB)": 77.28,
"step": 2120,
"token_acc": 0.8842804428044281,
"train_speed(iter/s)": 0.014432
},
{
"epoch": 0.6799728010879564,
"grad_norm": 0.03652134614213375,
"learning_rate": 4.925237799533445e-06,
"loss": 0.3587599039077759,
"memory(GiB)": 77.28,
"step": 2125,
"token_acc": 0.9209918373633144,
"train_speed(iter/s)": 0.014433
},
{
"epoch": 0.6815727370905164,
"grad_norm": 0.03713234057671444,
"learning_rate": 4.880562570728188e-06,
"loss": 0.3505564212799072,
"memory(GiB)": 77.28,
"step": 2130,
"token_acc": 0.9003831417624522,
"train_speed(iter/s)": 0.014434
},
{
"epoch": 0.6831726730930763,
"grad_norm": 0.03570712641296637,
"learning_rate": 4.836025383610382e-06,
"loss": 0.35914387702941897,
"memory(GiB)": 77.28,
"step": 2135,
"token_acc": 0.8888649580012923,
"train_speed(iter/s)": 0.014434
},
{
"epoch": 0.6847726090956362,
"grad_norm": 0.034457774830109436,
"learning_rate": 4.791627439090975e-06,
"loss": 0.35318760871887206,
"memory(GiB)": 77.28,
"step": 2140,
"token_acc": 0.9001070281840885,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.6863725450981961,
"grad_norm": 0.03671839147293295,
"learning_rate": 4.74736993432634e-06,
"loss": 0.3529956579208374,
"memory(GiB)": 77.28,
"step": 2145,
"token_acc": 0.909256801592568,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.6879724811007559,
"grad_norm": 0.03474714702977324,
"learning_rate": 4.703254062686017e-06,
"loss": 0.3566461086273193,
"memory(GiB)": 77.28,
"step": 2150,
"token_acc": 0.9030673019654556,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.6895724171033158,
"grad_norm": 0.035790167210903036,
"learning_rate": 4.6592810137205e-06,
"loss": 0.35962681770324706,
"memory(GiB)": 77.28,
"step": 2155,
"token_acc": 0.9103856266432954,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.6911723531058758,
"grad_norm": 0.03487739858408488,
"learning_rate": 4.615451973129196e-06,
"loss": 0.35558667182922366,
"memory(GiB)": 77.28,
"step": 2160,
"token_acc": 0.8970679975046787,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.6927722891084357,
"grad_norm": 0.03853196821530562,
"learning_rate": 4.571768122728421e-06,
"loss": 0.35672924518585203,
"memory(GiB)": 77.28,
"step": 2165,
"token_acc": 0.8965443686006825,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.6943722251109956,
"grad_norm": 0.0373570970369309,
"learning_rate": 4.528230640419562e-06,
"loss": 0.3587866067886353,
"memory(GiB)": 77.28,
"step": 2170,
"token_acc": 0.8806665033080128,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.6959721611135554,
"grad_norm": 0.03604883184517471,
"learning_rate": 4.4848407001572945e-06,
"loss": 0.3512024164199829,
"memory(GiB)": 77.28,
"step": 2175,
"token_acc": 0.8832857595940374,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.6975720971161153,
"grad_norm": 0.03504294349528598,
"learning_rate": 4.441599471917946e-06,
"loss": 0.34823672771453856,
"memory(GiB)": 77.28,
"step": 2180,
"token_acc": 0.8825027861805445,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.6991720331186753,
"grad_norm": 0.035895231783871086,
"learning_rate": 4.398508121667925e-06,
"loss": 0.34151611328125,
"memory(GiB)": 77.28,
"step": 2185,
"token_acc": 0.879415347137637,
"train_speed(iter/s)": 0.01444
},
{
"epoch": 0.7007719691212352,
"grad_norm": 0.03711717710215307,
"learning_rate": 4.355567811332311e-06,
"loss": 0.35381360054016114,
"memory(GiB)": 77.28,
"step": 2190,
"token_acc": 0.8886005190656818,
"train_speed(iter/s)": 0.01444
},
{
"epoch": 0.702371905123795,
"grad_norm": 0.03875724771094195,
"learning_rate": 4.312779698763493e-06,
"loss": 0.35048136711120603,
"memory(GiB)": 77.28,
"step": 2195,
"token_acc": 0.9109351806036615,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.7039718411263549,
"grad_norm": 0.037222751841702796,
"learning_rate": 4.270144937709981e-06,
"loss": 0.3498215913772583,
"memory(GiB)": 77.28,
"step": 2200,
"token_acc": 0.8952087007642563,
"train_speed(iter/s)": 0.014441
},
{
"epoch": 0.7055717771289148,
"grad_norm": 0.03655432132006705,
"learning_rate": 4.227664677785264e-06,
"loss": 0.3591599702835083,
"memory(GiB)": 77.28,
"step": 2205,
"token_acc": 0.8989089904709294,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.7071717131314748,
"grad_norm": 0.03539648204157617,
"learning_rate": 4.1853400644368395e-06,
"loss": 0.3569194316864014,
"memory(GiB)": 77.28,
"step": 2210,
"token_acc": 0.9273023393544566,
"train_speed(iter/s)": 0.014441
},
{
"epoch": 0.7087716491340347,
"grad_norm": 0.037916985081009914,
"learning_rate": 4.143172238915302e-06,
"loss": 0.35884747505187986,
"memory(GiB)": 77.28,
"step": 2215,
"token_acc": 0.8967870817379724,
"train_speed(iter/s)": 0.014441
},
{
"epoch": 0.7103715851365945,
"grad_norm": 0.03801135802626227,
"learning_rate": 4.101162338243595e-06,
"loss": 0.357472562789917,
"memory(GiB)": 77.28,
"step": 2220,
"token_acc": 0.8912637476654908,
"train_speed(iter/s)": 0.01444
},
{
"epoch": 0.7119715211391544,
"grad_norm": 0.0387640824372489,
"learning_rate": 4.059311495186338e-06,
"loss": 0.3565319538116455,
"memory(GiB)": 77.28,
"step": 2225,
"token_acc": 0.8952764555108019,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.7135714571417143,
"grad_norm": 0.03926080873946399,
"learning_rate": 4.017620838219276e-06,
"loss": 0.3521524667739868,
"memory(GiB)": 77.28,
"step": 2230,
"token_acc": 0.8861508810572687,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.7151713931442742,
"grad_norm": 0.03756015577315046,
"learning_rate": 3.9760914914988716e-06,
"loss": 0.3639491558074951,
"memory(GiB)": 77.28,
"step": 2235,
"token_acc": 0.8872466216216216,
"train_speed(iter/s)": 0.01444
},
{
"epoch": 0.7167713291468342,
"grad_norm": 0.036199547656564544,
"learning_rate": 3.93472457483197e-06,
"loss": 0.3500187635421753,
"memory(GiB)": 77.28,
"step": 2240,
"token_acc": 0.8480381530457403,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.718371265149394,
"grad_norm": 0.03683592500962426,
"learning_rate": 3.893521203645618e-06,
"loss": 0.35996718406677247,
"memory(GiB)": 77.28,
"step": 2245,
"token_acc": 0.9068561551757249,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.7199712011519539,
"grad_norm": 0.03450560655549409,
"learning_rate": 3.852482488956992e-06,
"loss": 0.35292108058929444,
"memory(GiB)": 77.28,
"step": 2250,
"token_acc": 0.8864724387908631,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.7199712011519539,
"eval_loss": 0.6000239849090576,
"eval_runtime": 169.3665,
"eval_samples_per_second": 118.607,
"eval_steps_per_second": 0.596,
"eval_token_acc": 0.8950660718419391,
"step": 2250
},
{
"epoch": 0.7215711371545138,
"grad_norm": 0.036073313606157474,
"learning_rate": 3.8116095373434204e-06,
"loss": 0.35668814182281494,
"memory(GiB)": 77.28,
"step": 2255,
"token_acc": 0.9087738494153047,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.7231710731570737,
"grad_norm": 0.036174459675283856,
"learning_rate": 3.7709034509125706e-06,
"loss": 0.35418474674224854,
"memory(GiB)": 77.28,
"step": 2260,
"token_acc": 0.8707964601769912,
"train_speed(iter/s)": 0.014425
},
{
"epoch": 0.7247710091596337,
"grad_norm": 0.03567475035555587,
"learning_rate": 3.7303653272727057e-06,
"loss": 0.357358717918396,
"memory(GiB)": 77.28,
"step": 2265,
"token_acc": 0.9060252913463923,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.7263709451621935,
"grad_norm": 0.035715034790481305,
"learning_rate": 3.689996259503116e-06,
"loss": 0.3499811887741089,
"memory(GiB)": 77.28,
"step": 2270,
"token_acc": 0.9101883788803397,
"train_speed(iter/s)": 0.014427
},
{
"epoch": 0.7279708811647534,
"grad_norm": 0.03612086417148584,
"learning_rate": 3.6497973361246153e-06,
"loss": 0.3532618284225464,
"memory(GiB)": 77.28,
"step": 2275,
"token_acc": 0.8859261596718208,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.7295708171673133,
"grad_norm": 0.037097792645410424,
"learning_rate": 3.609769641070221e-06,
"loss": 0.34888529777526855,
"memory(GiB)": 77.28,
"step": 2280,
"token_acc": 0.9103887168902649,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.7311707531698732,
"grad_norm": 0.03547959936969023,
"learning_rate": 3.569914253655896e-06,
"loss": 0.35082759857177737,
"memory(GiB)": 77.28,
"step": 2285,
"token_acc": 0.9120581352383298,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.7327706891724332,
"grad_norm": 0.03706499179009722,
"learning_rate": 3.530232248551466e-06,
"loss": 0.36017541885375975,
"memory(GiB)": 77.28,
"step": 2290,
"token_acc": 0.8559717087285003,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.734370625174993,
"grad_norm": 0.03739569626098127,
"learning_rate": 3.4907246957516416e-06,
"loss": 0.3543466329574585,
"memory(GiB)": 77.28,
"step": 2295,
"token_acc": 0.9116985376827896,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.7359705611775529,
"grad_norm": 0.03646822377433634,
"learning_rate": 3.4513926605471504e-06,
"loss": 0.3665087461471558,
"memory(GiB)": 77.28,
"step": 2300,
"token_acc": 0.8735919899874843,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.7375704971801128,
"grad_norm": 0.03643726700416454,
"learning_rate": 3.412237203496036e-06,
"loss": 0.35367345809936523,
"memory(GiB)": 77.28,
"step": 2305,
"token_acc": 0.8936760355029586,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.7391704331826727,
"grad_norm": 0.03681350508730061,
"learning_rate": 3.3732593803950354e-06,
"loss": 0.3540062189102173,
"memory(GiB)": 77.28,
"step": 2310,
"token_acc": 0.9164918170373478,
"train_speed(iter/s)": 0.014431
},
{
"epoch": 0.7407703691852325,
"grad_norm": 0.03619863113544937,
"learning_rate": 3.3344602422511343e-06,
"loss": 0.3489154577255249,
"memory(GiB)": 77.28,
"step": 2315,
"token_acc": 0.9134242883611251,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.7423703051877925,
"grad_norm": 0.03739761580100826,
"learning_rate": 3.2958408352532055e-06,
"loss": 0.34918310642242434,
"memory(GiB)": 77.28,
"step": 2320,
"token_acc": 0.8605150214592274,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.7439702411903524,
"grad_norm": 0.035263909838795474,
"learning_rate": 3.257402200743821e-06,
"loss": 0.3549443960189819,
"memory(GiB)": 77.28,
"step": 2325,
"token_acc": 0.8859731923730414,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.7455701771929123,
"grad_norm": 0.038532084755221324,
"learning_rate": 3.2191453751911505e-06,
"loss": 0.362837553024292,
"memory(GiB)": 77.28,
"step": 2330,
"token_acc": 0.9077399380804954,
"train_speed(iter/s)": 0.014429
},
{
"epoch": 0.7471701131954722,
"grad_norm": 0.03622027927597768,
"learning_rate": 3.1810713901610367e-06,
"loss": 0.3503484964370728,
"memory(GiB)": 77.28,
"step": 2335,
"token_acc": 0.8994184794314021,
"train_speed(iter/s)": 0.014431
},
{
"epoch": 0.748770049198032,
"grad_norm": 0.03656899746448185,
"learning_rate": 3.1431812722891598e-06,
"loss": 0.3492277145385742,
"memory(GiB)": 77.28,
"step": 2340,
"token_acc": 0.884628359383785,
"train_speed(iter/s)": 0.014432
},
{
"epoch": 0.750369985200592,
"grad_norm": 0.03972433850747652,
"learning_rate": 3.1054760432533626e-06,
"loss": 0.3659966230392456,
"memory(GiB)": 77.28,
"step": 2345,
"token_acc": 0.9043888952885613,
"train_speed(iter/s)": 0.014433
},
{
"epoch": 0.7519699212031519,
"grad_norm": 0.037936615779197595,
"learning_rate": 3.0679567197461135e-06,
"loss": 0.35586345195770264,
"memory(GiB)": 77.28,
"step": 2350,
"token_acc": 0.8697364435019691,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.7535698572057118,
"grad_norm": 0.038657371745029284,
"learning_rate": 3.0306243134470668e-06,
"loss": 0.3520052909851074,
"memory(GiB)": 77.28,
"step": 2355,
"token_acc": 0.9114033196809658,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.7551697932082717,
"grad_norm": 0.03759781411569022,
"learning_rate": 2.993479830995815e-06,
"loss": 0.359484601020813,
"memory(GiB)": 77.28,
"step": 2360,
"token_acc": 0.8960244648318043,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.7567697292108315,
"grad_norm": 0.0361038891255062,
"learning_rate": 2.9565242739647115e-06,
"loss": 0.3532958269119263,
"memory(GiB)": 77.28,
"step": 2365,
"token_acc": 0.9104216388225935,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7583696652133914,
"grad_norm": 0.03903281093821544,
"learning_rate": 2.919758638831893e-06,
"loss": 0.3664171934127808,
"memory(GiB)": 77.28,
"step": 2370,
"token_acc": 0.8849834016793595,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.7599696012159514,
"grad_norm": 0.03883483895946455,
"learning_rate": 2.8831839169543998e-06,
"loss": 0.3517657995223999,
"memory(GiB)": 77.28,
"step": 2375,
"token_acc": 0.903478904515174,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.7615695372185113,
"grad_norm": 0.03569351570239587,
"learning_rate": 2.84680109454143e-06,
"loss": 0.35557854175567627,
"memory(GiB)": 77.28,
"step": 2380,
"token_acc": 0.8889802631578947,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.7631694732210712,
"grad_norm": 0.038188596422853896,
"learning_rate": 2.810611152627777e-06,
"loss": 0.3597451686859131,
"memory(GiB)": 77.28,
"step": 2385,
"token_acc": 0.8827844799478317,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.764769409223631,
"grad_norm": 0.03572439909987441,
"learning_rate": 2.774615067047346e-06,
"loss": 0.34901888370513917,
"memory(GiB)": 77.28,
"step": 2390,
"token_acc": 0.8962715798636298,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.7663693452261909,
"grad_norm": 0.03686595519302669,
"learning_rate": 2.738813808406866e-06,
"loss": 0.3472025156021118,
"memory(GiB)": 77.28,
"step": 2395,
"token_acc": 0.9280912364945978,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.7679692812287509,
"grad_norm": 0.03715332128853523,
"learning_rate": 2.7032083420597e-06,
"loss": 0.34778246879577634,
"memory(GiB)": 77.28,
"step": 2400,
"token_acc": 0.9090736161308731,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7695692172313108,
"grad_norm": 0.03817279860399444,
"learning_rate": 2.667799628079829e-06,
"loss": 0.35284740924835206,
"memory(GiB)": 77.28,
"step": 2405,
"token_acc": 0.9096980255516841,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.7711691532338707,
"grad_norm": 0.036302722459302404,
"learning_rate": 2.6325886212359496e-06,
"loss": 0.34749345779418944,
"memory(GiB)": 77.28,
"step": 2410,
"token_acc": 0.9061160009027308,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7727690892364305,
"grad_norm": 0.038102620992520056,
"learning_rate": 2.5975762709657506e-06,
"loss": 0.3531970739364624,
"memory(GiB)": 77.28,
"step": 2415,
"token_acc": 0.8826328310864393,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.7743690252389904,
"grad_norm": 0.03445225499859096,
"learning_rate": 2.5627635213502832e-06,
"loss": 0.3450269937515259,
"memory(GiB)": 77.28,
"step": 2420,
"token_acc": 0.9214078466002271,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7759689612415503,
"grad_norm": 0.03854094961415296,
"learning_rate": 2.528151311088537e-06,
"loss": 0.3500360012054443,
"memory(GiB)": 77.28,
"step": 2425,
"token_acc": 0.8813531353135313,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.7775688972441103,
"grad_norm": 0.03576826677739602,
"learning_rate": 2.4937405734720964e-06,
"loss": 0.3535548210144043,
"memory(GiB)": 77.28,
"step": 2430,
"token_acc": 0.8837966985230234,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.7791688332466701,
"grad_norm": 0.03767939273785534,
"learning_rate": 2.459532236360007e-06,
"loss": 0.34597823619842527,
"memory(GiB)": 77.28,
"step": 2435,
"token_acc": 0.8772578890097933,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.78076876924923,
"grad_norm": 0.036004849313210435,
"learning_rate": 2.4255272221537295e-06,
"loss": 0.34565279483795164,
"memory(GiB)": 77.28,
"step": 2440,
"token_acc": 0.8803288090231314,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.7823687052517899,
"grad_norm": 0.03905322522036309,
"learning_rate": 2.391726447772279e-06,
"loss": 0.36594700813293457,
"memory(GiB)": 77.28,
"step": 2445,
"token_acc": 0.8882537089968695,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.7839686412543498,
"grad_norm": 0.03730014372598652,
"learning_rate": 2.3581308246275103e-06,
"loss": 0.3568562507629395,
"memory(GiB)": 77.28,
"step": 2450,
"token_acc": 0.9234494610217153,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7855685772569098,
"grad_norm": 0.03868286134685204,
"learning_rate": 2.324741258599521e-06,
"loss": 0.35208520889282224,
"memory(GiB)": 77.28,
"step": 2455,
"token_acc": 0.8954419212546969,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.7871685132594696,
"grad_norm": 0.03733286652687736,
"learning_rate": 2.29155865001225e-06,
"loss": 0.34863691329956054,
"memory(GiB)": 77.28,
"step": 2460,
"token_acc": 0.9080920564216778,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.7887684492620295,
"grad_norm": 0.03699225546025446,
"learning_rate": 2.2585838936091753e-06,
"loss": 0.34832584857940674,
"memory(GiB)": 77.28,
"step": 2465,
"token_acc": 0.9085607651038022,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7903683852645894,
"grad_norm": 0.03946439413106149,
"learning_rate": 2.225817878529214e-06,
"loss": 0.35381317138671875,
"memory(GiB)": 77.28,
"step": 2470,
"token_acc": 0.8874495646634105,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7919683212671493,
"grad_norm": 0.0392896601295871,
"learning_rate": 2.1932614882827196e-06,
"loss": 0.35070300102233887,
"memory(GiB)": 77.28,
"step": 2475,
"token_acc": 0.9032003160806006,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.7935682572697093,
"grad_norm": 0.03806309185869093,
"learning_rate": 2.160915600727688e-06,
"loss": 0.34960522651672366,
"memory(GiB)": 77.28,
"step": 2480,
"token_acc": 0.9318849089841457,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7951681932722691,
"grad_norm": 0.037966940284694224,
"learning_rate": 2.1287810880460636e-06,
"loss": 0.3503120422363281,
"memory(GiB)": 77.28,
"step": 2485,
"token_acc": 0.9095194647201946,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.796768129274829,
"grad_norm": 0.036666564553806735,
"learning_rate": 2.0968588167202265e-06,
"loss": 0.3496053695678711,
"memory(GiB)": 77.28,
"step": 2490,
"token_acc": 0.9117557251908397,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.7983680652773889,
"grad_norm": 0.03639630529287135,
"learning_rate": 2.0651496475096455e-06,
"loss": 0.34689855575561523,
"memory(GiB)": 77.28,
"step": 2495,
"token_acc": 0.8635149023638232,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7999680012799488,
"grad_norm": 0.038547849012489435,
"learning_rate": 2.03365443542764e-06,
"loss": 0.35553674697875975,
"memory(GiB)": 77.28,
"step": 2500,
"token_acc": 0.9040584668014305,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.7999680012799488,
"eval_loss": 0.5981466770172119,
"eval_runtime": 165.8098,
"eval_samples_per_second": 121.151,
"eval_steps_per_second": 0.609,
"eval_token_acc": 0.8956903623836094,
"step": 2500
},
{
"epoch": 0.8015679372825087,
"grad_norm": 0.03758764678842079,
"learning_rate": 2.0023740297183536e-06,
"loss": 0.3542864084243774,
"memory(GiB)": 77.28,
"step": 2505,
"token_acc": 0.9013850415512465,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.8031678732850686,
"grad_norm": 0.03968783826575613,
"learning_rate": 1.971309273833828e-06,
"loss": 0.35315916538238523,
"memory(GiB)": 77.28,
"step": 2510,
"token_acc": 0.8885698905436928,
"train_speed(iter/s)": 0.014423
},
{
"epoch": 0.8047678092876285,
"grad_norm": 0.03665700191714146,
"learning_rate": 1.940461005411288e-06,
"loss": 0.35584971904754636,
"memory(GiB)": 77.28,
"step": 2515,
"token_acc": 0.9148000549677064,
"train_speed(iter/s)": 0.014422
},
{
"epoch": 0.8063677452901884,
"grad_norm": 0.03809565053490125,
"learning_rate": 1.9098300562505266e-06,
"loss": 0.352116060256958,
"memory(GiB)": 77.28,
"step": 2520,
"token_acc": 0.9041350472355583,
"train_speed(iter/s)": 0.014423
},
{
"epoch": 0.8079676812927483,
"grad_norm": 0.037082731941368616,
"learning_rate": 1.8794172522915022e-06,
"loss": 0.3564736843109131,
"memory(GiB)": 77.28,
"step": 2525,
"token_acc": 0.9011320754716982,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.8095676172953082,
"grad_norm": 0.03536758455742058,
"learning_rate": 1.849223413592046e-06,
"loss": 0.3573369026184082,
"memory(GiB)": 77.28,
"step": 2530,
"token_acc": 0.8907506702412868,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.811167553297868,
"grad_norm": 0.0385223348984184,
"learning_rate": 1.8192493543057676e-06,
"loss": 0.35864074230194093,
"memory(GiB)": 77.28,
"step": 2535,
"token_acc": 0.892925430210325,
"train_speed(iter/s)": 0.014424
},
{
"epoch": 0.812767489300428,
"grad_norm": 0.039588078774316006,
"learning_rate": 1.7894958826600884e-06,
"loss": 0.355703067779541,
"memory(GiB)": 77.28,
"step": 2540,
"token_acc": 0.9034001743679163,
"train_speed(iter/s)": 0.014426
},
{
"epoch": 0.8143674253029879,
"grad_norm": 0.037317655071007885,
"learning_rate": 1.7599638009344566e-06,
"loss": 0.35617387294769287,
"memory(GiB)": 77.28,
"step": 2545,
"token_acc": 0.8941311852704258,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.8159673613055478,
"grad_norm": 0.03777407929611349,
"learning_rate": 1.730653905438714e-06,
"loss": 0.3580180168151855,
"memory(GiB)": 77.28,
"step": 2550,
"token_acc": 0.8959574468085106,
"train_speed(iter/s)": 0.014428
},
{
"epoch": 0.8175672973081076,
"grad_norm": 0.035142023960295414,
"learning_rate": 1.701566986491614e-06,
"loss": 0.34624552726745605,
"memory(GiB)": 77.28,
"step": 2555,
"token_acc": 0.9051190699418714,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.8191672333106675,
"grad_norm": 0.037714565360549845,
"learning_rate": 1.672703828399529e-06,
"loss": 0.35172338485717775,
"memory(GiB)": 77.28,
"step": 2560,
"token_acc": 0.9457239778610962,
"train_speed(iter/s)": 0.014431
},
{
"epoch": 0.8207671693132275,
"grad_norm": 0.036887384415936156,
"learning_rate": 1.6440652094352838e-06,
"loss": 0.3510489225387573,
"memory(GiB)": 77.28,
"step": 2565,
"token_acc": 0.8979176452168467,
"train_speed(iter/s)": 0.014432
},
{
"epoch": 0.8223671053157874,
"grad_norm": 0.03561026944223861,
"learning_rate": 1.6156519018171856e-06,
"loss": 0.35076611042022704,
"memory(GiB)": 77.28,
"step": 2570,
"token_acc": 0.9080580318126201,
"train_speed(iter/s)": 0.014432
},
{
"epoch": 0.8239670413183473,
"grad_norm": 0.03630258451216745,
"learning_rate": 1.587464671688187e-06,
"loss": 0.3570599317550659,
"memory(GiB)": 77.28,
"step": 2575,
"token_acc": 0.9031298682906104,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.8255669773209071,
"grad_norm": 0.038192907527631666,
"learning_rate": 1.5595042790952442e-06,
"loss": 0.3558261632919312,
"memory(GiB)": 77.28,
"step": 2580,
"token_acc": 0.8623452294246177,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.827166913323467,
"grad_norm": 0.036755690198104415,
"learning_rate": 1.5317714779688076e-06,
"loss": 0.3490342140197754,
"memory(GiB)": 77.28,
"step": 2585,
"token_acc": 0.8992491314580298,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.828766849326027,
"grad_norm": 0.03779058071089615,
"learning_rate": 1.5042670161024975e-06,
"loss": 0.3526420831680298,
"memory(GiB)": 77.28,
"step": 2590,
"token_acc": 0.9187872225230103,
"train_speed(iter/s)": 0.014435
},
{
"epoch": 0.8303667853285869,
"grad_norm": 0.0378490380899306,
"learning_rate": 1.4769916351329495e-06,
"loss": 0.3495866060256958,
"memory(GiB)": 77.28,
"step": 2595,
"token_acc": 0.9153539571076106,
"train_speed(iter/s)": 0.014437
},
{
"epoch": 0.8319667213311468,
"grad_norm": 0.038059208729720205,
"learning_rate": 1.4499460705198e-06,
"loss": 0.3585029602050781,
"memory(GiB)": 77.28,
"step": 2600,
"token_acc": 0.8617424242424242,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.8335666573337066,
"grad_norm": 0.036305573904208764,
"learning_rate": 1.4231310515258745e-06,
"loss": 0.35045819282531737,
"memory(GiB)": 77.28,
"step": 2605,
"token_acc": 0.8978984563883207,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.8351665933362665,
"grad_norm": 0.03724795292187118,
"learning_rate": 1.396547301197504e-06,
"loss": 0.3469654083251953,
"memory(GiB)": 77.28,
"step": 2610,
"token_acc": 0.8848700967906266,
"train_speed(iter/s)": 0.014438
},
{
"epoch": 0.8367665293388264,
"grad_norm": 0.03937123467027512,
"learning_rate": 1.3701955363450447e-06,
"loss": 0.3473918676376343,
"memory(GiB)": 77.28,
"step": 2615,
"token_acc": 0.8838246702870443,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.8383664653413864,
"grad_norm": 0.03667494649233471,
"learning_rate": 1.3440764675235384e-06,
"loss": 0.3473004579544067,
"memory(GiB)": 77.28,
"step": 2620,
"token_acc": 0.8983539094650206,
"train_speed(iter/s)": 0.014441
},
{
"epoch": 0.8399664013439463,
"grad_norm": 0.03740155571021143,
"learning_rate": 1.3181907990135624e-06,
"loss": 0.3439753532409668,
"memory(GiB)": 77.28,
"step": 2625,
"token_acc": 0.8991910392034848,
"train_speed(iter/s)": 0.014441
},
{
"epoch": 0.8415663373465061,
"grad_norm": 0.037121105337531816,
"learning_rate": 1.2925392288022299e-06,
"loss": 0.35173735618591306,
"memory(GiB)": 77.28,
"step": 2630,
"token_acc": 0.9013660104459622,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.843166273349066,
"grad_norm": 0.036589412214925045,
"learning_rate": 1.267122448564374e-06,
"loss": 0.35824949741363527,
"memory(GiB)": 77.28,
"step": 2635,
"token_acc": 0.8826762498678786,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.8447662093516259,
"grad_norm": 0.037390795588795094,
"learning_rate": 1.2419411436439021e-06,
"loss": 0.3420265197753906,
"memory(GiB)": 77.28,
"step": 2640,
"token_acc": 0.8637934539540557,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.8463661453541859,
"grad_norm": 0.0392903978609431,
"learning_rate": 1.2169959930353049e-06,
"loss": 0.35427193641662597,
"memory(GiB)": 77.28,
"step": 2645,
"token_acc": 0.9137991573033708,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.8479660813567458,
"grad_norm": 0.03621632863378309,
"learning_rate": 1.1922876693653584e-06,
"loss": 0.35888056755065917,
"memory(GiB)": 77.28,
"step": 2650,
"token_acc": 0.911003861003861,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.8495660173593056,
"grad_norm": 0.03660745676792027,
"learning_rate": 1.1678168388749788e-06,
"loss": 0.35086932182312014,
"memory(GiB)": 77.28,
"step": 2655,
"token_acc": 0.9206992112555958,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.8511659533618655,
"grad_norm": 0.040156354355006064,
"learning_rate": 1.1435841614012666e-06,
"loss": 0.35667102336883544,
"memory(GiB)": 77.28,
"step": 2660,
"token_acc": 0.8772329246935201,
"train_speed(iter/s)": 0.014445
},
{
"epoch": 0.8527658893644254,
"grad_norm": 0.03671656629027542,
"learning_rate": 1.1195902903597023e-06,
"loss": 0.34930713176727296,
"memory(GiB)": 77.28,
"step": 2665,
"token_acc": 0.9153739612188365,
"train_speed(iter/s)": 0.014445
},
{
"epoch": 0.8543658253669854,
"grad_norm": 0.0353334980673887,
"learning_rate": 1.0958358727265438e-06,
"loss": 0.3469362497329712,
"memory(GiB)": 77.28,
"step": 2670,
"token_acc": 0.8836606950140298,
"train_speed(iter/s)": 0.014445
},
{
"epoch": 0.8559657613695452,
"grad_norm": 0.03791549498121718,
"learning_rate": 1.0723215490213635e-06,
"loss": 0.34251036643981936,
"memory(GiB)": 77.28,
"step": 2675,
"token_acc": 0.8721257625527921,
"train_speed(iter/s)": 0.014444
},
{
"epoch": 0.8575656973721051,
"grad_norm": 0.039436468828163096,
"learning_rate": 1.0490479532897946e-06,
"loss": 0.36394264698028567,
"memory(GiB)": 77.28,
"step": 2680,
"token_acc": 0.8936742934051144,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.859165633374665,
"grad_norm": 0.03587054686772771,
"learning_rate": 1.0260157130864178e-06,
"loss": 0.3494544267654419,
"memory(GiB)": 77.28,
"step": 2685,
"token_acc": 0.8780027453671929,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.8607655693772249,
"grad_norm": 0.036927180363296286,
"learning_rate": 1.0032254494578519e-06,
"loss": 0.35199804306030275,
"memory(GiB)": 77.28,
"step": 2690,
"token_acc": 0.8905178979436406,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.8623655053797848,
"grad_norm": 0.03966797036856003,
"learning_rate": 9.806777769260034e-07,
"loss": 0.35879766941070557,
"memory(GiB)": 77.28,
"step": 2695,
"token_acc": 0.9054112554112554,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.8639654413823447,
"grad_norm": 0.03806048478363406,
"learning_rate": 9.583733034714982e-07,
"loss": 0.34694294929504393,
"memory(GiB)": 77.28,
"step": 2700,
"token_acc": 0.9187337129620693,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.8655653773849046,
"grad_norm": 0.03857250568994282,
"learning_rate": 9.363126305172831e-07,
"loss": 0.35350399017333983,
"memory(GiB)": 77.28,
"step": 2705,
"token_acc": 0.9250559284116331,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.8671653133874645,
"grad_norm": 0.037358698407483806,
"learning_rate": 9.144963529124163e-07,
"loss": 0.3406071186065674,
"memory(GiB)": 77.28,
"step": 2710,
"token_acc": 0.8880566801619433,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.8687652493900244,
"grad_norm": 0.03796555457876589,
"learning_rate": 8.929250589160166e-07,
"loss": 0.3480019807815552,
"memory(GiB)": 77.28,
"step": 2715,
"token_acc": 0.8878713878713879,
"train_speed(iter/s)": 0.014444
},
{
"epoch": 0.8703651853925843,
"grad_norm": 0.03578087810314897,
"learning_rate": 8.715993301814174e-07,
"loss": 0.34974730014801025,
"memory(GiB)": 77.28,
"step": 2720,
"token_acc": 0.893631910426872,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.8719651213951441,
"grad_norm": 0.03683673172866316,
"learning_rate": 8.505197417404687e-07,
"loss": 0.34303812980651854,
"memory(GiB)": 77.28,
"step": 2725,
"token_acc": 0.9124767225325885,
"train_speed(iter/s)": 0.014444
},
{
"epoch": 0.8735650573977041,
"grad_norm": 0.0365725452957113,
"learning_rate": 8.296868619880372e-07,
"loss": 0.3499909400939941,
"memory(GiB)": 77.28,
"step": 2730,
"token_acc": 0.8861124459394522,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.875164993400264,
"grad_norm": 0.03572406694103383,
"learning_rate": 8.091012526666797e-07,
"loss": 0.3504805564880371,
"memory(GiB)": 77.28,
"step": 2735,
"token_acc": 0.8892282630828752,
"train_speed(iter/s)": 0.014444
},
{
"epoch": 0.8767649294028239,
"grad_norm": 0.03779741947722869,
"learning_rate": 7.887634688515e-07,
"loss": 0.3552916765213013,
"memory(GiB)": 77.28,
"step": 2740,
"token_acc": 0.9217644084934277,
"train_speed(iter/s)": 0.014444
},
{
"epoch": 0.8783648654053838,
"grad_norm": 0.03734376079780654,
"learning_rate": 7.686740589351704e-07,
"loss": 0.3564465522766113,
"memory(GiB)": 77.28,
"step": 2745,
"token_acc": 0.8365307753796962,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.8799648014079436,
"grad_norm": 0.03886072012349239,
"learning_rate": 7.488335646131628e-07,
"loss": 0.35783588886260986,
"memory(GiB)": 77.28,
"step": 2750,
"token_acc": 0.8932851985559567,
"train_speed(iter/s)": 0.014444
},
{
"epoch": 0.8799648014079436,
"eval_loss": 0.5971372127532959,
"eval_runtime": 171.8021,
"eval_samples_per_second": 116.925,
"eval_steps_per_second": 0.588,
"eval_token_acc": 0.8960392306274841,
"step": 2750
},
{
"epoch": 0.8815647374105036,
"grad_norm": 0.03809267294716575,
"learning_rate": 7.292425208691212e-07,
"loss": 0.34661192893981935,
"memory(GiB)": 77.28,
"step": 2755,
"token_acc": 0.9020258590887091,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.8831646734130635,
"grad_norm": 0.03923242547695106,
"learning_rate": 7.099014559604556e-07,
"loss": 0.3626936674118042,
"memory(GiB)": 77.28,
"step": 2760,
"token_acc": 0.9132881442639724,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.8847646094156234,
"grad_norm": 0.038038269263299306,
"learning_rate": 6.908108914040823e-07,
"loss": 0.3482142210006714,
"memory(GiB)": 77.28,
"step": 2765,
"token_acc": 0.926984508226252,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.8863645454181833,
"grad_norm": 0.03824935772013396,
"learning_rate": 6.71971341962373e-07,
"loss": 0.35893754959106444,
"memory(GiB)": 77.28,
"step": 2770,
"token_acc": 0.8936886395511922,
"train_speed(iter/s)": 0.014431
},
{
"epoch": 0.8879644814207431,
"grad_norm": 0.04010489518356249,
"learning_rate": 6.53383315629268e-07,
"loss": 0.34843852519989016,
"memory(GiB)": 77.28,
"step": 2775,
"token_acc": 0.8804709495776811,
"train_speed(iter/s)": 0.01443
},
{
"epoch": 0.889564417423303,
"grad_norm": 0.038785315140372825,
"learning_rate": 6.350473136165836e-07,
"loss": 0.34716622829437255,
"memory(GiB)": 77.28,
"step": 2780,
"token_acc": 0.9097255275265747,
"train_speed(iter/s)": 0.014432
},
{
"epoch": 0.891164353425863,
"grad_norm": 0.03648869486252188,
"learning_rate": 6.169638303404912e-07,
"loss": 0.34730355739593505,
"memory(GiB)": 77.28,
"step": 2785,
"token_acc": 0.9088560885608856,
"train_speed(iter/s)": 0.014433
},
{
"epoch": 0.8927642894284229,
"grad_norm": 0.037303942869965495,
"learning_rate": 5.991333534081878e-07,
"loss": 0.35375151634216306,
"memory(GiB)": 77.28,
"step": 2790,
"token_acc": 0.9058347775852109,
"train_speed(iter/s)": 0.014434
},
{
"epoch": 0.8943642254309827,
"grad_norm": 0.03697384190504123,
"learning_rate": 5.815563636047539e-07,
"loss": 0.347182297706604,
"memory(GiB)": 77.28,
"step": 2795,
"token_acc": 0.8924109931292942,
"train_speed(iter/s)": 0.014436
},
{
"epoch": 0.8959641614335426,
"grad_norm": 0.03652945378250148,
"learning_rate": 5.64233334880181e-07,
"loss": 0.34785597324371337,
"memory(GiB)": 77.28,
"step": 2800,
"token_acc": 0.9158926728586171,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.8975640974361025,
"grad_norm": 0.03760402764710459,
"learning_rate": 5.471647343365982e-07,
"loss": 0.3536502838134766,
"memory(GiB)": 77.28,
"step": 2805,
"token_acc": 0.9084852734922861,
"train_speed(iter/s)": 0.014439
},
{
"epoch": 0.8991640334386625,
"grad_norm": 0.03705771284444855,
"learning_rate": 5.303510222156716e-07,
"loss": 0.3537883758544922,
"memory(GiB)": 77.28,
"step": 2810,
"token_acc": 0.8768209478148626,
"train_speed(iter/s)": 0.01444
},
{
"epoch": 0.9007639694412224,
"grad_norm": 0.03923039459407896,
"learning_rate": 5.137926518862013e-07,
"loss": 0.3503025770187378,
"memory(GiB)": 77.28,
"step": 2815,
"token_acc": 0.8973375931842386,
"train_speed(iter/s)": 0.014441
},
{
"epoch": 0.9023639054437822,
"grad_norm": 0.03440569943973169,
"learning_rate": 4.974900698318885e-07,
"loss": 0.3502909421920776,
"memory(GiB)": 77.28,
"step": 2820,
"token_acc": 0.8903985507246377,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.9039638414463421,
"grad_norm": 0.037440830013703,
"learning_rate": 4.814437156393048e-07,
"loss": 0.359883975982666,
"memory(GiB)": 77.28,
"step": 2825,
"token_acc": 0.8621068032187271,
"train_speed(iter/s)": 0.014442
},
{
"epoch": 0.905563777448902,
"grad_norm": 0.03604417130894721,
"learning_rate": 4.656540219860317e-07,
"loss": 0.3613792657852173,
"memory(GiB)": 77.28,
"step": 2830,
"token_acc": 0.896741523557904,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.907163713451462,
"grad_norm": 0.03851080526779007,
"learning_rate": 4.501214146289956e-07,
"loss": 0.3496058464050293,
"memory(GiB)": 77.28,
"step": 2835,
"token_acc": 0.9011064062286573,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.9087636494540219,
"grad_norm": 0.03746777254251882,
"learning_rate": 4.3484631239299356e-07,
"loss": 0.3529067516326904,
"memory(GiB)": 77.28,
"step": 2840,
"token_acc": 0.8689181453921008,
"train_speed(iter/s)": 0.014443
},
{
"epoch": 0.9103635854565817,
"grad_norm": 0.03726783035013483,
"learning_rate": 4.198291271593924e-07,
"loss": 0.3502077579498291,
"memory(GiB)": 77.28,
"step": 2845,
"token_acc": 0.8986060161408658,
"train_speed(iter/s)": 0.014444
},
{
"epoch": 0.9119635214591416,
"grad_norm": 0.035823705524663504,
"learning_rate": 4.0507026385502747e-07,
"loss": 0.3497209310531616,
"memory(GiB)": 77.28,
"step": 2850,
"token_acc": 0.9251456745853878,
"train_speed(iter/s)": 0.014445
},
{
"epoch": 0.9135634574617015,
"grad_norm": 0.038081501743851526,
"learning_rate": 3.9057012044127817e-07,
"loss": 0.352987265586853,
"memory(GiB)": 77.28,
"step": 2855,
"token_acc": 0.8892445582586428,
"train_speed(iter/s)": 0.014446
},
{
"epoch": 0.9151633934642615,
"grad_norm": 0.0385949290213603,
"learning_rate": 3.7632908790334656e-07,
"loss": 0.3471065044403076,
"memory(GiB)": 77.28,
"step": 2860,
"token_acc": 0.9146107456140351,
"train_speed(iter/s)": 0.014446
},
{
"epoch": 0.9167633294668214,
"grad_norm": 0.03861723600804993,
"learning_rate": 3.6234755023970447e-07,
"loss": 0.3470769882202148,
"memory(GiB)": 77.28,
"step": 2865,
"token_acc": 0.8663258983890955,
"train_speed(iter/s)": 0.014448
},
{
"epoch": 0.9183632654693812,
"grad_norm": 0.037810929727173835,
"learning_rate": 3.4862588445174985e-07,
"loss": 0.3519733190536499,
"memory(GiB)": 77.28,
"step": 2870,
"token_acc": 0.9010814249363868,
"train_speed(iter/s)": 0.014449
},
{
"epoch": 0.9199632014719411,
"grad_norm": 0.0379260232969743,
"learning_rate": 3.3516446053363015e-07,
"loss": 0.34721758365631106,
"memory(GiB)": 77.28,
"step": 2875,
"token_acc": 0.9072595971113645,
"train_speed(iter/s)": 0.014449
},
{
"epoch": 0.921563137474501,
"grad_norm": 0.036881383803487856,
"learning_rate": 3.219636414622751e-07,
"loss": 0.35213327407836914,
"memory(GiB)": 77.28,
"step": 2880,
"token_acc": 0.9062799288548365,
"train_speed(iter/s)": 0.01445
},
{
"epoch": 0.923163073477061,
"grad_norm": 0.03626677080161208,
"learning_rate": 3.090237831876053e-07,
"loss": 0.3516512393951416,
"memory(GiB)": 77.28,
"step": 2885,
"token_acc": 0.8761041902604757,
"train_speed(iter/s)": 0.014451
},
{
"epoch": 0.9247630094796209,
"grad_norm": 0.03714975307806561,
"learning_rate": 2.9634523462293005e-07,
"loss": 0.3485568046569824,
"memory(GiB)": 77.28,
"step": 2890,
"token_acc": 0.9238785106112594,
"train_speed(iter/s)": 0.014451
},
{
"epoch": 0.9263629454821807,
"grad_norm": 0.036754057783206624,
"learning_rate": 2.839283376355506e-07,
"loss": 0.3485892295837402,
"memory(GiB)": 77.28,
"step": 2895,
"token_acc": 0.9183364839319471,
"train_speed(iter/s)": 0.01445
},
{
"epoch": 0.9279628814847406,
"grad_norm": 0.03647869908710096,
"learning_rate": 2.717734270375272e-07,
"loss": 0.3410207748413086,
"memory(GiB)": 77.28,
"step": 2900,
"token_acc": 0.9108079748163693,
"train_speed(iter/s)": 0.014451
},
{
"epoch": 0.9295628174873005,
"grad_norm": 0.03711266544187936,
"learning_rate": 2.5988083057666534e-07,
"loss": 0.35901172161102296,
"memory(GiB)": 77.28,
"step": 2905,
"token_acc": 0.9014373716632443,
"train_speed(iter/s)": 0.014451
},
{
"epoch": 0.9311627534898604,
"grad_norm": 0.0391959243873001,
"learning_rate": 2.4825086892766745e-07,
"loss": 0.3521601438522339,
"memory(GiB)": 77.28,
"step": 2910,
"token_acc": 0.9066280456636565,
"train_speed(iter/s)": 0.014452
},
{
"epoch": 0.9327626894924202,
"grad_norm": 0.03754600878736611,
"learning_rate": 2.3688385568349515e-07,
"loss": 0.34390983581542967,
"memory(GiB)": 77.28,
"step": 2915,
"token_acc": 0.8572481572481573,
"train_speed(iter/s)": 0.014453
},
{
"epoch": 0.9343626254949802,
"grad_norm": 0.040067928972265965,
"learning_rate": 2.2578009734690264e-07,
"loss": 0.3604452133178711,
"memory(GiB)": 77.28,
"step": 2920,
"token_acc": 0.9112820512820513,
"train_speed(iter/s)": 0.014453
},
{
"epoch": 0.9359625614975401,
"grad_norm": 0.03683689442632747,
"learning_rate": 2.1493989332218468e-07,
"loss": 0.34636476039886477,
"memory(GiB)": 77.28,
"step": 2925,
"token_acc": 0.8987912682662818,
"train_speed(iter/s)": 0.014453
},
{
"epoch": 0.9375624975001,
"grad_norm": 0.03737336362440631,
"learning_rate": 2.043635359070928e-07,
"loss": 0.35263738632202146,
"memory(GiB)": 77.28,
"step": 2930,
"token_acc": 0.9111613632692618,
"train_speed(iter/s)": 0.014456
},
{
"epoch": 0.9391624335026599,
"grad_norm": 0.037836926968173146,
"learning_rate": 1.9405131028495838e-07,
"loss": 0.35706591606140137,
"memory(GiB)": 77.28,
"step": 2935,
"token_acc": 0.8956814357823892,
"train_speed(iter/s)": 0.014455
},
{
"epoch": 0.9407623695052197,
"grad_norm": 0.03836305322378439,
"learning_rate": 1.8400349451700438e-07,
"loss": 0.3512787103652954,
"memory(GiB)": 77.28,
"step": 2940,
"token_acc": 0.9075797047512716,
"train_speed(iter/s)": 0.014457
},
{
"epoch": 0.9423623055077797,
"grad_norm": 0.0366255147217552,
"learning_rate": 1.742203595348435e-07,
"loss": 0.34981393814086914,
"memory(GiB)": 77.28,
"step": 2945,
"token_acc": 0.8997175141242938,
"train_speed(iter/s)": 0.014458
},
{
"epoch": 0.9439622415103396,
"grad_norm": 0.039903409914483774,
"learning_rate": 1.6470216913317628e-07,
"loss": 0.3578468322753906,
"memory(GiB)": 77.28,
"step": 2950,
"token_acc": 0.8852280955829109,
"train_speed(iter/s)": 0.014458
},
{
"epoch": 0.9455621775128995,
"grad_norm": 0.03632939603743224,
"learning_rate": 1.5544917996267562e-07,
"loss": 0.34919579029083253,
"memory(GiB)": 77.28,
"step": 2955,
"token_acc": 0.8785700775487044,
"train_speed(iter/s)": 0.014459
},
{
"epoch": 0.9471621135154594,
"grad_norm": 0.03871438310718043,
"learning_rate": 1.464616415230702e-07,
"loss": 0.35771970748901366,
"memory(GiB)": 77.28,
"step": 2960,
"token_acc": 0.893168029543656,
"train_speed(iter/s)": 0.014458
},
{
"epoch": 0.9487620495180192,
"grad_norm": 0.036901244083775424,
"learning_rate": 1.3773979615640976e-07,
"loss": 0.350262188911438,
"memory(GiB)": 77.28,
"step": 2965,
"token_acc": 0.9129044634863793,
"train_speed(iter/s)": 0.014459
},
{
"epoch": 0.9503619855205792,
"grad_norm": 0.03732230567834177,
"learning_rate": 1.292838790405393e-07,
"loss": 0.3521857500076294,
"memory(GiB)": 77.28,
"step": 2970,
"token_acc": 0.9018378063010501,
"train_speed(iter/s)": 0.014459
},
{
"epoch": 0.9519619215231391,
"grad_norm": 0.038418652841169985,
"learning_rate": 1.2109411818274851e-07,
"loss": 0.3512159585952759,
"memory(GiB)": 77.28,
"step": 2975,
"token_acc": 0.9232655416125776,
"train_speed(iter/s)": 0.01446
},
{
"epoch": 0.953561857525699,
"grad_norm": 0.03784470443540757,
"learning_rate": 1.1317073441363458e-07,
"loss": 0.35275132656097413,
"memory(GiB)": 77.28,
"step": 2980,
"token_acc": 0.9260171180677688,
"train_speed(iter/s)": 0.01446
},
{
"epoch": 0.9551617935282589,
"grad_norm": 0.037282968935844873,
"learning_rate": 1.055139413811379e-07,
"loss": 0.3569183826446533,
"memory(GiB)": 77.28,
"step": 2985,
"token_acc": 0.885663082437276,
"train_speed(iter/s)": 0.014461
},
{
"epoch": 0.9567617295308187,
"grad_norm": 0.03683921378138757,
"learning_rate": 9.812394554478355e-08,
"loss": 0.34755406379699705,
"memory(GiB)": 77.28,
"step": 2990,
"token_acc": 0.8813957127210139,
"train_speed(iter/s)": 0.014461
},
{
"epoch": 0.9583616655333786,
"grad_norm": 0.03816641432653712,
"learning_rate": 9.10009461701189e-08,
"loss": 0.35767698287963867,
"memory(GiB)": 77.28,
"step": 2995,
"token_acc": 0.8030809205642168,
"train_speed(iter/s)": 0.014462
},
{
"epoch": 0.9599616015359386,
"grad_norm": 0.03992625623958567,
"learning_rate": 8.41451353233369e-08,
"loss": 0.3515816926956177,
"memory(GiB)": 77.28,
"step": 3000,
"token_acc": 0.8982125124131083,
"train_speed(iter/s)": 0.014461
},
{
"epoch": 0.9599616015359386,
"eval_loss": 0.5968807339668274,
"eval_runtime": 161.8894,
"eval_samples_per_second": 124.085,
"eval_steps_per_second": 0.624,
"eval_token_acc": 0.8961120208061873,
"step": 3000
},
{
"epoch": 0.9615615375384985,
"grad_norm": 0.03506254411144567,
"learning_rate": 7.755669786609688e-08,
"loss": 0.3550234317779541,
"memory(GiB)": 77.28,
"step": 3005,
"token_acc": 0.9054439315775183,
"train_speed(iter/s)": 0.014448
},
{
"epoch": 0.9631614735410584,
"grad_norm": 0.037502896081413176,
"learning_rate": 7.123581145053849e-08,
"loss": 0.35604000091552734,
"memory(GiB)": 77.28,
"step": 3010,
"token_acc": 0.9059127526979784,
"train_speed(iter/s)": 0.014448
},
{
"epoch": 0.9647614095436182,
"grad_norm": 0.0382845236708893,
"learning_rate": 6.51826465144978e-08,
"loss": 0.35213139057159426,
"memory(GiB)": 77.28,
"step": 3015,
"token_acc": 0.8929005381010241,
"train_speed(iter/s)": 0.014448
},
{
"epoch": 0.9663613455461781,
"grad_norm": 0.03601878704018656,
"learning_rate": 5.93973662769054e-08,
"loss": 0.3391100883483887,
"memory(GiB)": 77.28,
"step": 3020,
"token_acc": 0.9075471698113208,
"train_speed(iter/s)": 0.014448
},
{
"epoch": 0.9679612815487381,
"grad_norm": 0.03691591762096,
"learning_rate": 5.388012673338661e-08,
"loss": 0.3560220956802368,
"memory(GiB)": 77.28,
"step": 3025,
"token_acc": 0.8877074270984372,
"train_speed(iter/s)": 0.014448
},
{
"epoch": 0.969561217551298,
"grad_norm": 0.038006836164876816,
"learning_rate": 4.863107665205702e-08,
"loss": 0.34921257495880126,
"memory(GiB)": 77.28,
"step": 3030,
"token_acc": 0.8738569123184508,
"train_speed(iter/s)": 0.014449
},
{
"epoch": 0.9711611535538578,
"grad_norm": 0.03500666951506718,
"learning_rate": 4.365035756950797e-08,
"loss": 0.34278459548950196,
"memory(GiB)": 77.28,
"step": 3035,
"token_acc": 0.8969732246798603,
"train_speed(iter/s)": 0.014449
},
{
"epoch": 0.9727610895564177,
"grad_norm": 0.03689296268268185,
"learning_rate": 3.8938103786995144e-08,
"loss": 0.3485910177230835,
"memory(GiB)": 77.28,
"step": 3040,
"token_acc": 0.9163443924282516,
"train_speed(iter/s)": 0.01445
},
{
"epoch": 0.9743610255589776,
"grad_norm": 0.03704895203134622,
"learning_rate": 3.449444236681254e-08,
"loss": 0.3477888822555542,
"memory(GiB)": 77.28,
"step": 3045,
"token_acc": 0.9033083219645294,
"train_speed(iter/s)": 0.014451
},
{
"epoch": 0.9759609615615376,
"grad_norm": 0.038564010535460366,
"learning_rate": 3.03194931288664e-08,
"loss": 0.36015493869781495,
"memory(GiB)": 77.28,
"step": 3050,
"token_acc": 0.9197261244245072,
"train_speed(iter/s)": 0.014452
},
{
"epoch": 0.9775608975640975,
"grad_norm": 0.03839178767845547,
"learning_rate": 2.641336864744992e-08,
"loss": 0.3448947429656982,
"memory(GiB)": 77.28,
"step": 3055,
"token_acc": 0.9067073170731708,
"train_speed(iter/s)": 0.014453
},
{
"epoch": 0.9791608335666573,
"grad_norm": 0.037786530189202895,
"learning_rate": 2.2776174248199114e-08,
"loss": 0.3379628896713257,
"memory(GiB)": 77.28,
"step": 3060,
"token_acc": 0.9009945079412202,
"train_speed(iter/s)": 0.014455
},
{
"epoch": 0.9807607695692172,
"grad_norm": 0.035912429119548846,
"learning_rate": 1.9408008005260548e-08,
"loss": 0.3500987529754639,
"memory(GiB)": 77.28,
"step": 3065,
"token_acc": 0.8876028806584362,
"train_speed(iter/s)": 0.014456
},
{
"epoch": 0.9823607055717771,
"grad_norm": 0.03444074710514445,
"learning_rate": 1.630896073864352e-08,
"loss": 0.3504997730255127,
"memory(GiB)": 77.28,
"step": 3070,
"token_acc": 0.8979777737292768,
"train_speed(iter/s)": 0.014456
},
{
"epoch": 0.983960641574337,
"grad_norm": 0.03756464819153609,
"learning_rate": 1.3479116011769766e-08,
"loss": 0.34742605686187744,
"memory(GiB)": 77.28,
"step": 3075,
"token_acc": 0.9106449106449106,
"train_speed(iter/s)": 0.014457
},
{
"epoch": 0.985560577576897,
"grad_norm": 0.03754891232855657,
"learning_rate": 1.0918550129223049e-08,
"loss": 0.3474902868270874,
"memory(GiB)": 77.28,
"step": 3080,
"token_acc": 0.9118387909319899,
"train_speed(iter/s)": 0.014457
},
{
"epoch": 0.9871605135794568,
"grad_norm": 0.03682524226116992,
"learning_rate": 8.627332134690802e-09,
"loss": 0.353102445602417,
"memory(GiB)": 77.28,
"step": 3085,
"token_acc": 0.8938781202063868,
"train_speed(iter/s)": 0.014457
},
{
"epoch": 0.9887604495820167,
"grad_norm": 0.0349572055380618,
"learning_rate": 6.605523809102288e-09,
"loss": 0.35455539226531985,
"memory(GiB)": 77.28,
"step": 3090,
"token_acc": 0.9251228678808904,
"train_speed(iter/s)": 0.014457
},
{
"epoch": 0.9903603855845766,
"grad_norm": 0.0367341369681787,
"learning_rate": 4.853179668959928e-09,
"loss": 0.3528116464614868,
"memory(GiB)": 77.28,
"step": 3095,
"token_acc": 0.8497830802603037,
"train_speed(iter/s)": 0.014458
},
{
"epoch": 0.9919603215871365,
"grad_norm": 0.03543382063951275,
"learning_rate": 3.3703469648760367e-09,
"loss": 0.34554617404937743,
"memory(GiB)": 77.28,
"step": 3100,
"token_acc": 0.8760165975103734,
"train_speed(iter/s)": 0.014458
},
{
"epoch": 0.9935602575896965,
"grad_norm": 0.03672488758432725,
"learning_rate": 2.1570656802905042e-09,
"loss": 0.35210456848144533,
"memory(GiB)": 77.28,
"step": 3105,
"token_acc": 0.875547098001903,
"train_speed(iter/s)": 0.014459
},
{
"epoch": 0.9951601935922563,
"grad_norm": 0.03667904917275392,
"learning_rate": 1.213368530399439e-09,
"loss": 0.36057708263397215,
"memory(GiB)": 77.28,
"step": 3110,
"token_acc": 0.8785273780601757,
"train_speed(iter/s)": 0.014459
},
{
"epoch": 0.9967601295948162,
"grad_norm": 0.037172261753358984,
"learning_rate": 5.392809612703165e-10,
"loss": 0.347002911567688,
"memory(GiB)": 77.28,
"step": 3115,
"token_acc": 0.8876961189099918,
"train_speed(iter/s)": 0.01446
},
{
"epoch": 0.9983600655973761,
"grad_norm": 0.03623294899802742,
"learning_rate": 1.3482114915475132e-10,
"loss": 0.34892323017120364,
"memory(GiB)": 77.28,
"step": 3120,
"token_acc": 0.9150393970537856,
"train_speed(iter/s)": 0.014459
},
{
"epoch": 0.999960001599936,
"grad_norm": 0.03979082426503465,
"learning_rate": 0.0,
"loss": 0.3523369073867798,
"memory(GiB)": 77.28,
"step": 3125,
"token_acc": 0.874745605920444,
"train_speed(iter/s)": 0.014459
},
{
"epoch": 0.999960001599936,
"eval_loss": 0.5968554615974426,
"eval_runtime": 146.0358,
"eval_samples_per_second": 137.555,
"eval_steps_per_second": 0.692,
"eval_token_acc": 0.8961375957338398,
"step": 3125
}
],
"logging_steps": 5,
"max_steps": 3125,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.4706850358900346e+20,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}