{ "best_metric": 0.59685546, "best_model_checkpoint": "/cpfs04/user/zhangqi/zhangqi/data/model_garden/0619_intern8b_v7-1-part15-19-resize-decay/v1-20250624-140732/checkpoint-3125", "epoch": 0.999960001599936, "eval_steps": 250, "global_step": 3125, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0003199872005119795, "grad_norm": 0.034520456918049065, "learning_rate": 2.0000000000000002e-07, "loss": 0.40204745531082153, "memory(GiB)": 40.4, "step": 1, "token_acc": 0.8817829457364341, "train_speed(iter/s)": 0.010771 }, { "epoch": 0.0015999360025598975, "grad_norm": 0.03420916628520123, "learning_rate": 1.0000000000000002e-06, "loss": 0.39483457803726196, "memory(GiB)": 60.23, "step": 5, "token_acc": 0.9005736137667304, "train_speed(iter/s)": 0.01352 }, { "epoch": 0.003199872005119795, "grad_norm": 0.03272073151772668, "learning_rate": 2.0000000000000003e-06, "loss": 0.39301304817199706, "memory(GiB)": 60.23, "step": 10, "token_acc": 0.9103283749649173, "train_speed(iter/s)": 0.014045 }, { "epoch": 0.004799808007679693, "grad_norm": 0.03294824977638289, "learning_rate": 3e-06, "loss": 0.38296959400177, "memory(GiB)": 60.23, "step": 15, "token_acc": 0.8657198192382182, "train_speed(iter/s)": 0.014012 }, { "epoch": 0.00639974401023959, "grad_norm": 0.0334494683427454, "learning_rate": 4.000000000000001e-06, "loss": 0.3897198915481567, "memory(GiB)": 60.23, "step": 20, "token_acc": 0.8978738236319275, "train_speed(iter/s)": 0.014066 }, { "epoch": 0.007999680012799487, "grad_norm": 0.03136602849258215, "learning_rate": 5e-06, "loss": 0.3881317138671875, "memory(GiB)": 60.23, "step": 25, "token_acc": 0.9188261541101768, "train_speed(iter/s)": 0.014214 }, { "epoch": 0.009599616015359386, "grad_norm": 0.03265063244675712, "learning_rate": 6e-06, "loss": 0.3901845693588257, "memory(GiB)": 60.23, "step": 30, "token_acc": 0.896212961495801, "train_speed(iter/s)": 0.01427 }, { "epoch": 0.011199552017919284, "grad_norm": 0.032203046144693825, "learning_rate": 7e-06, "loss": 0.3953768014907837, "memory(GiB)": 60.23, "step": 35, "token_acc": 0.8888367729831145, "train_speed(iter/s)": 0.014326 }, { "epoch": 0.01279948802047918, "grad_norm": 0.032390202609314425, "learning_rate": 8.000000000000001e-06, "loss": 0.38478689193725585, "memory(GiB)": 60.23, "step": 40, "token_acc": 0.8951841359773371, "train_speed(iter/s)": 0.014412 }, { "epoch": 0.014399424023039079, "grad_norm": 0.033801877503161194, "learning_rate": 9e-06, "loss": 0.38552730083465575, "memory(GiB)": 60.23, "step": 45, "token_acc": 0.9022271714922049, "train_speed(iter/s)": 0.014478 }, { "epoch": 0.015999360025598975, "grad_norm": 0.03301429535272696, "learning_rate": 1e-05, "loss": 0.38529186248779296, "memory(GiB)": 60.23, "step": 50, "token_acc": 0.8758992805755396, "train_speed(iter/s)": 0.014599 }, { "epoch": 0.017599296028158875, "grad_norm": 0.03149429825234287, "learning_rate": 1.1000000000000001e-05, "loss": 0.3803748607635498, "memory(GiB)": 76.07, "step": 55, "token_acc": 0.8477023180154535, "train_speed(iter/s)": 0.014592 }, { "epoch": 0.01919923203071877, "grad_norm": 0.033808759949065646, "learning_rate": 1.2e-05, "loss": 0.3867351055145264, "memory(GiB)": 76.07, "step": 60, "token_acc": 0.8850377977463986, "train_speed(iter/s)": 0.014608 }, { "epoch": 0.020799168033278668, "grad_norm": 0.03275791011215982, "learning_rate": 1.3000000000000001e-05, "loss": 0.39216411113739014, "memory(GiB)": 76.07, "step": 65, "token_acc": 0.901587826662256, "train_speed(iter/s)": 0.014547 }, { "epoch": 0.022399104035838568, "grad_norm": 0.03324158836650574, "learning_rate": 1.4e-05, "loss": 0.3974705457687378, "memory(GiB)": 76.07, "step": 70, "token_acc": 0.9116919816319322, "train_speed(iter/s)": 0.014544 }, { "epoch": 0.023999040038398464, "grad_norm": 0.031459981925064155, "learning_rate": 1.5000000000000002e-05, "loss": 0.37577147483825685, "memory(GiB)": 76.07, "step": 75, "token_acc": 0.9071523767214571, "train_speed(iter/s)": 0.014546 }, { "epoch": 0.02559897604095836, "grad_norm": 0.03366771334434494, "learning_rate": 1.6000000000000003e-05, "loss": 0.381273889541626, "memory(GiB)": 76.07, "step": 80, "token_acc": 0.8764924894081397, "train_speed(iter/s)": 0.014586 }, { "epoch": 0.02719891204351826, "grad_norm": 0.033717224619741304, "learning_rate": 1.7e-05, "loss": 0.3805533409118652, "memory(GiB)": 76.07, "step": 85, "token_acc": 0.8912507701786815, "train_speed(iter/s)": 0.014606 }, { "epoch": 0.028798848046078157, "grad_norm": 0.033563527084085734, "learning_rate": 1.8e-05, "loss": 0.3851145029067993, "memory(GiB)": 76.07, "step": 90, "token_acc": 0.8561311210036423, "train_speed(iter/s)": 0.0146 }, { "epoch": 0.030398784048638054, "grad_norm": 0.03128576112566358, "learning_rate": 1.9e-05, "loss": 0.37614123821258544, "memory(GiB)": 76.07, "step": 95, "token_acc": 0.8939516782876601, "train_speed(iter/s)": 0.014631 }, { "epoch": 0.03199872005119795, "grad_norm": 0.03419951138083408, "learning_rate": 2e-05, "loss": 0.3880021333694458, "memory(GiB)": 76.07, "step": 100, "token_acc": 0.8853078862081383, "train_speed(iter/s)": 0.014644 }, { "epoch": 0.03359865605375785, "grad_norm": 0.032374666409375384, "learning_rate": 1.9999865178850847e-05, "loss": 0.3888866901397705, "memory(GiB)": 76.07, "step": 105, "token_acc": 0.8903958366188298, "train_speed(iter/s)": 0.014639 }, { "epoch": 0.03519859205631775, "grad_norm": 0.034788552767827836, "learning_rate": 1.999946071903873e-05, "loss": 0.38006932735443116, "memory(GiB)": 76.07, "step": 110, "token_acc": 0.886074321717886, "train_speed(iter/s)": 0.014607 }, { "epoch": 0.03679852805887764, "grad_norm": 0.03501245967543382, "learning_rate": 1.9998786631469602e-05, "loss": 0.3911449432373047, "memory(GiB)": 76.07, "step": 115, "token_acc": 0.8798465266558966, "train_speed(iter/s)": 0.014604 }, { "epoch": 0.03839846406143754, "grad_norm": 0.03242661684377351, "learning_rate": 1.999784293431971e-05, "loss": 0.3861077070236206, "memory(GiB)": 76.07, "step": 120, "token_acc": 0.8665442301805938, "train_speed(iter/s)": 0.01425 }, { "epoch": 0.03999840006399744, "grad_norm": 0.03463389128587641, "learning_rate": 1.9996629653035128e-05, "loss": 0.3905928373336792, "memory(GiB)": 76.07, "step": 125, "token_acc": 0.8998435054773083, "train_speed(iter/s)": 0.014271 }, { "epoch": 0.041598336066557336, "grad_norm": 0.032645290740144876, "learning_rate": 1.999514682033104e-05, "loss": 0.3899507761001587, "memory(GiB)": 76.07, "step": 130, "token_acc": 0.8884783798576902, "train_speed(iter/s)": 0.01428 }, { "epoch": 0.043198272069117236, "grad_norm": 0.033852879217125625, "learning_rate": 1.99933944761909e-05, "loss": 0.3912219047546387, "memory(GiB)": 76.07, "step": 135, "token_acc": 0.8862394436164928, "train_speed(iter/s)": 0.014311 }, { "epoch": 0.044798208071677136, "grad_norm": 0.03314594743128617, "learning_rate": 1.999137266786531e-05, "loss": 0.38516685962677, "memory(GiB)": 76.07, "step": 140, "token_acc": 0.8981660231660231, "train_speed(iter/s)": 0.014301 }, { "epoch": 0.04639814407423703, "grad_norm": 0.03523216491858916, "learning_rate": 1.998908144987078e-05, "loss": 0.3815142631530762, "memory(GiB)": 76.07, "step": 145, "token_acc": 0.8799054994093713, "train_speed(iter/s)": 0.014302 }, { "epoch": 0.04799808007679693, "grad_norm": 0.0357431601404605, "learning_rate": 1.9986520883988233e-05, "loss": 0.3848976373672485, "memory(GiB)": 76.07, "step": 150, "token_acc": 0.8563193851409052, "train_speed(iter/s)": 0.014282 }, { "epoch": 0.04959801607935683, "grad_norm": 0.03262403168423455, "learning_rate": 1.9983691039261358e-05, "loss": 0.3893115043640137, "memory(GiB)": 76.07, "step": 155, "token_acc": 0.8972887393627548, "train_speed(iter/s)": 0.014299 }, { "epoch": 0.05119795208191672, "grad_norm": 0.03531346626165974, "learning_rate": 1.998059199199474e-05, "loss": 0.38597636222839354, "memory(GiB)": 76.07, "step": 160, "token_acc": 0.8945444319460067, "train_speed(iter/s)": 0.014311 }, { "epoch": 0.05279788808447662, "grad_norm": 0.03357647993148674, "learning_rate": 1.9977223825751802e-05, "loss": 0.38405232429504393, "memory(GiB)": 76.07, "step": 165, "token_acc": 0.9117782909930716, "train_speed(iter/s)": 0.014301 }, { "epoch": 0.05439782408703652, "grad_norm": 0.03440413120355411, "learning_rate": 1.997358663135255e-05, "loss": 0.3781674146652222, "memory(GiB)": 76.07, "step": 170, "token_acc": 0.9056845887334788, "train_speed(iter/s)": 0.014302 }, { "epoch": 0.055997760089596414, "grad_norm": 0.033442118491656826, "learning_rate": 1.9969680506871138e-05, "loss": 0.3843045949935913, "memory(GiB)": 76.07, "step": 175, "token_acc": 0.900383810188416, "train_speed(iter/s)": 0.014315 }, { "epoch": 0.057597696092156314, "grad_norm": 0.033662777739076964, "learning_rate": 1.9965505557633188e-05, "loss": 0.389201283454895, "memory(GiB)": 76.07, "step": 180, "token_acc": 0.8900032883919763, "train_speed(iter/s)": 0.014316 }, { "epoch": 0.059197632094716214, "grad_norm": 0.03251706827553148, "learning_rate": 1.9961061896213006e-05, "loss": 0.38699405193328856, "memory(GiB)": 76.07, "step": 185, "token_acc": 0.876270255424334, "train_speed(iter/s)": 0.014313 }, { "epoch": 0.06079756809727611, "grad_norm": 0.03283605185775851, "learning_rate": 1.9956349642430494e-05, "loss": 0.3966814517974854, "memory(GiB)": 76.07, "step": 190, "token_acc": 0.879168042258171, "train_speed(iter/s)": 0.014349 }, { "epoch": 0.06239750409983601, "grad_norm": 0.03449933751162301, "learning_rate": 1.9951368923347945e-05, "loss": 0.39047400951385497, "memory(GiB)": 76.07, "step": 195, "token_acc": 0.8665105386416861, "train_speed(iter/s)": 0.014346 }, { "epoch": 0.0639974401023959, "grad_norm": 0.03280827137817534, "learning_rate": 1.9946119873266615e-05, "loss": 0.37484734058380126, "memory(GiB)": 76.07, "step": 200, "token_acc": 0.9069767441860465, "train_speed(iter/s)": 0.014353 }, { "epoch": 0.0655973761049558, "grad_norm": 0.03584807348524717, "learning_rate": 1.9940602633723097e-05, "loss": 0.3874636173248291, "memory(GiB)": 76.07, "step": 205, "token_acc": 0.8897243107769424, "train_speed(iter/s)": 0.014347 }, { "epoch": 0.0671973121075157, "grad_norm": 0.03414995299732699, "learning_rate": 1.99348173534855e-05, "loss": 0.3874980926513672, "memory(GiB)": 76.07, "step": 210, "token_acc": 0.881191672648959, "train_speed(iter/s)": 0.014354 }, { "epoch": 0.06879724811007559, "grad_norm": 0.03286991072544723, "learning_rate": 1.9928764188549462e-05, "loss": 0.38269970417022703, "memory(GiB)": 76.07, "step": 215, "token_acc": 0.8929658134956148, "train_speed(iter/s)": 0.014357 }, { "epoch": 0.0703971841126355, "grad_norm": 0.03359781387973185, "learning_rate": 1.9922443302133906e-05, "loss": 0.38327147960662844, "memory(GiB)": 76.07, "step": 220, "token_acc": 0.9165275459098498, "train_speed(iter/s)": 0.014351 }, { "epoch": 0.07199712011519539, "grad_norm": 0.03275039662042973, "learning_rate": 1.9915854864676665e-05, "loss": 0.3898788928985596, "memory(GiB)": 76.07, "step": 225, "token_acc": 0.8592750533049041, "train_speed(iter/s)": 0.014343 }, { "epoch": 0.07359705611775529, "grad_norm": 0.03395724860978424, "learning_rate": 1.990899905382988e-05, "loss": 0.3836425065994263, "memory(GiB)": 76.07, "step": 230, "token_acc": 0.9050742813042639, "train_speed(iter/s)": 0.014331 }, { "epoch": 0.07519699212031519, "grad_norm": 0.03323014361282172, "learning_rate": 1.9901876054455217e-05, "loss": 0.40008840560913084, "memory(GiB)": 76.07, "step": 235, "token_acc": 0.8920118343195266, "train_speed(iter/s)": 0.014328 }, { "epoch": 0.07679692812287509, "grad_norm": 0.03344217991905355, "learning_rate": 1.9894486058618863e-05, "loss": 0.3800571203231812, "memory(GiB)": 76.07, "step": 240, "token_acc": 0.9098188751191612, "train_speed(iter/s)": 0.014319 }, { "epoch": 0.07839686412543498, "grad_norm": 0.03473900387731426, "learning_rate": 1.9886829265586368e-05, "loss": 0.39225742816925047, "memory(GiB)": 76.07, "step": 245, "token_acc": 0.8883210297179632, "train_speed(iter/s)": 0.014313 }, { "epoch": 0.07999680012799489, "grad_norm": 0.03513961345431388, "learning_rate": 1.9878905881817254e-05, "loss": 0.3903574228286743, "memory(GiB)": 76.07, "step": 250, "token_acc": 0.8576667430666972, "train_speed(iter/s)": 0.014314 }, { "epoch": 0.07999680012799489, "eval_loss": 0.622439444065094, "eval_runtime": 157.3342, "eval_samples_per_second": 127.677, "eval_steps_per_second": 0.642, "eval_token_acc": 0.8873306398781322, "step": 250 }, { "epoch": 0.08159673613055478, "grad_norm": 0.03372251695955875, "learning_rate": 1.9870716120959462e-05, "loss": 0.38556718826293945, "memory(GiB)": 76.07, "step": 255, "token_acc": 0.8786027360871298, "train_speed(iter/s)": 0.014206 }, { "epoch": 0.08319667213311467, "grad_norm": 0.03264986549168058, "learning_rate": 1.986226020384359e-05, "loss": 0.37873091697692873, "memory(GiB)": 76.07, "step": 260, "token_acc": 0.889001778003556, "train_speed(iter/s)": 0.014217 }, { "epoch": 0.08479660813567458, "grad_norm": 0.03141933647884167, "learning_rate": 1.9853538358476933e-05, "loss": 0.38749330043792723, "memory(GiB)": 76.07, "step": 265, "token_acc": 0.9063093880653744, "train_speed(iter/s)": 0.014225 }, { "epoch": 0.08639654413823447, "grad_norm": 0.03386011981593799, "learning_rate": 1.9844550820037326e-05, "loss": 0.387894868850708, "memory(GiB)": 76.07, "step": 270, "token_acc": 0.8854422161304285, "train_speed(iter/s)": 0.014241 }, { "epoch": 0.08799648014079436, "grad_norm": 0.03711364422068592, "learning_rate": 1.9835297830866827e-05, "loss": 0.38588383197784426, "memory(GiB)": 76.07, "step": 275, "token_acc": 0.8868660598179454, "train_speed(iter/s)": 0.014246 }, { "epoch": 0.08959641614335427, "grad_norm": 0.03341834892330089, "learning_rate": 1.9825779640465157e-05, "loss": 0.38894240856170653, "memory(GiB)": 76.07, "step": 280, "token_acc": 0.9306718179866924, "train_speed(iter/s)": 0.014256 }, { "epoch": 0.09119635214591416, "grad_norm": 0.03387819973021305, "learning_rate": 1.9815996505483e-05, "loss": 0.38292522430419923, "memory(GiB)": 76.07, "step": 285, "token_acc": 0.8671353884982873, "train_speed(iter/s)": 0.014257 }, { "epoch": 0.09279628814847406, "grad_norm": 0.03429150627328532, "learning_rate": 1.9805948689715043e-05, "loss": 0.376310133934021, "memory(GiB)": 76.07, "step": 290, "token_acc": 0.8656910569105691, "train_speed(iter/s)": 0.014265 }, { "epoch": 0.09439622415103396, "grad_norm": 0.03450246959931839, "learning_rate": 1.979563646409291e-05, "loss": 0.39239072799682617, "memory(GiB)": 76.07, "step": 295, "token_acc": 0.8977094446187637, "train_speed(iter/s)": 0.014273 }, { "epoch": 0.09599616015359386, "grad_norm": 0.031824087341643076, "learning_rate": 1.9785060106677818e-05, "loss": 0.3861429691314697, "memory(GiB)": 76.07, "step": 300, "token_acc": 0.9000577700751011, "train_speed(iter/s)": 0.014282 }, { "epoch": 0.09759609615615375, "grad_norm": 0.03346845050772549, "learning_rate": 1.97742199026531e-05, "loss": 0.38443379402160643, "memory(GiB)": 76.07, "step": 305, "token_acc": 0.8890675241157556, "train_speed(iter/s)": 0.014289 }, { "epoch": 0.09919603215871366, "grad_norm": 0.03191677416839948, "learning_rate": 1.9763116144316506e-05, "loss": 0.3867342948913574, "memory(GiB)": 76.07, "step": 310, "token_acc": 0.8610453181746408, "train_speed(iter/s)": 0.0143 }, { "epoch": 0.10079596816127355, "grad_norm": 0.03421794121376898, "learning_rate": 1.9751749131072335e-05, "loss": 0.38043770790100095, "memory(GiB)": 76.07, "step": 315, "token_acc": 0.895057390489576, "train_speed(iter/s)": 0.014318 }, { "epoch": 0.10239590416383344, "grad_norm": 0.0335963955600723, "learning_rate": 1.9740119169423337e-05, "loss": 0.3925303936004639, "memory(GiB)": 76.07, "step": 320, "token_acc": 0.8879252835223482, "train_speed(iter/s)": 0.014325 }, { "epoch": 0.10399584016639335, "grad_norm": 0.03247377224618784, "learning_rate": 1.9728226572962474e-05, "loss": 0.39456634521484374, "memory(GiB)": 76.07, "step": 325, "token_acc": 0.9204545454545454, "train_speed(iter/s)": 0.014349 }, { "epoch": 0.10559577616895324, "grad_norm": 0.03372138735130045, "learning_rate": 1.9716071662364454e-05, "loss": 0.39053902626037595, "memory(GiB)": 76.07, "step": 330, "token_acc": 0.8667469395946217, "train_speed(iter/s)": 0.014349 }, { "epoch": 0.10719571217151314, "grad_norm": 0.03514032505290493, "learning_rate": 1.970365476537707e-05, "loss": 0.38283843994140626, "memory(GiB)": 76.07, "step": 335, "token_acc": 0.8957358294331773, "train_speed(iter/s)": 0.01436 }, { "epoch": 0.10879564817407304, "grad_norm": 0.03192284784230212, "learning_rate": 1.9690976216812397e-05, "loss": 0.3861492156982422, "memory(GiB)": 76.07, "step": 340, "token_acc": 0.8877259752616555, "train_speed(iter/s)": 0.014363 }, { "epoch": 0.11039558417663294, "grad_norm": 0.033562102316210984, "learning_rate": 1.9678036358537726e-05, "loss": 0.38447730541229247, "memory(GiB)": 76.07, "step": 345, "token_acc": 0.8906195309765488, "train_speed(iter/s)": 0.014357 }, { "epoch": 0.11199552017919283, "grad_norm": 0.03449736551982357, "learning_rate": 1.966483553946637e-05, "loss": 0.3902695894241333, "memory(GiB)": 76.07, "step": 350, "token_acc": 0.8884874759152216, "train_speed(iter/s)": 0.014363 }, { "epoch": 0.11359545618175274, "grad_norm": 0.03299602135964767, "learning_rate": 1.9651374115548255e-05, "loss": 0.3823978424072266, "memory(GiB)": 76.07, "step": 355, "token_acc": 0.9103085026335591, "train_speed(iter/s)": 0.014362 }, { "epoch": 0.11519539218431263, "grad_norm": 0.03433798775900007, "learning_rate": 1.9637652449760297e-05, "loss": 0.3836047172546387, "memory(GiB)": 76.07, "step": 360, "token_acc": 0.8500127323656735, "train_speed(iter/s)": 0.014367 }, { "epoch": 0.11679532818687252, "grad_norm": 0.03345845540162246, "learning_rate": 1.9623670912096656e-05, "loss": 0.3858953475952148, "memory(GiB)": 76.07, "step": 365, "token_acc": 0.8927587882715049, "train_speed(iter/s)": 0.014364 }, { "epoch": 0.11839526418943243, "grad_norm": 0.03341419963683031, "learning_rate": 1.9609429879558726e-05, "loss": 0.37838385105133054, "memory(GiB)": 76.07, "step": 370, "token_acc": 0.8884803921568627, "train_speed(iter/s)": 0.014369 }, { "epoch": 0.11999520019199232, "grad_norm": 0.03318506660752264, "learning_rate": 1.9594929736144978e-05, "loss": 0.39080846309661865, "memory(GiB)": 76.07, "step": 375, "token_acc": 0.8838375667367739, "train_speed(iter/s)": 0.014371 }, { "epoch": 0.12159513619455221, "grad_norm": 0.032615752382225055, "learning_rate": 1.958017087284061e-05, "loss": 0.3769553184509277, "memory(GiB)": 76.07, "step": 380, "token_acc": 0.9018950192855945, "train_speed(iter/s)": 0.014386 }, { "epoch": 0.12319507219711212, "grad_norm": 0.03133189034498934, "learning_rate": 1.9565153687607006e-05, "loss": 0.3848905563354492, "memory(GiB)": 76.07, "step": 385, "token_acc": 0.8868577075098815, "train_speed(iter/s)": 0.014386 }, { "epoch": 0.12479500819967201, "grad_norm": 0.03197313383191992, "learning_rate": 1.9549878585371006e-05, "loss": 0.38284108638763426, "memory(GiB)": 76.07, "step": 390, "token_acc": 0.8899135446685879, "train_speed(iter/s)": 0.014394 }, { "epoch": 0.1263949442022319, "grad_norm": 0.031847003037153106, "learning_rate": 1.9534345978013972e-05, "loss": 0.3859133720397949, "memory(GiB)": 76.07, "step": 395, "token_acc": 0.8742560659240043, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.1279948802047918, "grad_norm": 0.03422769575373828, "learning_rate": 1.9518556284360696e-05, "loss": 0.38266074657440186, "memory(GiB)": 76.07, "step": 400, "token_acc": 0.9119344878507182, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.1295948162073517, "grad_norm": 0.03221204648449897, "learning_rate": 1.9502509930168113e-05, "loss": 0.38048243522644043, "memory(GiB)": 76.07, "step": 405, "token_acc": 0.9020516214427532, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.1311947522099116, "grad_norm": 0.034549366769104535, "learning_rate": 1.9486207348113803e-05, "loss": 0.37532615661621094, "memory(GiB)": 76.07, "step": 410, "token_acc": 0.8943346070775876, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.1327946882124715, "grad_norm": 0.03556652976821217, "learning_rate": 1.946964897778433e-05, "loss": 0.38798692226409914, "memory(GiB)": 76.07, "step": 415, "token_acc": 0.9074051332432764, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.1343946242150314, "grad_norm": 0.032782000611636754, "learning_rate": 1.9452835265663404e-05, "loss": 0.38746092319488523, "memory(GiB)": 76.07, "step": 420, "token_acc": 0.8914526484751204, "train_speed(iter/s)": 0.014394 }, { "epoch": 0.1359945602175913, "grad_norm": 0.03634421691537427, "learning_rate": 1.9435766665119823e-05, "loss": 0.3850360870361328, "memory(GiB)": 76.07, "step": 425, "token_acc": 0.8656546489563567, "train_speed(iter/s)": 0.014387 }, { "epoch": 0.13759449622015119, "grad_norm": 0.03409209090353386, "learning_rate": 1.941844363639525e-05, "loss": 0.3924290895462036, "memory(GiB)": 76.07, "step": 430, "token_acc": 0.8879083449450379, "train_speed(iter/s)": 0.014389 }, { "epoch": 0.13919443222271108, "grad_norm": 0.03586613576277069, "learning_rate": 1.9400866646591816e-05, "loss": 0.3824719667434692, "memory(GiB)": 76.07, "step": 435, "token_acc": 0.8478456014362658, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.140794368225271, "grad_norm": 0.03612177033189357, "learning_rate": 1.9383036169659513e-05, "loss": 0.3880664587020874, "memory(GiB)": 76.07, "step": 440, "token_acc": 0.8917012448132781, "train_speed(iter/s)": 0.014389 }, { "epoch": 0.1423943042278309, "grad_norm": 0.03585757877860267, "learning_rate": 1.936495268638342e-05, "loss": 0.39356892108917235, "memory(GiB)": 76.07, "step": 445, "token_acc": 0.8592846433925894, "train_speed(iter/s)": 0.014396 }, { "epoch": 0.14399424023039079, "grad_norm": 0.032095810341158305, "learning_rate": 1.934661668437073e-05, "loss": 0.3881976842880249, "memory(GiB)": 76.07, "step": 450, "token_acc": 0.8775109170305677, "train_speed(iter/s)": 0.014397 }, { "epoch": 0.14559417623295068, "grad_norm": 0.035715492914310906, "learning_rate": 1.932802865803763e-05, "loss": 0.3885905981063843, "memory(GiB)": 76.07, "step": 455, "token_acc": 0.8691340534797237, "train_speed(iter/s)": 0.014403 }, { "epoch": 0.14719411223551057, "grad_norm": 0.03359573622491741, "learning_rate": 1.930918910859592e-05, "loss": 0.38143932819366455, "memory(GiB)": 76.07, "step": 460, "token_acc": 0.8709529627367135, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.14879404823807046, "grad_norm": 0.03406432480471397, "learning_rate": 1.9290098544039546e-05, "loss": 0.38104383945465087, "memory(GiB)": 76.07, "step": 465, "token_acc": 0.8818467648518947, "train_speed(iter/s)": 0.014388 }, { "epoch": 0.15039398424063039, "grad_norm": 0.0334674901088086, "learning_rate": 1.927075747913088e-05, "loss": 0.38691911697387693, "memory(GiB)": 76.07, "step": 470, "token_acc": 0.8903258526689489, "train_speed(iter/s)": 0.014384 }, { "epoch": 0.15199392024319028, "grad_norm": 0.03139039879037341, "learning_rate": 1.9251166435386837e-05, "loss": 0.3794668197631836, "memory(GiB)": 76.07, "step": 475, "token_acc": 0.881838481577968, "train_speed(iter/s)": 0.014384 }, { "epoch": 0.15359385624575017, "grad_norm": 0.032712134906697395, "learning_rate": 1.923132594106483e-05, "loss": 0.3873713254928589, "memory(GiB)": 76.07, "step": 480, "token_acc": 0.8821567537520845, "train_speed(iter/s)": 0.014377 }, { "epoch": 0.15519379224831006, "grad_norm": 0.035229518924756134, "learning_rate": 1.92112365311485e-05, "loss": 0.38217613697052, "memory(GiB)": 76.07, "step": 485, "token_acc": 0.8820149162489301, "train_speed(iter/s)": 0.014383 }, { "epoch": 0.15679372825086996, "grad_norm": 0.03274511624533184, "learning_rate": 1.919089874733332e-05, "loss": 0.38786864280700684, "memory(GiB)": 76.07, "step": 490, "token_acc": 0.8996381941167217, "train_speed(iter/s)": 0.014387 }, { "epoch": 0.15839366425342985, "grad_norm": 0.03284065009666707, "learning_rate": 1.9170313138011964e-05, "loss": 0.3825819730758667, "memory(GiB)": 76.07, "step": 495, "token_acc": 0.9057554964290716, "train_speed(iter/s)": 0.014388 }, { "epoch": 0.15999360025598977, "grad_norm": 0.03419542960956006, "learning_rate": 1.9149480258259535e-05, "loss": 0.38258953094482423, "memory(GiB)": 76.07, "step": 500, "token_acc": 0.8961057623221728, "train_speed(iter/s)": 0.01439 }, { "epoch": 0.15999360025598977, "eval_loss": 0.6193732619285583, "eval_runtime": 168.67, "eval_samples_per_second": 119.096, "eval_steps_per_second": 0.599, "eval_token_acc": 0.8881378895176241, "step": 500 }, { "epoch": 0.16159353625854966, "grad_norm": 0.03206404175508866, "learning_rate": 1.9128400669818586e-05, "loss": 0.3774104118347168, "memory(GiB)": 76.07, "step": 505, "token_acc": 0.8925198620896417, "train_speed(iter/s)": 0.014323 }, { "epoch": 0.16319347226110956, "grad_norm": 0.03264569403840349, "learning_rate": 1.9107074941083987e-05, "loss": 0.3852546215057373, "memory(GiB)": 76.07, "step": 510, "token_acc": 0.8948775055679288, "train_speed(iter/s)": 0.014323 }, { "epoch": 0.16479340826366945, "grad_norm": 0.033527933798423434, "learning_rate": 1.9085503647087588e-05, "loss": 0.37959980964660645, "memory(GiB)": 76.07, "step": 515, "token_acc": 0.8879507475813544, "train_speed(iter/s)": 0.014326 }, { "epoch": 0.16639334426622934, "grad_norm": 0.03295561806491276, "learning_rate": 1.906368736948272e-05, "loss": 0.3861686706542969, "memory(GiB)": 76.07, "step": 520, "token_acc": 0.889853813865972, "train_speed(iter/s)": 0.014325 }, { "epoch": 0.16799328026878924, "grad_norm": 0.03184366828026341, "learning_rate": 1.9041626696528503e-05, "loss": 0.38342669010162356, "memory(GiB)": 76.07, "step": 525, "token_acc": 0.8992944194996793, "train_speed(iter/s)": 0.014338 }, { "epoch": 0.16959321627134916, "grad_norm": 0.033738127296183994, "learning_rate": 1.9019322223073997e-05, "loss": 0.3832501173019409, "memory(GiB)": 76.56, "step": 530, "token_acc": 0.9125608082823999, "train_speed(iter/s)": 0.014338 }, { "epoch": 0.17119315227390905, "grad_norm": 0.0333234741433263, "learning_rate": 1.899677455054215e-05, "loss": 0.38559613227844236, "memory(GiB)": 76.56, "step": 535, "token_acc": 0.8407811400422238, "train_speed(iter/s)": 0.014346 }, { "epoch": 0.17279308827646894, "grad_norm": 0.03099693893435516, "learning_rate": 1.8973984286913584e-05, "loss": 0.38624236583709715, "memory(GiB)": 76.56, "step": 540, "token_acc": 0.9047673619069447, "train_speed(iter/s)": 0.014351 }, { "epoch": 0.17439302427902884, "grad_norm": 0.03564589208589755, "learning_rate": 1.895095204671021e-05, "loss": 0.3812048673629761, "memory(GiB)": 76.56, "step": 545, "token_acc": 0.9132128940843075, "train_speed(iter/s)": 0.014351 }, { "epoch": 0.17599296028158873, "grad_norm": 0.03306838339780197, "learning_rate": 1.892767845097864e-05, "loss": 0.38694233894348146, "memory(GiB)": 76.56, "step": 550, "token_acc": 0.8896024995660475, "train_speed(iter/s)": 0.014362 }, { "epoch": 0.17759289628414862, "grad_norm": 0.03511437169806579, "learning_rate": 1.890416412727346e-05, "loss": 0.3801495790481567, "memory(GiB)": 76.56, "step": 555, "token_acc": 0.8592943801422396, "train_speed(iter/s)": 0.01437 }, { "epoch": 0.17919283228670854, "grad_norm": 0.033895161074874745, "learning_rate": 1.88804097096403e-05, "loss": 0.37548644542694093, "memory(GiB)": 76.56, "step": 560, "token_acc": 0.9068198850861854, "train_speed(iter/s)": 0.014382 }, { "epoch": 0.18079276828926844, "grad_norm": 0.033440476927491095, "learning_rate": 1.8856415838598738e-05, "loss": 0.3744084596633911, "memory(GiB)": 76.56, "step": 565, "token_acc": 0.8932863323185387, "train_speed(iter/s)": 0.01439 }, { "epoch": 0.18239270429182833, "grad_norm": 0.035885470124335045, "learning_rate": 1.8832183161125026e-05, "loss": 0.3785930395126343, "memory(GiB)": 76.56, "step": 570, "token_acc": 0.848502994011976, "train_speed(iter/s)": 0.014392 }, { "epoch": 0.18399264029438822, "grad_norm": 0.03324044359853696, "learning_rate": 1.8807712330634645e-05, "loss": 0.3850206136703491, "memory(GiB)": 76.56, "step": 575, "token_acc": 0.9094766619519095, "train_speed(iter/s)": 0.014389 }, { "epoch": 0.18559257629694811, "grad_norm": 0.03263482668047798, "learning_rate": 1.87830040069647e-05, "loss": 0.37779667377471926, "memory(GiB)": 76.56, "step": 580, "token_acc": 0.9197788863421869, "train_speed(iter/s)": 0.014394 }, { "epoch": 0.187192512299508, "grad_norm": 0.03550703857977458, "learning_rate": 1.87580588563561e-05, "loss": 0.3798608541488647, "memory(GiB)": 76.56, "step": 585, "token_acc": 0.8933184500079732, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.18879244830206793, "grad_norm": 0.03391669539615144, "learning_rate": 1.873287755143563e-05, "loss": 0.3751659393310547, "memory(GiB)": 76.56, "step": 590, "token_acc": 0.9166312809624911, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.19039238430462782, "grad_norm": 0.03459224478752944, "learning_rate": 1.8707460771197773e-05, "loss": 0.38129582405090334, "memory(GiB)": 76.56, "step": 595, "token_acc": 0.9053976730879267, "train_speed(iter/s)": 0.014401 }, { "epoch": 0.1919923203071877, "grad_norm": 0.03339910116296889, "learning_rate": 1.868180920098644e-05, "loss": 0.38383800983428956, "memory(GiB)": 76.56, "step": 600, "token_acc": 0.872634898388227, "train_speed(iter/s)": 0.014405 }, { "epoch": 0.1935922563097476, "grad_norm": 0.033692221359167995, "learning_rate": 1.8655923532476463e-05, "loss": 0.3776890516281128, "memory(GiB)": 76.56, "step": 605, "token_acc": 0.9167274052478134, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.1951921923123075, "grad_norm": 0.0332686161147481, "learning_rate": 1.8629804463654956e-05, "loss": 0.3806722402572632, "memory(GiB)": 76.56, "step": 610, "token_acc": 0.8899387576552931, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.1967921283148674, "grad_norm": 0.034972178070293056, "learning_rate": 1.8603452698802498e-05, "loss": 0.38915410041809084, "memory(GiB)": 77.28, "step": 615, "token_acc": 0.8858360966366651, "train_speed(iter/s)": 0.014415 }, { "epoch": 0.1983920643174273, "grad_norm": 0.032230881125325274, "learning_rate": 1.857686894847413e-05, "loss": 0.37490866184234617, "memory(GiB)": 77.28, "step": 620, "token_acc": 0.8671481128219103, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.1999920003199872, "grad_norm": 0.03461719194107402, "learning_rate": 1.8550053929480202e-05, "loss": 0.3814939737319946, "memory(GiB)": 77.28, "step": 625, "token_acc": 0.9177888022678952, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.2015919363225471, "grad_norm": 0.03369236467656219, "learning_rate": 1.8523008364867056e-05, "loss": 0.38451409339904785, "memory(GiB)": 77.28, "step": 630, "token_acc": 0.870737913486005, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.203191872325107, "grad_norm": 0.03255294220837347, "learning_rate": 1.8495732983897504e-05, "loss": 0.37762107849121096, "memory(GiB)": 77.28, "step": 635, "token_acc": 0.8674445294567712, "train_speed(iter/s)": 0.014415 }, { "epoch": 0.20479180832766689, "grad_norm": 0.03474015187119267, "learning_rate": 1.8468228522031197e-05, "loss": 0.3729959726333618, "memory(GiB)": 77.28, "step": 640, "token_acc": 0.8980558325024925, "train_speed(iter/s)": 0.014415 }, { "epoch": 0.20639174433022678, "grad_norm": 0.034565861862923035, "learning_rate": 1.8440495720904758e-05, "loss": 0.380579400062561, "memory(GiB)": 77.28, "step": 645, "token_acc": 0.8993572889278411, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.2079916803327867, "grad_norm": 0.03667995528577527, "learning_rate": 1.8412535328311813e-05, "loss": 0.3839728593826294, "memory(GiB)": 77.28, "step": 650, "token_acc": 0.8749459108610991, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.2095916163353466, "grad_norm": 0.03454743457582257, "learning_rate": 1.8384348098182815e-05, "loss": 0.3817548990249634, "memory(GiB)": 77.28, "step": 655, "token_acc": 0.838635049161365, "train_speed(iter/s)": 0.014414 }, { "epoch": 0.21119155233790649, "grad_norm": 0.03545621066201229, "learning_rate": 1.8355934790564718e-05, "loss": 0.38348143100738524, "memory(GiB)": 77.28, "step": 660, "token_acc": 0.905241935483871, "train_speed(iter/s)": 0.014419 }, { "epoch": 0.21279148834046638, "grad_norm": 0.03572649708176257, "learning_rate": 1.832729617160047e-05, "loss": 0.3777714967727661, "memory(GiB)": 77.28, "step": 665, "token_acc": 0.9266425992779783, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.21439142434302627, "grad_norm": 0.033679470408814874, "learning_rate": 1.8298433013508384e-05, "loss": 0.38007168769836425, "memory(GiB)": 77.28, "step": 670, "token_acc": 0.8724329548200048, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.21599136034558616, "grad_norm": 0.034843072179395064, "learning_rate": 1.826934609456129e-05, "loss": 0.3841479063034058, "memory(GiB)": 77.28, "step": 675, "token_acc": 0.9051177216974482, "train_speed(iter/s)": 0.014421 }, { "epoch": 0.21759129634814608, "grad_norm": 0.0365705080123855, "learning_rate": 1.8240036199065546e-05, "loss": 0.38644914627075194, "memory(GiB)": 77.28, "step": 680, "token_acc": 0.8996160175534833, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.21919123235070598, "grad_norm": 0.03502298426190971, "learning_rate": 1.8210504117339917e-05, "loss": 0.38111186027526855, "memory(GiB)": 77.28, "step": 685, "token_acc": 0.9016673362796304, "train_speed(iter/s)": 0.014421 }, { "epoch": 0.22079116835326587, "grad_norm": 0.03495070664363774, "learning_rate": 1.8180750645694236e-05, "loss": 0.3825707912445068, "memory(GiB)": 77.28, "step": 690, "token_acc": 0.889507494646681, "train_speed(iter/s)": 0.014427 }, { "epoch": 0.22239110435582576, "grad_norm": 0.03462540294483746, "learning_rate": 1.8150776586407957e-05, "loss": 0.3783039808273315, "memory(GiB)": 77.28, "step": 695, "token_acc": 0.912316715542522, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.22399104035838566, "grad_norm": 0.03365404014142329, "learning_rate": 1.8120582747708503e-05, "loss": 0.3824033498764038, "memory(GiB)": 77.28, "step": 700, "token_acc": 0.8982280781462971, "train_speed(iter/s)": 0.014425 }, { "epoch": 0.22559097636094555, "grad_norm": 0.03525313113291282, "learning_rate": 1.8090169943749477e-05, "loss": 0.3850820779800415, "memory(GiB)": 77.28, "step": 705, "token_acc": 0.8981919931123548, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.22719091236350547, "grad_norm": 0.03679372138793972, "learning_rate": 1.8059538994588715e-05, "loss": 0.3753945827484131, "memory(GiB)": 77.28, "step": 710, "token_acc": 0.8688331368917326, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.22879084836606536, "grad_norm": 0.034266978650896916, "learning_rate": 1.8028690726166172e-05, "loss": 0.37668046951293943, "memory(GiB)": 77.28, "step": 715, "token_acc": 0.8903355032548823, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.23039078436862526, "grad_norm": 0.036082400513325966, "learning_rate": 1.7997625970281652e-05, "loss": 0.3769336223602295, "memory(GiB)": 77.28, "step": 720, "token_acc": 0.9020576131687242, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.23199072037118515, "grad_norm": 0.03522824011355726, "learning_rate": 1.796634556457236e-05, "loss": 0.38350567817687986, "memory(GiB)": 77.28, "step": 725, "token_acc": 0.9060884549109707, "train_speed(iter/s)": 0.014425 }, { "epoch": 0.23359065637374504, "grad_norm": 0.03384650643032488, "learning_rate": 1.793485035249036e-05, "loss": 0.3775055408477783, "memory(GiB)": 77.28, "step": 730, "token_acc": 0.8859484777517564, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.23519059237630494, "grad_norm": 0.03311621627978966, "learning_rate": 1.7903141183279776e-05, "loss": 0.3862148284912109, "memory(GiB)": 77.28, "step": 735, "token_acc": 0.8621900826446282, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.23679052837886486, "grad_norm": 0.03335783787305468, "learning_rate": 1.7871218911953942e-05, "loss": 0.37302775382995607, "memory(GiB)": 77.28, "step": 740, "token_acc": 0.8644029170464904, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.23839046438142475, "grad_norm": 0.03535545477880254, "learning_rate": 1.7839084399272317e-05, "loss": 0.3812894821166992, "memory(GiB)": 77.28, "step": 745, "token_acc": 0.8859926610148045, "train_speed(iter/s)": 0.014425 }, { "epoch": 0.23999040038398464, "grad_norm": 0.03536304324563333, "learning_rate": 1.780673851171728e-05, "loss": 0.38368926048278806, "memory(GiB)": 77.28, "step": 750, "token_acc": 0.915541118139853, "train_speed(iter/s)": 0.014421 }, { "epoch": 0.23999040038398464, "eval_loss": 0.6164008378982544, "eval_runtime": 169.1145, "eval_samples_per_second": 118.783, "eval_steps_per_second": 0.597, "eval_token_acc": 0.8890133389641892, "step": 750 }, { "epoch": 0.24159033638654454, "grad_norm": 0.03680542582321454, "learning_rate": 1.777418212147079e-05, "loss": 0.3746520519256592, "memory(GiB)": 77.28, "step": 755, "token_acc": 0.906258484930763, "train_speed(iter/s)": 0.014378 }, { "epoch": 0.24319027238910443, "grad_norm": 0.03617919710711229, "learning_rate": 1.7741416106390828e-05, "loss": 0.37985007762908934, "memory(GiB)": 77.28, "step": 760, "token_acc": 0.9109599395313681, "train_speed(iter/s)": 0.014379 }, { "epoch": 0.24479020839166432, "grad_norm": 0.03522579073367174, "learning_rate": 1.7708441349987753e-05, "loss": 0.3773144960403442, "memory(GiB)": 77.28, "step": 765, "token_acc": 0.8976910828025477, "train_speed(iter/s)": 0.014379 }, { "epoch": 0.24639014439422424, "grad_norm": 0.035862654993067136, "learning_rate": 1.767525874140048e-05, "loss": 0.38391575813293455, "memory(GiB)": 77.28, "step": 770, "token_acc": 0.8621361746361746, "train_speed(iter/s)": 0.014384 }, { "epoch": 0.24799008039678413, "grad_norm": 0.03436492411019931, "learning_rate": 1.7641869175372493e-05, "loss": 0.3757505416870117, "memory(GiB)": 77.28, "step": 775, "token_acc": 0.8865568083261058, "train_speed(iter/s)": 0.014384 }, { "epoch": 0.24959001639934403, "grad_norm": 0.03460527205552933, "learning_rate": 1.7608273552227723e-05, "loss": 0.3736558437347412, "memory(GiB)": 77.28, "step": 780, "token_acc": 0.9036800600826136, "train_speed(iter/s)": 0.014387 }, { "epoch": 0.25118995240190395, "grad_norm": 0.032946309550249894, "learning_rate": 1.7574472777846276e-05, "loss": 0.3870768308639526, "memory(GiB)": 77.28, "step": 785, "token_acc": 0.8922848664688428, "train_speed(iter/s)": 0.014391 }, { "epoch": 0.2527898884044638, "grad_norm": 0.033912193247707154, "learning_rate": 1.7540467763639994e-05, "loss": 0.3805867910385132, "memory(GiB)": 77.28, "step": 790, "token_acc": 0.8922994076467421, "train_speed(iter/s)": 0.014395 }, { "epoch": 0.25438982440702373, "grad_norm": 0.03576586207074456, "learning_rate": 1.7506259426527903e-05, "loss": 0.3851534128189087, "memory(GiB)": 77.28, "step": 795, "token_acc": 0.9005177922220998, "train_speed(iter/s)": 0.014396 }, { "epoch": 0.2559897604095836, "grad_norm": 0.03520759857550378, "learning_rate": 1.7471848688911465e-05, "loss": 0.3831015586853027, "memory(GiB)": 77.28, "step": 800, "token_acc": 0.9037107258938245, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.2575896964121435, "grad_norm": 0.0354593082946657, "learning_rate": 1.7437236478649718e-05, "loss": 0.37855699062347414, "memory(GiB)": 77.28, "step": 805, "token_acc": 0.8879225143308954, "train_speed(iter/s)": 0.014398 }, { "epoch": 0.2591896324147034, "grad_norm": 0.0337808522927956, "learning_rate": 1.7402423729034252e-05, "loss": 0.3711889982223511, "memory(GiB)": 77.28, "step": 810, "token_acc": 0.8532670454545455, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.2607895684172633, "grad_norm": 0.03492768229901829, "learning_rate": 1.736741137876405e-05, "loss": 0.3790097951889038, "memory(GiB)": 77.28, "step": 815, "token_acc": 0.9026868367577331, "train_speed(iter/s)": 0.014404 }, { "epoch": 0.2623895044198232, "grad_norm": 0.034967340753827056, "learning_rate": 1.7332200371920173e-05, "loss": 0.38438780307769777, "memory(GiB)": 77.28, "step": 820, "token_acc": 0.8772080999569152, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.2639894404223831, "grad_norm": 0.034264119000574224, "learning_rate": 1.72967916579403e-05, "loss": 0.37496380805969237, "memory(GiB)": 77.28, "step": 825, "token_acc": 0.8874313065059387, "train_speed(iter/s)": 0.014415 }, { "epoch": 0.265589376424943, "grad_norm": 0.033897273321268885, "learning_rate": 1.7261186191593135e-05, "loss": 0.3849215269088745, "memory(GiB)": 77.28, "step": 830, "token_acc": 0.8913907284768212, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.2671893124275029, "grad_norm": 0.03586062681802787, "learning_rate": 1.7225384932952655e-05, "loss": 0.3776970148086548, "memory(GiB)": 77.28, "step": 835, "token_acc": 0.8961673537944724, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.2687892484300628, "grad_norm": 0.03463767475104641, "learning_rate": 1.7189388847372227e-05, "loss": 0.3832270622253418, "memory(GiB)": 77.28, "step": 840, "token_acc": 0.8957481602616517, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.2703891844326227, "grad_norm": 0.03322572736677012, "learning_rate": 1.715319890545857e-05, "loss": 0.373725152015686, "memory(GiB)": 77.28, "step": 845, "token_acc": 0.87657254682695, "train_speed(iter/s)": 0.014419 }, { "epoch": 0.2719891204351826, "grad_norm": 0.03432594388504518, "learning_rate": 1.7116816083045603e-05, "loss": 0.38315093517303467, "memory(GiB)": 77.28, "step": 850, "token_acc": 0.8969713732540451, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.2735890564377425, "grad_norm": 0.0333573566270864, "learning_rate": 1.7080241361168108e-05, "loss": 0.3734123229980469, "memory(GiB)": 77.28, "step": 855, "token_acc": 0.8995640238979493, "train_speed(iter/s)": 0.014422 }, { "epoch": 0.27518899244030237, "grad_norm": 0.03455173370569199, "learning_rate": 1.704347572603529e-05, "loss": 0.38244330883026123, "memory(GiB)": 77.28, "step": 860, "token_acc": 0.8684960263907633, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.2767889284428623, "grad_norm": 0.035362819343963146, "learning_rate": 1.700652016900419e-05, "loss": 0.38104417324066164, "memory(GiB)": 77.28, "step": 865, "token_acc": 0.8948292371528886, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.27838886444542216, "grad_norm": 0.034943075348089055, "learning_rate": 1.696937568655294e-05, "loss": 0.375447678565979, "memory(GiB)": 77.28, "step": 870, "token_acc": 0.8895320791123975, "train_speed(iter/s)": 0.014425 }, { "epoch": 0.2799888004479821, "grad_norm": 0.03518132486138768, "learning_rate": 1.6932043280253892e-05, "loss": 0.3870342969894409, "memory(GiB)": 77.28, "step": 875, "token_acc": 0.8991515927645269, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.281588736450542, "grad_norm": 0.03358472672640051, "learning_rate": 1.689452395674664e-05, "loss": 0.3791643619537354, "memory(GiB)": 77.28, "step": 880, "token_acc": 0.882903981264637, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.28318867245310186, "grad_norm": 0.0335812057163469, "learning_rate": 1.6856818727710847e-05, "loss": 0.37133069038391114, "memory(GiB)": 77.28, "step": 885, "token_acc": 0.8640576725025747, "train_speed(iter/s)": 0.014429 }, { "epoch": 0.2847886084556618, "grad_norm": 0.033689064925450846, "learning_rate": 1.6818928609838967e-05, "loss": 0.3744334697723389, "memory(GiB)": 77.28, "step": 890, "token_acc": 0.904192992533027, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.28638854445822165, "grad_norm": 0.03324735662329384, "learning_rate": 1.678085462480885e-05, "loss": 0.3733969688415527, "memory(GiB)": 77.28, "step": 895, "token_acc": 0.8976343135087331, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.28798848046078157, "grad_norm": 0.034296406767401026, "learning_rate": 1.6742597799256182e-05, "loss": 0.37558152675628664, "memory(GiB)": 77.28, "step": 900, "token_acc": 0.9029866553696251, "train_speed(iter/s)": 0.014431 }, { "epoch": 0.2895884164633415, "grad_norm": 0.037582572024316786, "learning_rate": 1.6704159164746797e-05, "loss": 0.3907860040664673, "memory(GiB)": 77.28, "step": 905, "token_acc": 0.9069654950016124, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.29118835246590136, "grad_norm": 0.033743665763862556, "learning_rate": 1.6665539757748866e-05, "loss": 0.373353385925293, "memory(GiB)": 77.28, "step": 910, "token_acc": 0.8887350534927627, "train_speed(iter/s)": 0.014432 }, { "epoch": 0.2927882884684613, "grad_norm": 0.03614831200848796, "learning_rate": 1.6626740619604967e-05, "loss": 0.37723698616027834, "memory(GiB)": 77.28, "step": 915, "token_acc": 0.8396020383402086, "train_speed(iter/s)": 0.014431 }, { "epoch": 0.29438822447102114, "grad_norm": 0.0345492804244864, "learning_rate": 1.658776279650397e-05, "loss": 0.38145616054534914, "memory(GiB)": 77.28, "step": 920, "token_acc": 0.9019520851818988, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.29598816047358106, "grad_norm": 0.03512572590148749, "learning_rate": 1.6548607339452853e-05, "loss": 0.37775335311889646, "memory(GiB)": 77.28, "step": 925, "token_acc": 0.897300230633564, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.29758809647614093, "grad_norm": 0.0369285958635259, "learning_rate": 1.6509275304248366e-05, "loss": 0.3776986837387085, "memory(GiB)": 77.28, "step": 930, "token_acc": 0.8829104695246428, "train_speed(iter/s)": 0.014433 }, { "epoch": 0.29918803247870085, "grad_norm": 0.03462506767370347, "learning_rate": 1.6469767751448538e-05, "loss": 0.3799281597137451, "memory(GiB)": 77.28, "step": 935, "token_acc": 0.8700686947988224, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.30078796848126077, "grad_norm": 0.03338974052579205, "learning_rate": 1.6430085746344107e-05, "loss": 0.37139339447021485, "memory(GiB)": 77.28, "step": 940, "token_acc": 0.8986585010207058, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.30238790448382064, "grad_norm": 0.03046768581019517, "learning_rate": 1.639023035892978e-05, "loss": 0.36957426071166993, "memory(GiB)": 77.28, "step": 945, "token_acc": 0.9041682898324893, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.30398784048638056, "grad_norm": 0.03387287029515358, "learning_rate": 1.6350202663875385e-05, "loss": 0.3741326808929443, "memory(GiB)": 77.28, "step": 950, "token_acc": 0.887836853605244, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.3055877764889404, "grad_norm": 0.03266389732849567, "learning_rate": 1.6310003740496887e-05, "loss": 0.37487266063690183, "memory(GiB)": 77.28, "step": 955, "token_acc": 0.8825019485580671, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.30718771249150034, "grad_norm": 0.03351674125437608, "learning_rate": 1.6269634672727296e-05, "loss": 0.37188766002655027, "memory(GiB)": 77.28, "step": 960, "token_acc": 0.900720576461169, "train_speed(iter/s)": 0.014434 }, { "epoch": 0.30878764849406026, "grad_norm": 0.031488337411913495, "learning_rate": 1.6229096549087434e-05, "loss": 0.3766692399978638, "memory(GiB)": 77.28, "step": 965, "token_acc": 0.8986156351791531, "train_speed(iter/s)": 0.014434 }, { "epoch": 0.31038758449662013, "grad_norm": 0.03332048991285344, "learning_rate": 1.618839046265658e-05, "loss": 0.3791315793991089, "memory(GiB)": 77.28, "step": 970, "token_acc": 0.8830157184587565, "train_speed(iter/s)": 0.014434 }, { "epoch": 0.31198752049918005, "grad_norm": 0.03451155538352893, "learning_rate": 1.614751751104301e-05, "loss": 0.3785123825073242, "memory(GiB)": 77.28, "step": 975, "token_acc": 0.8958753965964811, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.3135874565017399, "grad_norm": 0.033059221136730675, "learning_rate": 1.6106478796354382e-05, "loss": 0.37357268333435056, "memory(GiB)": 77.28, "step": 980, "token_acc": 0.9054635545703481, "train_speed(iter/s)": 0.014433 }, { "epoch": 0.31518739250429983, "grad_norm": 0.037287525323499084, "learning_rate": 1.6065275425168034e-05, "loss": 0.37153091430664065, "memory(GiB)": 77.28, "step": 985, "token_acc": 0.9115008156606852, "train_speed(iter/s)": 0.014434 }, { "epoch": 0.3167873285068597, "grad_norm": 0.033380291242419424, "learning_rate": 1.602390850850113e-05, "loss": 0.3818410634994507, "memory(GiB)": 77.28, "step": 990, "token_acc": 0.8696263559662515, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.3183872645094196, "grad_norm": 0.03439438956072722, "learning_rate": 1.5982379161780722e-05, "loss": 0.366620135307312, "memory(GiB)": 77.28, "step": 995, "token_acc": 0.8729515742957098, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.31998720051197954, "grad_norm": 0.034020697710137944, "learning_rate": 1.5940688504813664e-05, "loss": 0.3724443197250366, "memory(GiB)": 77.28, "step": 1000, "token_acc": 0.9151111111111111, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.31998720051197954, "eval_loss": 0.6141124963760376, "eval_runtime": 158.9547, "eval_samples_per_second": 126.376, "eval_steps_per_second": 0.635, "eval_token_acc": 0.8899123960362797, "step": 1000 }, { "epoch": 0.3215871365145394, "grad_norm": 0.033011811195180485, "learning_rate": 1.5898837661756405e-05, "loss": 0.37675890922546384, "memory(GiB)": 77.28, "step": 1005, "token_acc": 0.9039758494444088, "train_speed(iter/s)": 0.014394 }, { "epoch": 0.3231870725170993, "grad_norm": 0.035486853244652936, "learning_rate": 1.5856827761084698e-05, "loss": 0.36834869384765623, "memory(GiB)": 77.28, "step": 1010, "token_acc": 0.8983255653374763, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.3247870085196592, "grad_norm": 0.03406105920529523, "learning_rate": 1.5814659935563165e-05, "loss": 0.3808779239654541, "memory(GiB)": 77.28, "step": 1015, "token_acc": 0.8966199971715457, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.3263869445222191, "grad_norm": 0.03308081465556082, "learning_rate": 1.577233532221474e-05, "loss": 0.37457520961761476, "memory(GiB)": 77.28, "step": 1020, "token_acc": 0.8870108821486455, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.32798688052477903, "grad_norm": 0.033407344837741056, "learning_rate": 1.5729855062290024e-05, "loss": 0.3800173044204712, "memory(GiB)": 77.28, "step": 1025, "token_acc": 0.8932816214187413, "train_speed(iter/s)": 0.014398 }, { "epoch": 0.3295868165273389, "grad_norm": 0.03687625272041186, "learning_rate": 1.568722030123651e-05, "loss": 0.3687458515167236, "memory(GiB)": 77.28, "step": 1030, "token_acc": 0.8835139318885449, "train_speed(iter/s)": 0.014397 }, { "epoch": 0.3311867525298988, "grad_norm": 0.03432528592893544, "learning_rate": 1.5644432188667695e-05, "loss": 0.3709027528762817, "memory(GiB)": 77.28, "step": 1035, "token_acc": 0.8903526550466153, "train_speed(iter/s)": 0.014398 }, { "epoch": 0.3327866885324587, "grad_norm": 0.03319653665975899, "learning_rate": 1.5601491878332077e-05, "loss": 0.3777631759643555, "memory(GiB)": 77.28, "step": 1040, "token_acc": 0.8910492205289893, "train_speed(iter/s)": 0.014398 }, { "epoch": 0.3343866245350186, "grad_norm": 0.034202821127900754, "learning_rate": 1.5558400528082057e-05, "loss": 0.3790686845779419, "memory(GiB)": 77.28, "step": 1045, "token_acc": 0.9055801594331266, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.33598656053757847, "grad_norm": 0.03691156666887596, "learning_rate": 1.551515929984271e-05, "loss": 0.3713582992553711, "memory(GiB)": 77.28, "step": 1050, "token_acc": 0.9086751254057244, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.3375864965401384, "grad_norm": 0.03449412127363822, "learning_rate": 1.547176935958044e-05, "loss": 0.3742972373962402, "memory(GiB)": 77.28, "step": 1055, "token_acc": 0.8761001100110011, "train_speed(iter/s)": 0.014401 }, { "epoch": 0.3391864325426983, "grad_norm": 0.03434565900369347, "learning_rate": 1.5428231877271584e-05, "loss": 0.3786214828491211, "memory(GiB)": 77.28, "step": 1060, "token_acc": 0.871280724450194, "train_speed(iter/s)": 0.014397 }, { "epoch": 0.3407863685452582, "grad_norm": 0.033670135783735435, "learning_rate": 1.538454802687081e-05, "loss": 0.3775958776473999, "memory(GiB)": 77.28, "step": 1065, "token_acc": 0.8966864910790144, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.3423863045478181, "grad_norm": 0.03556691326509067, "learning_rate": 1.5340718986279505e-05, "loss": 0.38387582302093504, "memory(GiB)": 77.28, "step": 1070, "token_acc": 0.8821359223300971, "train_speed(iter/s)": 0.014401 }, { "epoch": 0.34398624055037796, "grad_norm": 0.03410584414537992, "learning_rate": 1.529674593731399e-05, "loss": 0.367924427986145, "memory(GiB)": 77.28, "step": 1075, "token_acc": 0.8812294182217344, "train_speed(iter/s)": 0.014403 }, { "epoch": 0.3455861765529379, "grad_norm": 0.03472114991770262, "learning_rate": 1.5252630065673662e-05, "loss": 0.38024375438690183, "memory(GiB)": 77.28, "step": 1080, "token_acc": 0.9087554085008908, "train_speed(iter/s)": 0.014402 }, { "epoch": 0.3471861125554978, "grad_norm": 0.034826116899087524, "learning_rate": 1.5208372560909031e-05, "loss": 0.37552039623260497, "memory(GiB)": 77.28, "step": 1085, "token_acc": 0.914223331253899, "train_speed(iter/s)": 0.014403 }, { "epoch": 0.34878604855805767, "grad_norm": 0.03415469833651797, "learning_rate": 1.5163974616389621e-05, "loss": 0.37450971603393557, "memory(GiB)": 77.28, "step": 1090, "token_acc": 0.8556051457075348, "train_speed(iter/s)": 0.014403 }, { "epoch": 0.3503859845606176, "grad_norm": 0.03655513507503648, "learning_rate": 1.5119437429271813e-05, "loss": 0.3794886589050293, "memory(GiB)": 77.28, "step": 1095, "token_acc": 0.8877699941622884, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.35198592056317746, "grad_norm": 0.034995454028194976, "learning_rate": 1.5074762200466557e-05, "loss": 0.3700634717941284, "memory(GiB)": 77.28, "step": 1100, "token_acc": 0.9116356483582992, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.3535858565657374, "grad_norm": 0.034538306373934693, "learning_rate": 1.5029950134606991e-05, "loss": 0.3690228223800659, "memory(GiB)": 77.28, "step": 1105, "token_acc": 0.8942924687605539, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.35518579256829724, "grad_norm": 0.0331069504176894, "learning_rate": 1.4985002440015959e-05, "loss": 0.36534135341644286, "memory(GiB)": 77.28, "step": 1110, "token_acc": 0.8909802740551122, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.35678572857085716, "grad_norm": 0.034796730271752487, "learning_rate": 1.4939920328673422e-05, "loss": 0.38107268810272216, "memory(GiB)": 77.28, "step": 1115, "token_acc": 0.9336683417085427, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.3583856645734171, "grad_norm": 0.03428619908077693, "learning_rate": 1.4894705016183803e-05, "loss": 0.36655797958374026, "memory(GiB)": 77.28, "step": 1120, "token_acc": 0.8758409785932721, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.35998560057597695, "grad_norm": 0.03650887961633004, "learning_rate": 1.4849357721743169e-05, "loss": 0.37060978412628176, "memory(GiB)": 77.28, "step": 1125, "token_acc": 0.8783166728372208, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.36158553657853687, "grad_norm": 0.0365625802848291, "learning_rate": 1.4803879668106393e-05, "loss": 0.38014461994171145, "memory(GiB)": 77.28, "step": 1130, "token_acc": 0.9106974995299868, "train_speed(iter/s)": 0.014407 }, { "epoch": 0.36318547258109674, "grad_norm": 0.03441102167916761, "learning_rate": 1.4758272081554168e-05, "loss": 0.3692239999771118, "memory(GiB)": 77.28, "step": 1135, "token_acc": 0.875740776142229, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.36478540858365666, "grad_norm": 0.03330407208979561, "learning_rate": 1.4712536191859934e-05, "loss": 0.37282414436340333, "memory(GiB)": 77.28, "step": 1140, "token_acc": 0.9172197640117994, "train_speed(iter/s)": 0.014412 }, { "epoch": 0.3663853445862166, "grad_norm": 0.035699108901044725, "learning_rate": 1.4666673232256738e-05, "loss": 0.37760913372039795, "memory(GiB)": 77.28, "step": 1145, "token_acc": 0.8891951488423374, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.36798528058877644, "grad_norm": 0.03532503045003448, "learning_rate": 1.4620684439403962e-05, "loss": 0.37476723194122313, "memory(GiB)": 77.28, "step": 1150, "token_acc": 0.9057826520438684, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.36958521659133636, "grad_norm": 0.0344910408139177, "learning_rate": 1.4574571053353987e-05, "loss": 0.374307918548584, "memory(GiB)": 77.28, "step": 1155, "token_acc": 0.9003899902502438, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.37118515259389623, "grad_norm": 0.035041872884459944, "learning_rate": 1.452833431751875e-05, "loss": 0.3697278738021851, "memory(GiB)": 77.28, "step": 1160, "token_acc": 0.9063315478643044, "train_speed(iter/s)": 0.014412 }, { "epoch": 0.37278508859645615, "grad_norm": 0.03519132694721856, "learning_rate": 1.448197547863622e-05, "loss": 0.36422038078308105, "memory(GiB)": 77.28, "step": 1165, "token_acc": 0.9000765696784073, "train_speed(iter/s)": 0.014412 }, { "epoch": 0.374385024599016, "grad_norm": 0.03547211442268733, "learning_rate": 1.4435495786736796e-05, "loss": 0.3784764289855957, "memory(GiB)": 77.28, "step": 1170, "token_acc": 0.8931984260820686, "train_speed(iter/s)": 0.014412 }, { "epoch": 0.37598496060157593, "grad_norm": 0.033084975573475006, "learning_rate": 1.438889649510956e-05, "loss": 0.3620013236999512, "memory(GiB)": 77.28, "step": 1175, "token_acc": 0.8830564784053156, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.37758489660413586, "grad_norm": 0.03494219380332394, "learning_rate": 1.4342178860268523e-05, "loss": 0.3709207773208618, "memory(GiB)": 77.28, "step": 1180, "token_acc": 0.8974101081216997, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.3791848326066957, "grad_norm": 0.03635733513697145, "learning_rate": 1.4295344141918734e-05, "loss": 0.37572057247161866, "memory(GiB)": 77.28, "step": 1185, "token_acc": 0.8881118881118881, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.38078476860925564, "grad_norm": 0.036630394189626006, "learning_rate": 1.4248393602922299e-05, "loss": 0.38127038478851316, "memory(GiB)": 77.28, "step": 1190, "token_acc": 0.8691920686593667, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.3823847046118155, "grad_norm": 0.03496102213628827, "learning_rate": 1.420132850926434e-05, "loss": 0.37142717838287354, "memory(GiB)": 77.28, "step": 1195, "token_acc": 0.8981158408932309, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.3839846406143754, "grad_norm": 0.03318251083183633, "learning_rate": 1.4154150130018867e-05, "loss": 0.37023210525512695, "memory(GiB)": 77.28, "step": 1200, "token_acc": 0.8824277666727239, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.38558457661693535, "grad_norm": 0.03307058094990319, "learning_rate": 1.4106859737314532e-05, "loss": 0.36745152473449705, "memory(GiB)": 77.28, "step": 1205, "token_acc": 0.8875419619544946, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.3871845126194952, "grad_norm": 0.035424472590586585, "learning_rate": 1.4059458606300358e-05, "loss": 0.3661919832229614, "memory(GiB)": 77.28, "step": 1210, "token_acc": 0.8780977896851976, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.38878444862205513, "grad_norm": 0.03420289825157965, "learning_rate": 1.4011948015111334e-05, "loss": 0.37414982318878176, "memory(GiB)": 77.28, "step": 1215, "token_acc": 0.8649971756731313, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.390384384624615, "grad_norm": 0.03335207107599188, "learning_rate": 1.396432924483396e-05, "loss": 0.3709057569503784, "memory(GiB)": 77.28, "step": 1220, "token_acc": 0.8992544446568533, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.3919843206271749, "grad_norm": 0.03659090220095111, "learning_rate": 1.3916603579471705e-05, "loss": 0.3810150146484375, "memory(GiB)": 77.28, "step": 1225, "token_acc": 0.8939136988882608, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.3935842566297348, "grad_norm": 0.03381760469834974, "learning_rate": 1.3868772305910376e-05, "loss": 0.3754213809967041, "memory(GiB)": 77.28, "step": 1230, "token_acc": 0.8942501005227181, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.3951841926322947, "grad_norm": 0.03498771807662288, "learning_rate": 1.3820836713883424e-05, "loss": 0.3726653099060059, "memory(GiB)": 77.28, "step": 1235, "token_acc": 0.8871177618737801, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.3967841286348546, "grad_norm": 0.03417566824022459, "learning_rate": 1.3772798095937172e-05, "loss": 0.363895320892334, "memory(GiB)": 77.28, "step": 1240, "token_acc": 0.8693128333856291, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.3983840646374145, "grad_norm": 0.03427076519706647, "learning_rate": 1.3724657747395957e-05, "loss": 0.3746422052383423, "memory(GiB)": 77.28, "step": 1245, "token_acc": 0.8969516235917826, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.3999840006399744, "grad_norm": 0.034195401871935746, "learning_rate": 1.3676416966327201e-05, "loss": 0.37307212352752683, "memory(GiB)": 77.28, "step": 1250, "token_acc": 0.8579698957931301, "train_speed(iter/s)": 0.014414 }, { "epoch": 0.3999840006399744, "eval_loss": 0.6099496483802795, "eval_runtime": 171.3813, "eval_samples_per_second": 117.212, "eval_steps_per_second": 0.589, "eval_token_acc": 0.8910344140161096, "step": 1250 }, { "epoch": 0.4015839366425343, "grad_norm": 0.03442247514389261, "learning_rate": 1.362807705350641e-05, "loss": 0.37490437030792234, "memory(GiB)": 77.28, "step": 1255, "token_acc": 0.8993468545892059, "train_speed(iter/s)": 0.014386 }, { "epoch": 0.4031838726450942, "grad_norm": 0.03543108584022621, "learning_rate": 1.3579639312382105e-05, "loss": 0.3771961212158203, "memory(GiB)": 77.28, "step": 1260, "token_acc": 0.8801626016260162, "train_speed(iter/s)": 0.014386 }, { "epoch": 0.4047838086476541, "grad_norm": 0.0351732239969475, "learning_rate": 1.3531105049040667e-05, "loss": 0.37178664207458495, "memory(GiB)": 77.28, "step": 1265, "token_acc": 0.9065207478340174, "train_speed(iter/s)": 0.014385 }, { "epoch": 0.406383744650214, "grad_norm": 0.0345010504737042, "learning_rate": 1.3482475572171132e-05, "loss": 0.3657317399978638, "memory(GiB)": 77.28, "step": 1270, "token_acc": 0.877511961722488, "train_speed(iter/s)": 0.014385 }, { "epoch": 0.4079836806527739, "grad_norm": 0.03426174629461238, "learning_rate": 1.3433752193029888e-05, "loss": 0.37921135425567626, "memory(GiB)": 77.28, "step": 1275, "token_acc": 0.9078838174273859, "train_speed(iter/s)": 0.014385 }, { "epoch": 0.40958361665533377, "grad_norm": 0.03606013606177771, "learning_rate": 1.3384936225405326e-05, "loss": 0.37555053234100344, "memory(GiB)": 77.28, "step": 1280, "token_acc": 0.8769176512078999, "train_speed(iter/s)": 0.014388 }, { "epoch": 0.4111835526578937, "grad_norm": 0.03638594766243525, "learning_rate": 1.333602898558242e-05, "loss": 0.37437245845794676, "memory(GiB)": 77.28, "step": 1285, "token_acc": 0.9019975868078831, "train_speed(iter/s)": 0.014389 }, { "epoch": 0.41278348866045356, "grad_norm": 0.03480203069849946, "learning_rate": 1.3287031792307226e-05, "loss": 0.37502617835998536, "memory(GiB)": 77.28, "step": 1290, "token_acc": 0.8862950291809217, "train_speed(iter/s)": 0.014388 }, { "epoch": 0.4143834246630135, "grad_norm": 0.034125749594009575, "learning_rate": 1.323794596675132e-05, "loss": 0.36830193996429444, "memory(GiB)": 77.28, "step": 1295, "token_acc": 0.8786538933922869, "train_speed(iter/s)": 0.01439 }, { "epoch": 0.4159833606655734, "grad_norm": 0.03467851818797935, "learning_rate": 1.318877283247619e-05, "loss": 0.36499571800231934, "memory(GiB)": 77.28, "step": 1300, "token_acc": 0.9122148024485254, "train_speed(iter/s)": 0.014391 }, { "epoch": 0.41758329666813326, "grad_norm": 0.03351147905784924, "learning_rate": 1.3139513715397521e-05, "loss": 0.36349053382873536, "memory(GiB)": 77.28, "step": 1305, "token_acc": 0.8831595210505987, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.4191832326706932, "grad_norm": 0.036200622491475404, "learning_rate": 1.3090169943749475e-05, "loss": 0.3686731576919556, "memory(GiB)": 77.28, "step": 1310, "token_acc": 0.8656188048711413, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.42078316867325305, "grad_norm": 0.03434195756254507, "learning_rate": 1.304074284804885e-05, "loss": 0.37625932693481445, "memory(GiB)": 77.28, "step": 1315, "token_acc": 0.8982833717653087, "train_speed(iter/s)": 0.014397 }, { "epoch": 0.42238310467581297, "grad_norm": 0.034749866744640846, "learning_rate": 1.2991233761059214e-05, "loss": 0.37158203125, "memory(GiB)": 77.28, "step": 1320, "token_acc": 0.8929796780153074, "train_speed(iter/s)": 0.014398 }, { "epoch": 0.4239830406783729, "grad_norm": 0.03548467311511409, "learning_rate": 1.2941644017754964e-05, "loss": 0.37488343715667727, "memory(GiB)": 77.28, "step": 1325, "token_acc": 0.904258943781942, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.42558297668093276, "grad_norm": 0.0341920805825176, "learning_rate": 1.289197495528534e-05, "loss": 0.3711984872817993, "memory(GiB)": 77.28, "step": 1330, "token_acc": 0.9195646027707096, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.4271829126834927, "grad_norm": 0.03554475718209227, "learning_rate": 1.284222791293836e-05, "loss": 0.368884015083313, "memory(GiB)": 77.28, "step": 1335, "token_acc": 0.8715034965034965, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.42878284868605254, "grad_norm": 0.03575254500276844, "learning_rate": 1.2792404232104699e-05, "loss": 0.36724443435668946, "memory(GiB)": 77.28, "step": 1340, "token_acc": 0.8930875576036866, "train_speed(iter/s)": 0.014401 }, { "epoch": 0.43038278468861246, "grad_norm": 0.03441881916218118, "learning_rate": 1.2742505256241543e-05, "loss": 0.3715341806411743, "memory(GiB)": 77.28, "step": 1345, "token_acc": 0.853706238998631, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.43198272069117233, "grad_norm": 0.03496918226927363, "learning_rate": 1.2692532330836346e-05, "loss": 0.3687546491622925, "memory(GiB)": 77.28, "step": 1350, "token_acc": 0.8844972353061642, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.43358265669373225, "grad_norm": 0.0342197412687382, "learning_rate": 1.2642486803370553e-05, "loss": 0.3681937217712402, "memory(GiB)": 77.28, "step": 1355, "token_acc": 0.8881036513545347, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.43518259269629217, "grad_norm": 0.03574024280169566, "learning_rate": 1.2592370023283268e-05, "loss": 0.36503190994262696, "memory(GiB)": 77.28, "step": 1360, "token_acc": 0.8921713441654358, "train_speed(iter/s)": 0.014403 }, { "epoch": 0.43678252869885204, "grad_norm": 0.03347504729151743, "learning_rate": 1.2542183341934873e-05, "loss": 0.3655604362487793, "memory(GiB)": 77.28, "step": 1365, "token_acc": 0.8905417406749556, "train_speed(iter/s)": 0.014404 }, { "epoch": 0.43838246470141196, "grad_norm": 0.03600326432455147, "learning_rate": 1.2491928112570568e-05, "loss": 0.366928768157959, "memory(GiB)": 77.28, "step": 1370, "token_acc": 0.896969696969697, "train_speed(iter/s)": 0.014405 }, { "epoch": 0.4399824007039718, "grad_norm": 0.03491325824773157, "learning_rate": 1.2441605690283915e-05, "loss": 0.37325053215026854, "memory(GiB)": 77.28, "step": 1375, "token_acc": 0.9224045391811072, "train_speed(iter/s)": 0.014404 }, { "epoch": 0.44158233670653174, "grad_norm": 0.03780738973130896, "learning_rate": 1.2391217431980273e-05, "loss": 0.3637607336044312, "memory(GiB)": 77.28, "step": 1380, "token_acc": 0.918383623554433, "train_speed(iter/s)": 0.014407 }, { "epoch": 0.44318227270909166, "grad_norm": 0.035690154757200145, "learning_rate": 1.234076469634022e-05, "loss": 0.3695350170135498, "memory(GiB)": 77.28, "step": 1385, "token_acc": 0.9101499423298731, "train_speed(iter/s)": 0.014405 }, { "epoch": 0.4447822087116515, "grad_norm": 0.03590046624532822, "learning_rate": 1.2290248843782915e-05, "loss": 0.364530086517334, "memory(GiB)": 77.28, "step": 1390, "token_acc": 0.9150886503437462, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.44638214471421145, "grad_norm": 0.03472603260778397, "learning_rate": 1.2239671236429413e-05, "loss": 0.3661569833755493, "memory(GiB)": 77.28, "step": 1395, "token_acc": 0.8987637821583695, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.4479820807167713, "grad_norm": 0.03445762563216705, "learning_rate": 1.218903323806595e-05, "loss": 0.3707982778549194, "memory(GiB)": 77.28, "step": 1400, "token_acc": 0.8745701357466064, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.44958201671933123, "grad_norm": 0.035218814155010984, "learning_rate": 1.2138336214107148e-05, "loss": 0.3614500045776367, "memory(GiB)": 77.28, "step": 1405, "token_acc": 0.8926116838487973, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.4511819527218911, "grad_norm": 0.03368066952337403, "learning_rate": 1.2087581531559208e-05, "loss": 0.3688710451126099, "memory(GiB)": 77.28, "step": 1410, "token_acc": 0.8967142129393785, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.452781888724451, "grad_norm": 0.03439504879116651, "learning_rate": 1.2036770558983067e-05, "loss": 0.3658963441848755, "memory(GiB)": 77.28, "step": 1415, "token_acc": 0.8647400820793434, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.45438182472701094, "grad_norm": 0.03294429069191412, "learning_rate": 1.1985904666457455e-05, "loss": 0.36890151500701907, "memory(GiB)": 77.28, "step": 1420, "token_acc": 0.9237490071485306, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.4559817607295708, "grad_norm": 0.03476827611852477, "learning_rate": 1.1934985225541998e-05, "loss": 0.3723160266876221, "memory(GiB)": 77.28, "step": 1425, "token_acc": 0.9109958092197166, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.4575816967321307, "grad_norm": 0.03464210636372699, "learning_rate": 1.18840136092402e-05, "loss": 0.3672841310501099, "memory(GiB)": 77.28, "step": 1430, "token_acc": 0.8790931989924433, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.4591816327346906, "grad_norm": 0.03405244756060422, "learning_rate": 1.1832991191962435e-05, "loss": 0.3602238416671753, "memory(GiB)": 77.28, "step": 1435, "token_acc": 0.8997259591429995, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.4607815687372505, "grad_norm": 0.03479537032371878, "learning_rate": 1.1781919349488894e-05, "loss": 0.3703394889831543, "memory(GiB)": 77.28, "step": 1440, "token_acc": 0.8827277423798864, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.46238150473981043, "grad_norm": 0.03630153249015714, "learning_rate": 1.1730799458932473e-05, "loss": 0.37370154857635496, "memory(GiB)": 77.28, "step": 1445, "token_acc": 0.9269114990969296, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.4639814407423703, "grad_norm": 0.03556854160517035, "learning_rate": 1.1679632898701649e-05, "loss": 0.36541726589202883, "memory(GiB)": 77.28, "step": 1450, "token_acc": 0.9014066496163683, "train_speed(iter/s)": 0.014415 }, { "epoch": 0.4655813767449302, "grad_norm": 0.03600309817806044, "learning_rate": 1.1628421048463315e-05, "loss": 0.37421836853027346, "memory(GiB)": 77.28, "step": 1455, "token_acc": 0.8827207275483138, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.4671813127474901, "grad_norm": 0.03322462203870746, "learning_rate": 1.1577165289105565e-05, "loss": 0.36063060760498045, "memory(GiB)": 77.28, "step": 1460, "token_acc": 0.8796332422941865, "train_speed(iter/s)": 0.014414 }, { "epoch": 0.46878124875005, "grad_norm": 0.03627115996462612, "learning_rate": 1.1525867002700484e-05, "loss": 0.3762346744537354, "memory(GiB)": 77.28, "step": 1465, "token_acc": 0.89023396577814, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.47038118475260987, "grad_norm": 0.035647939753576684, "learning_rate": 1.1474527572466847e-05, "loss": 0.3616278409957886, "memory(GiB)": 77.28, "step": 1470, "token_acc": 0.8720430107526882, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.4719811207551698, "grad_norm": 0.035285173854949954, "learning_rate": 1.1423148382732854e-05, "loss": 0.37021946907043457, "memory(GiB)": 77.28, "step": 1475, "token_acc": 0.9171724384148519, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.4735810567577297, "grad_norm": 0.035629576623768464, "learning_rate": 1.1371730818898785e-05, "loss": 0.3663011074066162, "memory(GiB)": 77.28, "step": 1480, "token_acc": 0.9093475533249686, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.4751809927602896, "grad_norm": 0.036145329500511955, "learning_rate": 1.132027626739965e-05, "loss": 0.3670144557952881, "memory(GiB)": 77.28, "step": 1485, "token_acc": 0.9013305685156385, "train_speed(iter/s)": 0.014419 }, { "epoch": 0.4767809287628495, "grad_norm": 0.03762454278136116, "learning_rate": 1.1268786115667798e-05, "loss": 0.370996880531311, "memory(GiB)": 77.28, "step": 1490, "token_acc": 0.8893922824558663, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.47838086476540936, "grad_norm": 0.03489585116510581, "learning_rate": 1.1217261752095518e-05, "loss": 0.3688071250915527, "memory(GiB)": 77.28, "step": 1495, "token_acc": 0.8983111749910169, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.4799808007679693, "grad_norm": 0.03446273860874737, "learning_rate": 1.1165704565997593e-05, "loss": 0.36016933917999266, "memory(GiB)": 77.28, "step": 1500, "token_acc": 0.8913821585903083, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.4799808007679693, "eval_loss": 0.6074870824813843, "eval_runtime": 172.104, "eval_samples_per_second": 116.72, "eval_steps_per_second": 0.587, "eval_token_acc": 0.8923138161661085, "step": 1500 }, { "epoch": 0.4815807367705292, "grad_norm": 0.03567717193695566, "learning_rate": 1.1114115947573834e-05, "loss": 0.3687129497528076, "memory(GiB)": 77.28, "step": 1505, "token_acc": 0.8902910121040433, "train_speed(iter/s)": 0.014394 }, { "epoch": 0.48318067277308907, "grad_norm": 0.035522027399690424, "learning_rate": 1.1062497287871606e-05, "loss": 0.3638231039047241, "memory(GiB)": 77.28, "step": 1510, "token_acc": 0.8678424740275429, "train_speed(iter/s)": 0.014394 }, { "epoch": 0.484780608775649, "grad_norm": 0.03466224643090752, "learning_rate": 1.1010849978748314e-05, "loss": 0.3652355194091797, "memory(GiB)": 77.28, "step": 1515, "token_acc": 0.8848318880267763, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.48638054477820886, "grad_norm": 0.0354542903926529, "learning_rate": 1.0959175412833869e-05, "loss": 0.3614229917526245, "memory(GiB)": 77.28, "step": 1520, "token_acc": 0.8956547443097842, "train_speed(iter/s)": 0.014394 }, { "epoch": 0.4879804807807688, "grad_norm": 0.03440586258662547, "learning_rate": 1.0907474983493144e-05, "loss": 0.3634510517120361, "memory(GiB)": 77.28, "step": 1525, "token_acc": 0.9006639427987743, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.48958041678332864, "grad_norm": 0.0360801859171815, "learning_rate": 1.08557500847884e-05, "loss": 0.36115612983703616, "memory(GiB)": 77.28, "step": 1530, "token_acc": 0.9074234296591106, "train_speed(iter/s)": 0.014393 }, { "epoch": 0.49118035278588856, "grad_norm": 0.03497423282601686, "learning_rate": 1.080400211144169e-05, "loss": 0.3642597675323486, "memory(GiB)": 77.28, "step": 1535, "token_acc": 0.8553005879006258, "train_speed(iter/s)": 0.014394 }, { "epoch": 0.4927802887884485, "grad_norm": 0.03446763731370447, "learning_rate": 1.0752232458797262e-05, "loss": 0.3559999942779541, "memory(GiB)": 77.28, "step": 1540, "token_acc": 0.8824950269963058, "train_speed(iter/s)": 0.014397 }, { "epoch": 0.49438022479100835, "grad_norm": 0.035387308834996176, "learning_rate": 1.070044252278393e-05, "loss": 0.3755119562149048, "memory(GiB)": 77.28, "step": 1545, "token_acc": 0.8683636363636363, "train_speed(iter/s)": 0.014398 }, { "epoch": 0.49598016079356827, "grad_norm": 0.035623508164582596, "learning_rate": 1.064863369987743e-05, "loss": 0.36371660232543945, "memory(GiB)": 77.28, "step": 1550, "token_acc": 0.9095354523227384, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.49758009679612814, "grad_norm": 0.03586927734844086, "learning_rate": 1.0596807387062772e-05, "loss": 0.3677802562713623, "memory(GiB)": 77.28, "step": 1555, "token_acc": 0.9039025142680858, "train_speed(iter/s)": 0.0144 }, { "epoch": 0.49918003279868806, "grad_norm": 0.03653622777112098, "learning_rate": 1.0544964981796563e-05, "loss": 0.3684211254119873, "memory(GiB)": 77.28, "step": 1560, "token_acc": 0.868405540819334, "train_speed(iter/s)": 0.014403 }, { "epoch": 0.500779968801248, "grad_norm": 0.0370656544294769, "learning_rate": 1.0493107881969335e-05, "loss": 0.3586920738220215, "memory(GiB)": 77.28, "step": 1565, "token_acc": 0.9100284977608902, "train_speed(iter/s)": 0.014404 }, { "epoch": 0.5023799048038079, "grad_norm": 0.03616388731261157, "learning_rate": 1.0441237485867845e-05, "loss": 0.36218621730804446, "memory(GiB)": 77.28, "step": 1570, "token_acc": 0.902942631058358, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.5039798408063677, "grad_norm": 0.03609161295790287, "learning_rate": 1.0389355192137379e-05, "loss": 0.3653876304626465, "memory(GiB)": 77.28, "step": 1575, "token_acc": 0.9041706462909901, "train_speed(iter/s)": 0.014407 }, { "epoch": 0.5055797768089276, "grad_norm": 0.03748808681261972, "learning_rate": 1.0337462399744025e-05, "loss": 0.37090017795562746, "memory(GiB)": 77.28, "step": 1580, "token_acc": 0.8675850435760473, "train_speed(iter/s)": 0.014405 }, { "epoch": 0.5071797128114875, "grad_norm": 0.0345478093663887, "learning_rate": 1.0285560507936962e-05, "loss": 0.3756566047668457, "memory(GiB)": 77.28, "step": 1585, "token_acc": 0.8505338078291815, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.5087796488140475, "grad_norm": 0.03650247257124013, "learning_rate": 1.0233650916210736e-05, "loss": 0.3637782096862793, "memory(GiB)": 77.28, "step": 1590, "token_acc": 0.9002235318024792, "train_speed(iter/s)": 0.014405 }, { "epoch": 0.5103795848166074, "grad_norm": 0.03633358814639768, "learning_rate": 1.0181735024267504e-05, "loss": 0.3628427028656006, "memory(GiB)": 77.28, "step": 1595, "token_acc": 0.8564662273476112, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.5119795208191672, "grad_norm": 0.037908299488290956, "learning_rate": 1.012981423197931e-05, "loss": 0.3728133201599121, "memory(GiB)": 77.28, "step": 1600, "token_acc": 0.8976991588322613, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.5135794568217271, "grad_norm": 0.03477409396173477, "learning_rate": 1.007788993935033e-05, "loss": 0.36496148109436033, "memory(GiB)": 77.28, "step": 1605, "token_acc": 0.8824123989218329, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.515179392824287, "grad_norm": 0.03591338948302039, "learning_rate": 1.002596354647912e-05, "loss": 0.3671183347702026, "memory(GiB)": 77.28, "step": 1610, "token_acc": 0.9008127633955448, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.516779328826847, "grad_norm": 0.035196111530376294, "learning_rate": 9.974036453520881e-06, "loss": 0.3602726459503174, "memory(GiB)": 77.28, "step": 1615, "token_acc": 0.8955383382313652, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.5183792648294068, "grad_norm": 0.03748636943340592, "learning_rate": 9.922110060649672e-06, "loss": 0.36945409774780275, "memory(GiB)": 77.28, "step": 1620, "token_acc": 0.9212632180623035, "train_speed(iter/s)": 0.014412 }, { "epoch": 0.5199792008319667, "grad_norm": 0.03548428460759863, "learning_rate": 9.870185768020694e-06, "loss": 0.3491816997528076, "memory(GiB)": 77.28, "step": 1625, "token_acc": 0.9078094620868438, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.5215791368345266, "grad_norm": 0.03518573566978696, "learning_rate": 9.818264975732497e-06, "loss": 0.3619969367980957, "memory(GiB)": 77.28, "step": 1630, "token_acc": 0.9038128249566725, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.5231790728370865, "grad_norm": 0.03522651488263579, "learning_rate": 9.766349083789266e-06, "loss": 0.36349639892578123, "memory(GiB)": 77.28, "step": 1635, "token_acc": 0.8999687890137328, "train_speed(iter/s)": 0.014409 }, { "epoch": 0.5247790088396465, "grad_norm": 0.03809564693798896, "learning_rate": 9.71443949206304e-06, "loss": 0.3725806713104248, "memory(GiB)": 77.28, "step": 1640, "token_acc": 0.9121447028423773, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.5263789448422063, "grad_norm": 0.034721878832050516, "learning_rate": 9.662537600255979e-06, "loss": 0.363213849067688, "memory(GiB)": 77.28, "step": 1645, "token_acc": 0.9216789268714842, "train_speed(iter/s)": 0.01441 }, { "epoch": 0.5279788808447662, "grad_norm": 0.03790554016155405, "learning_rate": 9.610644807862625e-06, "loss": 0.3574589729309082, "memory(GiB)": 77.28, "step": 1650, "token_acc": 0.8960802187784868, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.5295788168473261, "grad_norm": 0.03479166503013798, "learning_rate": 9.558762514132157e-06, "loss": 0.36415691375732423, "memory(GiB)": 77.28, "step": 1655, "token_acc": 0.8750883808625972, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.531178752849886, "grad_norm": 0.035643614279757305, "learning_rate": 9.506892118030668e-06, "loss": 0.35752391815185547, "memory(GiB)": 77.28, "step": 1660, "token_acc": 0.8826297984997794, "train_speed(iter/s)": 0.014414 }, { "epoch": 0.532778688852446, "grad_norm": 0.0354932657107638, "learning_rate": 9.455035018203439e-06, "loss": 0.3576699495315552, "memory(GiB)": 77.28, "step": 1665, "token_acc": 0.9069622618009715, "train_speed(iter/s)": 0.014412 }, { "epoch": 0.5343786248550058, "grad_norm": 0.03500590822032312, "learning_rate": 9.40319261293723e-06, "loss": 0.3677717447280884, "memory(GiB)": 77.28, "step": 1670, "token_acc": 0.9211569519894288, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.5359785608575657, "grad_norm": 0.0342264071437337, "learning_rate": 9.351366300122569e-06, "loss": 0.36440818309783934, "memory(GiB)": 77.28, "step": 1675, "token_acc": 0.8545367258761402, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.5375784968601256, "grad_norm": 0.035171456175800336, "learning_rate": 9.299557477216073e-06, "loss": 0.3585089445114136, "memory(GiB)": 77.28, "step": 1680, "token_acc": 0.8948815566835872, "train_speed(iter/s)": 0.014414 }, { "epoch": 0.5391784328626855, "grad_norm": 0.035301103192222384, "learning_rate": 9.247767541202738e-06, "loss": 0.364825439453125, "memory(GiB)": 77.28, "step": 1685, "token_acc": 0.9007202881152461, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.5407783688652454, "grad_norm": 0.0364786603543792, "learning_rate": 9.195997888558312e-06, "loss": 0.36471312046051024, "memory(GiB)": 77.28, "step": 1690, "token_acc": 0.9036003130707018, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.5423783048678052, "grad_norm": 0.03610181518648113, "learning_rate": 9.144249915211605e-06, "loss": 0.363938045501709, "memory(GiB)": 77.28, "step": 1695, "token_acc": 0.8853854642913448, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.5439782408703652, "grad_norm": 0.03450955343562785, "learning_rate": 9.092525016506858e-06, "loss": 0.3608727931976318, "memory(GiB)": 77.28, "step": 1700, "token_acc": 0.9012345679012346, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.5455781768729251, "grad_norm": 0.03928334892137232, "learning_rate": 9.040824587166136e-06, "loss": 0.36118714809417723, "memory(GiB)": 77.28, "step": 1705, "token_acc": 0.910617705664674, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.547178112875485, "grad_norm": 0.03595714484013575, "learning_rate": 8.98915002125169e-06, "loss": 0.35936105251312256, "memory(GiB)": 77.28, "step": 1710, "token_acc": 0.8989370970552361, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.5487780488780449, "grad_norm": 0.037004676299287526, "learning_rate": 8.9375027121284e-06, "loss": 0.36121673583984376, "memory(GiB)": 77.28, "step": 1715, "token_acc": 0.8800587685321224, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.5503779848806047, "grad_norm": 0.03719630007378892, "learning_rate": 8.885884052426168e-06, "loss": 0.3646020650863647, "memory(GiB)": 77.28, "step": 1720, "token_acc": 0.886611426079372, "train_speed(iter/s)": 0.014419 }, { "epoch": 0.5519779208831647, "grad_norm": 0.03665089520428984, "learning_rate": 8.83429543400241e-06, "loss": 0.36258678436279296, "memory(GiB)": 77.28, "step": 1725, "token_acc": 0.9009743487770928, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.5535778568857246, "grad_norm": 0.036346266670361026, "learning_rate": 8.78273824790448e-06, "loss": 0.34870684146881104, "memory(GiB)": 77.28, "step": 1730, "token_acc": 0.8874141161773891, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.5551777928882845, "grad_norm": 0.03699883692335831, "learning_rate": 8.731213884332205e-06, "loss": 0.3484686851501465, "memory(GiB)": 77.28, "step": 1735, "token_acc": 0.8768292682926829, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.5567777288908443, "grad_norm": 0.034484229533255854, "learning_rate": 8.679723732600355e-06, "loss": 0.3594592809677124, "memory(GiB)": 77.28, "step": 1740, "token_acc": 0.9233852496564361, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.5583776648934042, "grad_norm": 0.03539114391370881, "learning_rate": 8.628269181101216e-06, "loss": 0.3632354736328125, "memory(GiB)": 77.28, "step": 1745, "token_acc": 0.9032677848467322, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.5599776008959642, "grad_norm": 0.037092075176258815, "learning_rate": 8.576851617267151e-06, "loss": 0.36093626022338865, "memory(GiB)": 77.28, "step": 1750, "token_acc": 0.8888888888888888, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.5599776008959642, "eval_loss": 0.6050233244895935, "eval_runtime": 160.4027, "eval_samples_per_second": 125.235, "eval_steps_per_second": 0.63, "eval_token_acc": 0.8933715689431194, "step": 1750 }, { "epoch": 0.5615775368985241, "grad_norm": 0.03548048223547666, "learning_rate": 8.525472427533156e-06, "loss": 0.3627908229827881, "memory(GiB)": 77.28, "step": 1755, "token_acc": 0.8926028719681429, "train_speed(iter/s)": 0.014398 }, { "epoch": 0.563177472901084, "grad_norm": 0.03655306695315087, "learning_rate": 8.474132997299521e-06, "loss": 0.36844007968902587, "memory(GiB)": 77.28, "step": 1760, "token_acc": 0.9042783419344098, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.5647774089036438, "grad_norm": 0.035314820603192965, "learning_rate": 8.422834710894434e-06, "loss": 0.3652467966079712, "memory(GiB)": 77.28, "step": 1765, "token_acc": 0.9266847055791779, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.5663773449062037, "grad_norm": 0.03577687703884473, "learning_rate": 8.371578951536689e-06, "loss": 0.3631904602050781, "memory(GiB)": 77.28, "step": 1770, "token_acc": 0.9114650595494332, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.5679772809087636, "grad_norm": 0.034291004661375586, "learning_rate": 8.320367101298351e-06, "loss": 0.3591639280319214, "memory(GiB)": 77.28, "step": 1775, "token_acc": 0.8908784817875727, "train_speed(iter/s)": 0.014399 }, { "epoch": 0.5695772169113236, "grad_norm": 0.03531566113853678, "learning_rate": 8.26920054106753e-06, "loss": 0.36348772048950195, "memory(GiB)": 77.28, "step": 1780, "token_acc": 0.9099979214300561, "train_speed(iter/s)": 0.014401 }, { "epoch": 0.5711771529138835, "grad_norm": 0.034798094575765916, "learning_rate": 8.218080650511107e-06, "loss": 0.35968499183654784, "memory(GiB)": 77.28, "step": 1785, "token_acc": 0.8964790217162134, "train_speed(iter/s)": 0.014402 }, { "epoch": 0.5727770889164433, "grad_norm": 0.03657750435790097, "learning_rate": 8.167008808037568e-06, "loss": 0.3568159341812134, "memory(GiB)": 77.28, "step": 1790, "token_acc": 0.905320813771518, "train_speed(iter/s)": 0.014402 }, { "epoch": 0.5743770249190032, "grad_norm": 0.034079547262996786, "learning_rate": 8.115986390759805e-06, "loss": 0.3550254821777344, "memory(GiB)": 77.28, "step": 1795, "token_acc": 0.8698279018674479, "train_speed(iter/s)": 0.014402 }, { "epoch": 0.5759769609215631, "grad_norm": 0.0358502386641742, "learning_rate": 8.065014774458004e-06, "loss": 0.3728140592575073, "memory(GiB)": 77.28, "step": 1800, "token_acc": 0.8613029680791487, "train_speed(iter/s)": 0.014403 }, { "epoch": 0.5775768969241231, "grad_norm": 0.03701314908573154, "learning_rate": 8.014095333542548e-06, "loss": 0.36500091552734376, "memory(GiB)": 77.28, "step": 1805, "token_acc": 0.8857192859642982, "train_speed(iter/s)": 0.014405 }, { "epoch": 0.579176832926683, "grad_norm": 0.03679183269002458, "learning_rate": 7.963229441016938e-06, "loss": 0.3736963987350464, "memory(GiB)": 77.28, "step": 1810, "token_acc": 0.9040948275862069, "train_speed(iter/s)": 0.014406 }, { "epoch": 0.5807767689292428, "grad_norm": 0.03681323611591806, "learning_rate": 7.912418468440794e-06, "loss": 0.35898847579956056, "memory(GiB)": 77.28, "step": 1815, "token_acc": 0.9207317073170732, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.5823767049318027, "grad_norm": 0.0357736878813674, "learning_rate": 7.861663785892857e-06, "loss": 0.361141300201416, "memory(GiB)": 77.28, "step": 1820, "token_acc": 0.9049714034315882, "train_speed(iter/s)": 0.014408 }, { "epoch": 0.5839766409343626, "grad_norm": 0.0351745332589475, "learning_rate": 7.810966761934053e-06, "loss": 0.3606626272201538, "memory(GiB)": 77.28, "step": 1825, "token_acc": 0.8948683015440508, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.5855765769369226, "grad_norm": 0.037435806949626366, "learning_rate": 7.760328763570589e-06, "loss": 0.3612012147903442, "memory(GiB)": 77.28, "step": 1830, "token_acc": 0.8970428858956495, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.5871765129394825, "grad_norm": 0.03532540907383151, "learning_rate": 7.709751156217088e-06, "loss": 0.3607369661331177, "memory(GiB)": 77.28, "step": 1835, "token_acc": 0.8445970365016263, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.5887764489420423, "grad_norm": 0.037979717396771834, "learning_rate": 7.659235303659784e-06, "loss": 0.36890883445739747, "memory(GiB)": 77.28, "step": 1840, "token_acc": 0.9026708176306735, "train_speed(iter/s)": 0.014411 }, { "epoch": 0.5903763849446022, "grad_norm": 0.036073467557711535, "learning_rate": 7.608782568019729e-06, "loss": 0.35541131496429446, "memory(GiB)": 77.28, "step": 1845, "token_acc": 0.8726491133799033, "train_speed(iter/s)": 0.014415 }, { "epoch": 0.5919763209471621, "grad_norm": 0.03583872104637772, "learning_rate": 7.558394309716088e-06, "loss": 0.36942641735076903, "memory(GiB)": 77.28, "step": 1850, "token_acc": 0.8708656432979902, "train_speed(iter/s)": 0.014415 }, { "epoch": 0.593576256949722, "grad_norm": 0.036236485857737255, "learning_rate": 7.508071887429433e-06, "loss": 0.3710246801376343, "memory(GiB)": 77.28, "step": 1855, "token_acc": 0.921398891966759, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.5951761929522819, "grad_norm": 0.03640169386223587, "learning_rate": 7.4578166580651335e-06, "loss": 0.3630064010620117, "memory(GiB)": 77.28, "step": 1860, "token_acc": 0.9057997783524196, "train_speed(iter/s)": 0.014416 }, { "epoch": 0.5967761289548418, "grad_norm": 0.03390146765654374, "learning_rate": 7.4076299767167325e-06, "loss": 0.3687079429626465, "memory(GiB)": 77.28, "step": 1865, "token_acc": 0.8828963051251489, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.5983760649574017, "grad_norm": 0.034010107936428, "learning_rate": 7.35751319662945e-06, "loss": 0.36475975513458253, "memory(GiB)": 77.28, "step": 1870, "token_acc": 0.9084216196803735, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.5999760009599616, "grad_norm": 0.03677793324767255, "learning_rate": 7.307467669163655e-06, "loss": 0.36134514808654783, "memory(GiB)": 77.28, "step": 1875, "token_acc": 0.8969276511397423, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.6015759369625215, "grad_norm": 0.03620375763366839, "learning_rate": 7.25749474375846e-06, "loss": 0.3645354747772217, "memory(GiB)": 77.28, "step": 1880, "token_acc": 0.9285598836269597, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.6031758729650813, "grad_norm": 0.03789666553237776, "learning_rate": 7.207595767895303e-06, "loss": 0.3591428756713867, "memory(GiB)": 77.28, "step": 1885, "token_acc": 0.8843816469158311, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.6047758089676413, "grad_norm": 0.03881137375316804, "learning_rate": 7.157772087061645e-06, "loss": 0.3609945297241211, "memory(GiB)": 77.28, "step": 1890, "token_acc": 0.8922645477915401, "train_speed(iter/s)": 0.014419 }, { "epoch": 0.6063757449702012, "grad_norm": 0.036554160329644855, "learning_rate": 7.108025044714661e-06, "loss": 0.35931782722473143, "memory(GiB)": 77.28, "step": 1895, "token_acc": 0.9164502825721704, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.6079756809727611, "grad_norm": 0.035159911064239865, "learning_rate": 7.058355982245038e-06, "loss": 0.35569937229156495, "memory(GiB)": 77.28, "step": 1900, "token_acc": 0.8982567884679853, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.609575616975321, "grad_norm": 0.03716807984128876, "learning_rate": 7.00876623894079e-06, "loss": 0.35586116313934324, "memory(GiB)": 77.28, "step": 1905, "token_acc": 0.8946164199192463, "train_speed(iter/s)": 0.014419 }, { "epoch": 0.6111755529778808, "grad_norm": 0.037084671519224476, "learning_rate": 6.959257151951153e-06, "loss": 0.3600043773651123, "memory(GiB)": 77.28, "step": 1910, "token_acc": 0.9071520500091929, "train_speed(iter/s)": 0.014421 }, { "epoch": 0.6127754889804408, "grad_norm": 0.03475843599873702, "learning_rate": 6.909830056250527e-06, "loss": 0.36089887619018557, "memory(GiB)": 77.28, "step": 1915, "token_acc": 0.9130308318789995, "train_speed(iter/s)": 0.014422 }, { "epoch": 0.6143754249830007, "grad_norm": 0.0383438952624416, "learning_rate": 6.860486284602479e-06, "loss": 0.35850651264190675, "memory(GiB)": 77.28, "step": 1920, "token_acc": 0.9072142546718818, "train_speed(iter/s)": 0.014423 }, { "epoch": 0.6159753609855606, "grad_norm": 0.038359374478266664, "learning_rate": 6.8112271675238154e-06, "loss": 0.3597878456115723, "memory(GiB)": 77.28, "step": 1925, "token_acc": 0.8963350785340314, "train_speed(iter/s)": 0.014425 }, { "epoch": 0.6175752969881205, "grad_norm": 0.03627563124845106, "learning_rate": 6.762054033248681e-06, "loss": 0.35578844547271726, "memory(GiB)": 77.28, "step": 1930, "token_acc": 0.8670747704416266, "train_speed(iter/s)": 0.014425 }, { "epoch": 0.6191752329906803, "grad_norm": 0.03684144075866297, "learning_rate": 6.712968207692778e-06, "loss": 0.3531275033950806, "memory(GiB)": 77.28, "step": 1935, "token_acc": 0.8941378235110695, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.6207751689932403, "grad_norm": 0.03687953126630672, "learning_rate": 6.663971014417585e-06, "loss": 0.3559092044830322, "memory(GiB)": 77.28, "step": 1940, "token_acc": 0.8794438073394495, "train_speed(iter/s)": 0.014427 }, { "epoch": 0.6223751049958002, "grad_norm": 0.03271894900825819, "learning_rate": 6.615063774594677e-06, "loss": 0.3499966859817505, "memory(GiB)": 77.28, "step": 1945, "token_acc": 0.9143808777429467, "train_speed(iter/s)": 0.014427 }, { "epoch": 0.6239750409983601, "grad_norm": 0.03670229290341502, "learning_rate": 6.566247806970119e-06, "loss": 0.3593435525894165, "memory(GiB)": 77.28, "step": 1950, "token_acc": 0.8722057635335309, "train_speed(iter/s)": 0.014427 }, { "epoch": 0.62557497700092, "grad_norm": 0.03589472224235785, "learning_rate": 6.5175244278288705e-06, "loss": 0.35672483444213865, "memory(GiB)": 77.28, "step": 1955, "token_acc": 0.8869902912621359, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.6271749130034798, "grad_norm": 0.0354115189065044, "learning_rate": 6.468894950959336e-06, "loss": 0.3563361167907715, "memory(GiB)": 77.28, "step": 1960, "token_acc": 0.872582685703958, "train_speed(iter/s)": 0.014427 }, { "epoch": 0.6287748490060397, "grad_norm": 0.03855982219631724, "learning_rate": 6.420360687617897e-06, "loss": 0.35960986614227297, "memory(GiB)": 77.28, "step": 1965, "token_acc": 0.9085308941571775, "train_speed(iter/s)": 0.014429 }, { "epoch": 0.6303747850085997, "grad_norm": 0.0363939489470217, "learning_rate": 6.3719229464935915e-06, "loss": 0.36258764266967775, "memory(GiB)": 77.28, "step": 1970, "token_acc": 0.8915779283639884, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.6319747210111596, "grad_norm": 0.03622652969014867, "learning_rate": 6.323583033672799e-06, "loss": 0.35306107997894287, "memory(GiB)": 77.28, "step": 1975, "token_acc": 0.892795055051188, "train_speed(iter/s)": 0.014429 }, { "epoch": 0.6335746570137194, "grad_norm": 0.0359741868188003, "learning_rate": 6.275342252604044e-06, "loss": 0.3589993715286255, "memory(GiB)": 77.28, "step": 1980, "token_acc": 0.8946890603722197, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.6351745930162793, "grad_norm": 0.03712206781639858, "learning_rate": 6.22720190406283e-06, "loss": 0.3716681241989136, "memory(GiB)": 77.28, "step": 1985, "token_acc": 0.9078609119199026, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.6367745290188392, "grad_norm": 0.0356723794869841, "learning_rate": 6.179163286116581e-06, "loss": 0.35133976936340333, "memory(GiB)": 77.28, "step": 1990, "token_acc": 0.9327153762268267, "train_speed(iter/s)": 0.014431 }, { "epoch": 0.6383744650213992, "grad_norm": 0.03536609511126974, "learning_rate": 6.13122769408963e-06, "loss": 0.35833446979522704, "memory(GiB)": 77.28, "step": 1995, "token_acc": 0.882003614768913, "train_speed(iter/s)": 0.014432 }, { "epoch": 0.6399744010239591, "grad_norm": 0.03362321620964987, "learning_rate": 6.083396420528298e-06, "loss": 0.3585667610168457, "memory(GiB)": 77.28, "step": 2000, "token_acc": 0.9170406167299505, "train_speed(iter/s)": 0.014433 }, { "epoch": 0.6399744010239591, "eval_loss": 0.6020672917366028, "eval_runtime": 164.3521, "eval_samples_per_second": 122.225, "eval_steps_per_second": 0.615, "eval_token_acc": 0.8943001355471165, "step": 2000 }, { "epoch": 0.6415743370265189, "grad_norm": 0.03472639275538625, "learning_rate": 6.0356707551660434e-06, "loss": 0.36132421493530276, "memory(GiB)": 77.28, "step": 2005, "token_acc": 0.915687276443536, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.6431742730290788, "grad_norm": 0.0354392362366712, "learning_rate": 5.988051984888668e-06, "loss": 0.35641605854034425, "memory(GiB)": 77.28, "step": 2010, "token_acc": 0.9036523929471033, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.6447742090316387, "grad_norm": 0.036793660802490545, "learning_rate": 5.940541393699646e-06, "loss": 0.35499589443206786, "memory(GiB)": 77.28, "step": 2015, "token_acc": 0.9017251405311106, "train_speed(iter/s)": 0.014413 }, { "epoch": 0.6463741450341987, "grad_norm": 0.0356096679234017, "learning_rate": 5.893140262685469e-06, "loss": 0.3537860870361328, "memory(GiB)": 77.28, "step": 2020, "token_acc": 0.9089422028353326, "train_speed(iter/s)": 0.014415 }, { "epoch": 0.6479740810367586, "grad_norm": 0.038785732749065785, "learning_rate": 5.845849869981137e-06, "loss": 0.36054995059967043, "memory(GiB)": 77.28, "step": 2025, "token_acc": 0.8981469809655868, "train_speed(iter/s)": 0.014417 }, { "epoch": 0.6495740170393184, "grad_norm": 0.03604630935256211, "learning_rate": 5.7986714907356614e-06, "loss": 0.3670691728591919, "memory(GiB)": 77.28, "step": 2030, "token_acc": 0.9045626349892009, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.6511739530418783, "grad_norm": 0.03791812035130847, "learning_rate": 5.751606397077703e-06, "loss": 0.35528743267059326, "memory(GiB)": 77.28, "step": 2035, "token_acc": 0.9075596816976127, "train_speed(iter/s)": 0.014418 }, { "epoch": 0.6527738890444382, "grad_norm": 0.035478901481675915, "learning_rate": 5.704655858081268e-06, "loss": 0.34533185958862306, "memory(GiB)": 77.28, "step": 2040, "token_acc": 0.9188615123194562, "train_speed(iter/s)": 0.01442 }, { "epoch": 0.6543738250469981, "grad_norm": 0.03751046597155776, "learning_rate": 5.6578211397314765e-06, "loss": 0.3631927967071533, "memory(GiB)": 77.28, "step": 2045, "token_acc": 0.8758772533370028, "train_speed(iter/s)": 0.014419 }, { "epoch": 0.6559737610495581, "grad_norm": 0.035283669234402425, "learning_rate": 5.611103504890444e-06, "loss": 0.3572983264923096, "memory(GiB)": 77.28, "step": 2050, "token_acc": 0.894204990719736, "train_speed(iter/s)": 0.014419 }, { "epoch": 0.6575736970521179, "grad_norm": 0.035514482756984364, "learning_rate": 5.564504213263205e-06, "loss": 0.34580564498901367, "memory(GiB)": 77.28, "step": 2055, "token_acc": 0.8778079008520526, "train_speed(iter/s)": 0.01442 }, { "epoch": 0.6591736330546778, "grad_norm": 0.03510405358704929, "learning_rate": 5.5180245213637785e-06, "loss": 0.35724987983703616, "memory(GiB)": 77.28, "step": 2060, "token_acc": 0.9040819075845345, "train_speed(iter/s)": 0.014421 }, { "epoch": 0.6607735690572377, "grad_norm": 0.03558952127633272, "learning_rate": 5.4716656824812505e-06, "loss": 0.3560892343521118, "memory(GiB)": 77.28, "step": 2065, "token_acc": 0.9103578154425612, "train_speed(iter/s)": 0.014421 }, { "epoch": 0.6623735050597976, "grad_norm": 0.0352867930448959, "learning_rate": 5.425428946646016e-06, "loss": 0.3594446897506714, "memory(GiB)": 77.28, "step": 2070, "token_acc": 0.9159539473684211, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.6639734410623576, "grad_norm": 0.035189795121078615, "learning_rate": 5.379315560596038e-06, "loss": 0.3580685377120972, "memory(GiB)": 77.28, "step": 2075, "token_acc": 0.872678750138997, "train_speed(iter/s)": 0.014425 }, { "epoch": 0.6655733770649174, "grad_norm": 0.03660603391888094, "learning_rate": 5.333326767743263e-06, "loss": 0.35906505584716797, "memory(GiB)": 77.28, "step": 2080, "token_acc": 0.8538508186779866, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.6671733130674773, "grad_norm": 0.0357681196465874, "learning_rate": 5.287463808140069e-06, "loss": 0.3485325813293457, "memory(GiB)": 77.28, "step": 2085, "token_acc": 0.8672191853288662, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.6687732490700372, "grad_norm": 0.03662434567811883, "learning_rate": 5.241727918445836e-06, "loss": 0.3556757688522339, "memory(GiB)": 77.28, "step": 2090, "token_acc": 0.915863277826468, "train_speed(iter/s)": 0.014427 }, { "epoch": 0.6703731850725971, "grad_norm": 0.036729664500264415, "learning_rate": 5.1961203318936116e-06, "loss": 0.3540231466293335, "memory(GiB)": 77.28, "step": 2095, "token_acc": 0.8912253374870197, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.6719731210751569, "grad_norm": 0.03638060418817606, "learning_rate": 5.1506422782568345e-06, "loss": 0.36181719303131105, "memory(GiB)": 77.28, "step": 2100, "token_acc": 0.9020928899082569, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.6735730570777169, "grad_norm": 0.035195041704010034, "learning_rate": 5.105294983816203e-06, "loss": 0.35322787761688235, "memory(GiB)": 77.28, "step": 2105, "token_acc": 0.8900983606557377, "train_speed(iter/s)": 0.014429 }, { "epoch": 0.6751729930802768, "grad_norm": 0.03617857368359474, "learning_rate": 5.060079671326577e-06, "loss": 0.355142879486084, "memory(GiB)": 77.28, "step": 2110, "token_acc": 0.8857596191987307, "train_speed(iter/s)": 0.014429 }, { "epoch": 0.6767729290828367, "grad_norm": 0.035676130230209005, "learning_rate": 5.014997559984045e-06, "loss": 0.35041203498840334, "memory(GiB)": 77.28, "step": 2115, "token_acc": 0.8745164003364172, "train_speed(iter/s)": 0.014431 }, { "epoch": 0.6783728650853966, "grad_norm": 0.03733616225344439, "learning_rate": 4.970049865393009e-06, "loss": 0.35726475715637207, "memory(GiB)": 77.28, "step": 2120, "token_acc": 0.8842804428044281, "train_speed(iter/s)": 0.014432 }, { "epoch": 0.6799728010879564, "grad_norm": 0.03652134614213375, "learning_rate": 4.925237799533445e-06, "loss": 0.3587599039077759, "memory(GiB)": 77.28, "step": 2125, "token_acc": 0.9209918373633144, "train_speed(iter/s)": 0.014433 }, { "epoch": 0.6815727370905164, "grad_norm": 0.03713234057671444, "learning_rate": 4.880562570728188e-06, "loss": 0.3505564212799072, "memory(GiB)": 77.28, "step": 2130, "token_acc": 0.9003831417624522, "train_speed(iter/s)": 0.014434 }, { "epoch": 0.6831726730930763, "grad_norm": 0.03570712641296637, "learning_rate": 4.836025383610382e-06, "loss": 0.35914387702941897, "memory(GiB)": 77.28, "step": 2135, "token_acc": 0.8888649580012923, "train_speed(iter/s)": 0.014434 }, { "epoch": 0.6847726090956362, "grad_norm": 0.034457774830109436, "learning_rate": 4.791627439090975e-06, "loss": 0.35318760871887206, "memory(GiB)": 77.28, "step": 2140, "token_acc": 0.9001070281840885, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.6863725450981961, "grad_norm": 0.03671839147293295, "learning_rate": 4.74736993432634e-06, "loss": 0.3529956579208374, "memory(GiB)": 77.28, "step": 2145, "token_acc": 0.909256801592568, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.6879724811007559, "grad_norm": 0.03474714702977324, "learning_rate": 4.703254062686017e-06, "loss": 0.3566461086273193, "memory(GiB)": 77.28, "step": 2150, "token_acc": 0.9030673019654556, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.6895724171033158, "grad_norm": 0.035790167210903036, "learning_rate": 4.6592810137205e-06, "loss": 0.35962681770324706, "memory(GiB)": 77.28, "step": 2155, "token_acc": 0.9103856266432954, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.6911723531058758, "grad_norm": 0.03487739858408488, "learning_rate": 4.615451973129196e-06, "loss": 0.35558667182922366, "memory(GiB)": 77.28, "step": 2160, "token_acc": 0.8970679975046787, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.6927722891084357, "grad_norm": 0.03853196821530562, "learning_rate": 4.571768122728421e-06, "loss": 0.35672924518585203, "memory(GiB)": 77.28, "step": 2165, "token_acc": 0.8965443686006825, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.6943722251109956, "grad_norm": 0.0373570970369309, "learning_rate": 4.528230640419562e-06, "loss": 0.3587866067886353, "memory(GiB)": 77.28, "step": 2170, "token_acc": 0.8806665033080128, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.6959721611135554, "grad_norm": 0.03604883184517471, "learning_rate": 4.4848407001572945e-06, "loss": 0.3512024164199829, "memory(GiB)": 77.28, "step": 2175, "token_acc": 0.8832857595940374, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.6975720971161153, "grad_norm": 0.03504294349528598, "learning_rate": 4.441599471917946e-06, "loss": 0.34823672771453856, "memory(GiB)": 77.28, "step": 2180, "token_acc": 0.8825027861805445, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.6991720331186753, "grad_norm": 0.035895231783871086, "learning_rate": 4.398508121667925e-06, "loss": 0.34151611328125, "memory(GiB)": 77.28, "step": 2185, "token_acc": 0.879415347137637, "train_speed(iter/s)": 0.01444 }, { "epoch": 0.7007719691212352, "grad_norm": 0.03711717710215307, "learning_rate": 4.355567811332311e-06, "loss": 0.35381360054016114, "memory(GiB)": 77.28, "step": 2190, "token_acc": 0.8886005190656818, "train_speed(iter/s)": 0.01444 }, { "epoch": 0.702371905123795, "grad_norm": 0.03875724771094195, "learning_rate": 4.312779698763493e-06, "loss": 0.35048136711120603, "memory(GiB)": 77.28, "step": 2195, "token_acc": 0.9109351806036615, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.7039718411263549, "grad_norm": 0.037222751841702796, "learning_rate": 4.270144937709981e-06, "loss": 0.3498215913772583, "memory(GiB)": 77.28, "step": 2200, "token_acc": 0.8952087007642563, "train_speed(iter/s)": 0.014441 }, { "epoch": 0.7055717771289148, "grad_norm": 0.03655432132006705, "learning_rate": 4.227664677785264e-06, "loss": 0.3591599702835083, "memory(GiB)": 77.28, "step": 2205, "token_acc": 0.8989089904709294, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.7071717131314748, "grad_norm": 0.03539648204157617, "learning_rate": 4.1853400644368395e-06, "loss": 0.3569194316864014, "memory(GiB)": 77.28, "step": 2210, "token_acc": 0.9273023393544566, "train_speed(iter/s)": 0.014441 }, { "epoch": 0.7087716491340347, "grad_norm": 0.037916985081009914, "learning_rate": 4.143172238915302e-06, "loss": 0.35884747505187986, "memory(GiB)": 77.28, "step": 2215, "token_acc": 0.8967870817379724, "train_speed(iter/s)": 0.014441 }, { "epoch": 0.7103715851365945, "grad_norm": 0.03801135802626227, "learning_rate": 4.101162338243595e-06, "loss": 0.357472562789917, "memory(GiB)": 77.28, "step": 2220, "token_acc": 0.8912637476654908, "train_speed(iter/s)": 0.01444 }, { "epoch": 0.7119715211391544, "grad_norm": 0.0387640824372489, "learning_rate": 4.059311495186338e-06, "loss": 0.3565319538116455, "memory(GiB)": 77.28, "step": 2225, "token_acc": 0.8952764555108019, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.7135714571417143, "grad_norm": 0.03926080873946399, "learning_rate": 4.017620838219276e-06, "loss": 0.3521524667739868, "memory(GiB)": 77.28, "step": 2230, "token_acc": 0.8861508810572687, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.7151713931442742, "grad_norm": 0.03756015577315046, "learning_rate": 3.9760914914988716e-06, "loss": 0.3639491558074951, "memory(GiB)": 77.28, "step": 2235, "token_acc": 0.8872466216216216, "train_speed(iter/s)": 0.01444 }, { "epoch": 0.7167713291468342, "grad_norm": 0.036199547656564544, "learning_rate": 3.93472457483197e-06, "loss": 0.3500187635421753, "memory(GiB)": 77.28, "step": 2240, "token_acc": 0.8480381530457403, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.718371265149394, "grad_norm": 0.03683592500962426, "learning_rate": 3.893521203645618e-06, "loss": 0.35996718406677247, "memory(GiB)": 77.28, "step": 2245, "token_acc": 0.9068561551757249, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.7199712011519539, "grad_norm": 0.03450560655549409, "learning_rate": 3.852482488956992e-06, "loss": 0.35292108058929444, "memory(GiB)": 77.28, "step": 2250, "token_acc": 0.8864724387908631, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.7199712011519539, "eval_loss": 0.6000239849090576, "eval_runtime": 169.3665, "eval_samples_per_second": 118.607, "eval_steps_per_second": 0.596, "eval_token_acc": 0.8950660718419391, "step": 2250 }, { "epoch": 0.7215711371545138, "grad_norm": 0.036073313606157474, "learning_rate": 3.8116095373434204e-06, "loss": 0.35668814182281494, "memory(GiB)": 77.28, "step": 2255, "token_acc": 0.9087738494153047, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.7231710731570737, "grad_norm": 0.036174459675283856, "learning_rate": 3.7709034509125706e-06, "loss": 0.35418474674224854, "memory(GiB)": 77.28, "step": 2260, "token_acc": 0.8707964601769912, "train_speed(iter/s)": 0.014425 }, { "epoch": 0.7247710091596337, "grad_norm": 0.03567475035555587, "learning_rate": 3.7303653272727057e-06, "loss": 0.357358717918396, "memory(GiB)": 77.28, "step": 2265, "token_acc": 0.9060252913463923, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.7263709451621935, "grad_norm": 0.035715034790481305, "learning_rate": 3.689996259503116e-06, "loss": 0.3499811887741089, "memory(GiB)": 77.28, "step": 2270, "token_acc": 0.9101883788803397, "train_speed(iter/s)": 0.014427 }, { "epoch": 0.7279708811647534, "grad_norm": 0.03612086417148584, "learning_rate": 3.6497973361246153e-06, "loss": 0.3532618284225464, "memory(GiB)": 77.28, "step": 2275, "token_acc": 0.8859261596718208, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.7295708171673133, "grad_norm": 0.037097792645410424, "learning_rate": 3.609769641070221e-06, "loss": 0.34888529777526855, "memory(GiB)": 77.28, "step": 2280, "token_acc": 0.9103887168902649, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.7311707531698732, "grad_norm": 0.03547959936969023, "learning_rate": 3.569914253655896e-06, "loss": 0.35082759857177737, "memory(GiB)": 77.28, "step": 2285, "token_acc": 0.9120581352383298, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.7327706891724332, "grad_norm": 0.03706499179009722, "learning_rate": 3.530232248551466e-06, "loss": 0.36017541885375975, "memory(GiB)": 77.28, "step": 2290, "token_acc": 0.8559717087285003, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.734370625174993, "grad_norm": 0.03739569626098127, "learning_rate": 3.4907246957516416e-06, "loss": 0.3543466329574585, "memory(GiB)": 77.28, "step": 2295, "token_acc": 0.9116985376827896, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.7359705611775529, "grad_norm": 0.03646822377433634, "learning_rate": 3.4513926605471504e-06, "loss": 0.3665087461471558, "memory(GiB)": 77.28, "step": 2300, "token_acc": 0.8735919899874843, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.7375704971801128, "grad_norm": 0.03643726700416454, "learning_rate": 3.412237203496036e-06, "loss": 0.35367345809936523, "memory(GiB)": 77.28, "step": 2305, "token_acc": 0.8936760355029586, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.7391704331826727, "grad_norm": 0.03681350508730061, "learning_rate": 3.3732593803950354e-06, "loss": 0.3540062189102173, "memory(GiB)": 77.28, "step": 2310, "token_acc": 0.9164918170373478, "train_speed(iter/s)": 0.014431 }, { "epoch": 0.7407703691852325, "grad_norm": 0.03619863113544937, "learning_rate": 3.3344602422511343e-06, "loss": 0.3489154577255249, "memory(GiB)": 77.28, "step": 2315, "token_acc": 0.9134242883611251, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.7423703051877925, "grad_norm": 0.03739761580100826, "learning_rate": 3.2958408352532055e-06, "loss": 0.34918310642242434, "memory(GiB)": 77.28, "step": 2320, "token_acc": 0.8605150214592274, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.7439702411903524, "grad_norm": 0.035263909838795474, "learning_rate": 3.257402200743821e-06, "loss": 0.3549443960189819, "memory(GiB)": 77.28, "step": 2325, "token_acc": 0.8859731923730414, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.7455701771929123, "grad_norm": 0.038532084755221324, "learning_rate": 3.2191453751911505e-06, "loss": 0.362837553024292, "memory(GiB)": 77.28, "step": 2330, "token_acc": 0.9077399380804954, "train_speed(iter/s)": 0.014429 }, { "epoch": 0.7471701131954722, "grad_norm": 0.03622027927597768, "learning_rate": 3.1810713901610367e-06, "loss": 0.3503484964370728, "memory(GiB)": 77.28, "step": 2335, "token_acc": 0.8994184794314021, "train_speed(iter/s)": 0.014431 }, { "epoch": 0.748770049198032, "grad_norm": 0.03656899746448185, "learning_rate": 3.1431812722891598e-06, "loss": 0.3492277145385742, "memory(GiB)": 77.28, "step": 2340, "token_acc": 0.884628359383785, "train_speed(iter/s)": 0.014432 }, { "epoch": 0.750369985200592, "grad_norm": 0.03972433850747652, "learning_rate": 3.1054760432533626e-06, "loss": 0.3659966230392456, "memory(GiB)": 77.28, "step": 2345, "token_acc": 0.9043888952885613, "train_speed(iter/s)": 0.014433 }, { "epoch": 0.7519699212031519, "grad_norm": 0.037936615779197595, "learning_rate": 3.0679567197461135e-06, "loss": 0.35586345195770264, "memory(GiB)": 77.28, "step": 2350, "token_acc": 0.8697364435019691, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.7535698572057118, "grad_norm": 0.038657371745029284, "learning_rate": 3.0306243134470668e-06, "loss": 0.3520052909851074, "memory(GiB)": 77.28, "step": 2355, "token_acc": 0.9114033196809658, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.7551697932082717, "grad_norm": 0.03759781411569022, "learning_rate": 2.993479830995815e-06, "loss": 0.359484601020813, "memory(GiB)": 77.28, "step": 2360, "token_acc": 0.8960244648318043, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.7567697292108315, "grad_norm": 0.0361038891255062, "learning_rate": 2.9565242739647115e-06, "loss": 0.3532958269119263, "memory(GiB)": 77.28, "step": 2365, "token_acc": 0.9104216388225935, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7583696652133914, "grad_norm": 0.03903281093821544, "learning_rate": 2.919758638831893e-06, "loss": 0.3664171934127808, "memory(GiB)": 77.28, "step": 2370, "token_acc": 0.8849834016793595, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.7599696012159514, "grad_norm": 0.03883483895946455, "learning_rate": 2.8831839169543998e-06, "loss": 0.3517657995223999, "memory(GiB)": 77.28, "step": 2375, "token_acc": 0.903478904515174, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.7615695372185113, "grad_norm": 0.03569351570239587, "learning_rate": 2.84680109454143e-06, "loss": 0.35557854175567627, "memory(GiB)": 77.28, "step": 2380, "token_acc": 0.8889802631578947, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.7631694732210712, "grad_norm": 0.038188596422853896, "learning_rate": 2.810611152627777e-06, "loss": 0.3597451686859131, "memory(GiB)": 77.28, "step": 2385, "token_acc": 0.8827844799478317, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.764769409223631, "grad_norm": 0.03572439909987441, "learning_rate": 2.774615067047346e-06, "loss": 0.34901888370513917, "memory(GiB)": 77.28, "step": 2390, "token_acc": 0.8962715798636298, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.7663693452261909, "grad_norm": 0.03686595519302669, "learning_rate": 2.738813808406866e-06, "loss": 0.3472025156021118, "memory(GiB)": 77.28, "step": 2395, "token_acc": 0.9280912364945978, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.7679692812287509, "grad_norm": 0.03715332128853523, "learning_rate": 2.7032083420597e-06, "loss": 0.34778246879577634, "memory(GiB)": 77.28, "step": 2400, "token_acc": 0.9090736161308731, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7695692172313108, "grad_norm": 0.03817279860399444, "learning_rate": 2.667799628079829e-06, "loss": 0.35284740924835206, "memory(GiB)": 77.28, "step": 2405, "token_acc": 0.9096980255516841, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.7711691532338707, "grad_norm": 0.036302722459302404, "learning_rate": 2.6325886212359496e-06, "loss": 0.34749345779418944, "memory(GiB)": 77.28, "step": 2410, "token_acc": 0.9061160009027308, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7727690892364305, "grad_norm": 0.038102620992520056, "learning_rate": 2.5975762709657506e-06, "loss": 0.3531970739364624, "memory(GiB)": 77.28, "step": 2415, "token_acc": 0.8826328310864393, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.7743690252389904, "grad_norm": 0.03445225499859096, "learning_rate": 2.5627635213502832e-06, "loss": 0.3450269937515259, "memory(GiB)": 77.28, "step": 2420, "token_acc": 0.9214078466002271, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7759689612415503, "grad_norm": 0.03854094961415296, "learning_rate": 2.528151311088537e-06, "loss": 0.3500360012054443, "memory(GiB)": 77.28, "step": 2425, "token_acc": 0.8813531353135313, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.7775688972441103, "grad_norm": 0.03576826677739602, "learning_rate": 2.4937405734720964e-06, "loss": 0.3535548210144043, "memory(GiB)": 77.28, "step": 2430, "token_acc": 0.8837966985230234, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.7791688332466701, "grad_norm": 0.03767939273785534, "learning_rate": 2.459532236360007e-06, "loss": 0.34597823619842527, "memory(GiB)": 77.28, "step": 2435, "token_acc": 0.8772578890097933, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.78076876924923, "grad_norm": 0.036004849313210435, "learning_rate": 2.4255272221537295e-06, "loss": 0.34565279483795164, "memory(GiB)": 77.28, "step": 2440, "token_acc": 0.8803288090231314, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.7823687052517899, "grad_norm": 0.03905322522036309, "learning_rate": 2.391726447772279e-06, "loss": 0.36594700813293457, "memory(GiB)": 77.28, "step": 2445, "token_acc": 0.8882537089968695, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.7839686412543498, "grad_norm": 0.03730014372598652, "learning_rate": 2.3581308246275103e-06, "loss": 0.3568562507629395, "memory(GiB)": 77.28, "step": 2450, "token_acc": 0.9234494610217153, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7855685772569098, "grad_norm": 0.03868286134685204, "learning_rate": 2.324741258599521e-06, "loss": 0.35208520889282224, "memory(GiB)": 77.28, "step": 2455, "token_acc": 0.8954419212546969, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.7871685132594696, "grad_norm": 0.03733286652687736, "learning_rate": 2.29155865001225e-06, "loss": 0.34863691329956054, "memory(GiB)": 77.28, "step": 2460, "token_acc": 0.9080920564216778, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.7887684492620295, "grad_norm": 0.03699225546025446, "learning_rate": 2.2585838936091753e-06, "loss": 0.34832584857940674, "memory(GiB)": 77.28, "step": 2465, "token_acc": 0.9085607651038022, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7903683852645894, "grad_norm": 0.03946439413106149, "learning_rate": 2.225817878529214e-06, "loss": 0.35381317138671875, "memory(GiB)": 77.28, "step": 2470, "token_acc": 0.8874495646634105, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7919683212671493, "grad_norm": 0.0392896601295871, "learning_rate": 2.1932614882827196e-06, "loss": 0.35070300102233887, "memory(GiB)": 77.28, "step": 2475, "token_acc": 0.9032003160806006, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.7935682572697093, "grad_norm": 0.03806309185869093, "learning_rate": 2.160915600727688e-06, "loss": 0.34960522651672366, "memory(GiB)": 77.28, "step": 2480, "token_acc": 0.9318849089841457, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7951681932722691, "grad_norm": 0.037966940284694224, "learning_rate": 2.1287810880460636e-06, "loss": 0.3503120422363281, "memory(GiB)": 77.28, "step": 2485, "token_acc": 0.9095194647201946, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.796768129274829, "grad_norm": 0.036666564553806735, "learning_rate": 2.0968588167202265e-06, "loss": 0.3496053695678711, "memory(GiB)": 77.28, "step": 2490, "token_acc": 0.9117557251908397, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.7983680652773889, "grad_norm": 0.03639630529287135, "learning_rate": 2.0651496475096455e-06, "loss": 0.34689855575561523, "memory(GiB)": 77.28, "step": 2495, "token_acc": 0.8635149023638232, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7999680012799488, "grad_norm": 0.038547849012489435, "learning_rate": 2.03365443542764e-06, "loss": 0.35553674697875975, "memory(GiB)": 77.28, "step": 2500, "token_acc": 0.9040584668014305, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.7999680012799488, "eval_loss": 0.5981466770172119, "eval_runtime": 165.8098, "eval_samples_per_second": 121.151, "eval_steps_per_second": 0.609, "eval_token_acc": 0.8956903623836094, "step": 2500 }, { "epoch": 0.8015679372825087, "grad_norm": 0.03758764678842079, "learning_rate": 2.0023740297183536e-06, "loss": 0.3542864084243774, "memory(GiB)": 77.28, "step": 2505, "token_acc": 0.9013850415512465, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.8031678732850686, "grad_norm": 0.03968783826575613, "learning_rate": 1.971309273833828e-06, "loss": 0.35315916538238523, "memory(GiB)": 77.28, "step": 2510, "token_acc": 0.8885698905436928, "train_speed(iter/s)": 0.014423 }, { "epoch": 0.8047678092876285, "grad_norm": 0.03665700191714146, "learning_rate": 1.940461005411288e-06, "loss": 0.35584971904754636, "memory(GiB)": 77.28, "step": 2515, "token_acc": 0.9148000549677064, "train_speed(iter/s)": 0.014422 }, { "epoch": 0.8063677452901884, "grad_norm": 0.03809565053490125, "learning_rate": 1.9098300562505266e-06, "loss": 0.352116060256958, "memory(GiB)": 77.28, "step": 2520, "token_acc": 0.9041350472355583, "train_speed(iter/s)": 0.014423 }, { "epoch": 0.8079676812927483, "grad_norm": 0.037082731941368616, "learning_rate": 1.8794172522915022e-06, "loss": 0.3564736843109131, "memory(GiB)": 77.28, "step": 2525, "token_acc": 0.9011320754716982, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.8095676172953082, "grad_norm": 0.03536758455742058, "learning_rate": 1.849223413592046e-06, "loss": 0.3573369026184082, "memory(GiB)": 77.28, "step": 2530, "token_acc": 0.8907506702412868, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.811167553297868, "grad_norm": 0.0385223348984184, "learning_rate": 1.8192493543057676e-06, "loss": 0.35864074230194093, "memory(GiB)": 77.28, "step": 2535, "token_acc": 0.892925430210325, "train_speed(iter/s)": 0.014424 }, { "epoch": 0.812767489300428, "grad_norm": 0.039588078774316006, "learning_rate": 1.7894958826600884e-06, "loss": 0.355703067779541, "memory(GiB)": 77.28, "step": 2540, "token_acc": 0.9034001743679163, "train_speed(iter/s)": 0.014426 }, { "epoch": 0.8143674253029879, "grad_norm": 0.037317655071007885, "learning_rate": 1.7599638009344566e-06, "loss": 0.35617387294769287, "memory(GiB)": 77.28, "step": 2545, "token_acc": 0.8941311852704258, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.8159673613055478, "grad_norm": 0.03777407929611349, "learning_rate": 1.730653905438714e-06, "loss": 0.3580180168151855, "memory(GiB)": 77.28, "step": 2550, "token_acc": 0.8959574468085106, "train_speed(iter/s)": 0.014428 }, { "epoch": 0.8175672973081076, "grad_norm": 0.035142023960295414, "learning_rate": 1.701566986491614e-06, "loss": 0.34624552726745605, "memory(GiB)": 77.28, "step": 2555, "token_acc": 0.9051190699418714, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.8191672333106675, "grad_norm": 0.037714565360549845, "learning_rate": 1.672703828399529e-06, "loss": 0.35172338485717775, "memory(GiB)": 77.28, "step": 2560, "token_acc": 0.9457239778610962, "train_speed(iter/s)": 0.014431 }, { "epoch": 0.8207671693132275, "grad_norm": 0.036887384415936156, "learning_rate": 1.6440652094352838e-06, "loss": 0.3510489225387573, "memory(GiB)": 77.28, "step": 2565, "token_acc": 0.8979176452168467, "train_speed(iter/s)": 0.014432 }, { "epoch": 0.8223671053157874, "grad_norm": 0.03561026944223861, "learning_rate": 1.6156519018171856e-06, "loss": 0.35076611042022704, "memory(GiB)": 77.28, "step": 2570, "token_acc": 0.9080580318126201, "train_speed(iter/s)": 0.014432 }, { "epoch": 0.8239670413183473, "grad_norm": 0.03630258451216745, "learning_rate": 1.587464671688187e-06, "loss": 0.3570599317550659, "memory(GiB)": 77.28, "step": 2575, "token_acc": 0.9031298682906104, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.8255669773209071, "grad_norm": 0.038192907527631666, "learning_rate": 1.5595042790952442e-06, "loss": 0.3558261632919312, "memory(GiB)": 77.28, "step": 2580, "token_acc": 0.8623452294246177, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.827166913323467, "grad_norm": 0.036755690198104415, "learning_rate": 1.5317714779688076e-06, "loss": 0.3490342140197754, "memory(GiB)": 77.28, "step": 2585, "token_acc": 0.8992491314580298, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.828766849326027, "grad_norm": 0.03779058071089615, "learning_rate": 1.5042670161024975e-06, "loss": 0.3526420831680298, "memory(GiB)": 77.28, "step": 2590, "token_acc": 0.9187872225230103, "train_speed(iter/s)": 0.014435 }, { "epoch": 0.8303667853285869, "grad_norm": 0.0378490380899306, "learning_rate": 1.4769916351329495e-06, "loss": 0.3495866060256958, "memory(GiB)": 77.28, "step": 2595, "token_acc": 0.9153539571076106, "train_speed(iter/s)": 0.014437 }, { "epoch": 0.8319667213311468, "grad_norm": 0.038059208729720205, "learning_rate": 1.4499460705198e-06, "loss": 0.3585029602050781, "memory(GiB)": 77.28, "step": 2600, "token_acc": 0.8617424242424242, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.8335666573337066, "grad_norm": 0.036305573904208764, "learning_rate": 1.4231310515258745e-06, "loss": 0.35045819282531737, "memory(GiB)": 77.28, "step": 2605, "token_acc": 0.8978984563883207, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.8351665933362665, "grad_norm": 0.03724795292187118, "learning_rate": 1.396547301197504e-06, "loss": 0.3469654083251953, "memory(GiB)": 77.28, "step": 2610, "token_acc": 0.8848700967906266, "train_speed(iter/s)": 0.014438 }, { "epoch": 0.8367665293388264, "grad_norm": 0.03937123467027512, "learning_rate": 1.3701955363450447e-06, "loss": 0.3473918676376343, "memory(GiB)": 77.28, "step": 2615, "token_acc": 0.8838246702870443, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.8383664653413864, "grad_norm": 0.03667494649233471, "learning_rate": 1.3440764675235384e-06, "loss": 0.3473004579544067, "memory(GiB)": 77.28, "step": 2620, "token_acc": 0.8983539094650206, "train_speed(iter/s)": 0.014441 }, { "epoch": 0.8399664013439463, "grad_norm": 0.03740155571021143, "learning_rate": 1.3181907990135624e-06, "loss": 0.3439753532409668, "memory(GiB)": 77.28, "step": 2625, "token_acc": 0.8991910392034848, "train_speed(iter/s)": 0.014441 }, { "epoch": 0.8415663373465061, "grad_norm": 0.037121105337531816, "learning_rate": 1.2925392288022299e-06, "loss": 0.35173735618591306, "memory(GiB)": 77.28, "step": 2630, "token_acc": 0.9013660104459622, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.843166273349066, "grad_norm": 0.036589412214925045, "learning_rate": 1.267122448564374e-06, "loss": 0.35824949741363527, "memory(GiB)": 77.28, "step": 2635, "token_acc": 0.8826762498678786, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.8447662093516259, "grad_norm": 0.037390795588795094, "learning_rate": 1.2419411436439021e-06, "loss": 0.3420265197753906, "memory(GiB)": 77.28, "step": 2640, "token_acc": 0.8637934539540557, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.8463661453541859, "grad_norm": 0.0392903978609431, "learning_rate": 1.2169959930353049e-06, "loss": 0.35427193641662597, "memory(GiB)": 77.28, "step": 2645, "token_acc": 0.9137991573033708, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.8479660813567458, "grad_norm": 0.03621632863378309, "learning_rate": 1.1922876693653584e-06, "loss": 0.35888056755065917, "memory(GiB)": 77.28, "step": 2650, "token_acc": 0.911003861003861, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.8495660173593056, "grad_norm": 0.03660745676792027, "learning_rate": 1.1678168388749788e-06, "loss": 0.35086932182312014, "memory(GiB)": 77.28, "step": 2655, "token_acc": 0.9206992112555958, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.8511659533618655, "grad_norm": 0.040156354355006064, "learning_rate": 1.1435841614012666e-06, "loss": 0.35667102336883544, "memory(GiB)": 77.28, "step": 2660, "token_acc": 0.8772329246935201, "train_speed(iter/s)": 0.014445 }, { "epoch": 0.8527658893644254, "grad_norm": 0.03671656629027542, "learning_rate": 1.1195902903597023e-06, "loss": 0.34930713176727296, "memory(GiB)": 77.28, "step": 2665, "token_acc": 0.9153739612188365, "train_speed(iter/s)": 0.014445 }, { "epoch": 0.8543658253669854, "grad_norm": 0.0353334980673887, "learning_rate": 1.0958358727265438e-06, "loss": 0.3469362497329712, "memory(GiB)": 77.28, "step": 2670, "token_acc": 0.8836606950140298, "train_speed(iter/s)": 0.014445 }, { "epoch": 0.8559657613695452, "grad_norm": 0.03791549498121718, "learning_rate": 1.0723215490213635e-06, "loss": 0.34251036643981936, "memory(GiB)": 77.28, "step": 2675, "token_acc": 0.8721257625527921, "train_speed(iter/s)": 0.014444 }, { "epoch": 0.8575656973721051, "grad_norm": 0.039436468828163096, "learning_rate": 1.0490479532897946e-06, "loss": 0.36394264698028567, "memory(GiB)": 77.28, "step": 2680, "token_acc": 0.8936742934051144, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.859165633374665, "grad_norm": 0.03587054686772771, "learning_rate": 1.0260157130864178e-06, "loss": 0.3494544267654419, "memory(GiB)": 77.28, "step": 2685, "token_acc": 0.8780027453671929, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.8607655693772249, "grad_norm": 0.036927180363296286, "learning_rate": 1.0032254494578519e-06, "loss": 0.35199804306030275, "memory(GiB)": 77.28, "step": 2690, "token_acc": 0.8905178979436406, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.8623655053797848, "grad_norm": 0.03966797036856003, "learning_rate": 9.806777769260034e-07, "loss": 0.35879766941070557, "memory(GiB)": 77.28, "step": 2695, "token_acc": 0.9054112554112554, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.8639654413823447, "grad_norm": 0.03806048478363406, "learning_rate": 9.583733034714982e-07, "loss": 0.34694294929504393, "memory(GiB)": 77.28, "step": 2700, "token_acc": 0.9187337129620693, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.8655653773849046, "grad_norm": 0.03857250568994282, "learning_rate": 9.363126305172831e-07, "loss": 0.35350399017333983, "memory(GiB)": 77.28, "step": 2705, "token_acc": 0.9250559284116331, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.8671653133874645, "grad_norm": 0.037358698407483806, "learning_rate": 9.144963529124163e-07, "loss": 0.3406071186065674, "memory(GiB)": 77.28, "step": 2710, "token_acc": 0.8880566801619433, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.8687652493900244, "grad_norm": 0.03796555457876589, "learning_rate": 8.929250589160166e-07, "loss": 0.3480019807815552, "memory(GiB)": 77.28, "step": 2715, "token_acc": 0.8878713878713879, "train_speed(iter/s)": 0.014444 }, { "epoch": 0.8703651853925843, "grad_norm": 0.03578087810314897, "learning_rate": 8.715993301814174e-07, "loss": 0.34974730014801025, "memory(GiB)": 77.28, "step": 2720, "token_acc": 0.893631910426872, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.8719651213951441, "grad_norm": 0.03683673172866316, "learning_rate": 8.505197417404687e-07, "loss": 0.34303812980651854, "memory(GiB)": 77.28, "step": 2725, "token_acc": 0.9124767225325885, "train_speed(iter/s)": 0.014444 }, { "epoch": 0.8735650573977041, "grad_norm": 0.0365725452957113, "learning_rate": 8.296868619880372e-07, "loss": 0.3499909400939941, "memory(GiB)": 77.28, "step": 2730, "token_acc": 0.8861124459394522, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.875164993400264, "grad_norm": 0.03572406694103383, "learning_rate": 8.091012526666797e-07, "loss": 0.3504805564880371, "memory(GiB)": 77.28, "step": 2735, "token_acc": 0.8892282630828752, "train_speed(iter/s)": 0.014444 }, { "epoch": 0.8767649294028239, "grad_norm": 0.03779741947722869, "learning_rate": 7.887634688515e-07, "loss": 0.3552916765213013, "memory(GiB)": 77.28, "step": 2740, "token_acc": 0.9217644084934277, "train_speed(iter/s)": 0.014444 }, { "epoch": 0.8783648654053838, "grad_norm": 0.03734376079780654, "learning_rate": 7.686740589351704e-07, "loss": 0.3564465522766113, "memory(GiB)": 77.28, "step": 2745, "token_acc": 0.8365307753796962, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.8799648014079436, "grad_norm": 0.03886072012349239, "learning_rate": 7.488335646131628e-07, "loss": 0.35783588886260986, "memory(GiB)": 77.28, "step": 2750, "token_acc": 0.8932851985559567, "train_speed(iter/s)": 0.014444 }, { "epoch": 0.8799648014079436, "eval_loss": 0.5971372127532959, "eval_runtime": 171.8021, "eval_samples_per_second": 116.925, "eval_steps_per_second": 0.588, "eval_token_acc": 0.8960392306274841, "step": 2750 }, { "epoch": 0.8815647374105036, "grad_norm": 0.03809267294716575, "learning_rate": 7.292425208691212e-07, "loss": 0.34661192893981935, "memory(GiB)": 77.28, "step": 2755, "token_acc": 0.9020258590887091, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.8831646734130635, "grad_norm": 0.03923242547695106, "learning_rate": 7.099014559604556e-07, "loss": 0.3626936674118042, "memory(GiB)": 77.28, "step": 2760, "token_acc": 0.9132881442639724, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.8847646094156234, "grad_norm": 0.038038269263299306, "learning_rate": 6.908108914040823e-07, "loss": 0.3482142210006714, "memory(GiB)": 77.28, "step": 2765, "token_acc": 0.926984508226252, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.8863645454181833, "grad_norm": 0.03824935772013396, "learning_rate": 6.71971341962373e-07, "loss": 0.35893754959106444, "memory(GiB)": 77.28, "step": 2770, "token_acc": 0.8936886395511922, "train_speed(iter/s)": 0.014431 }, { "epoch": 0.8879644814207431, "grad_norm": 0.04010489518356249, "learning_rate": 6.53383315629268e-07, "loss": 0.34843852519989016, "memory(GiB)": 77.28, "step": 2775, "token_acc": 0.8804709495776811, "train_speed(iter/s)": 0.01443 }, { "epoch": 0.889564417423303, "grad_norm": 0.038785315140372825, "learning_rate": 6.350473136165836e-07, "loss": 0.34716622829437255, "memory(GiB)": 77.28, "step": 2780, "token_acc": 0.9097255275265747, "train_speed(iter/s)": 0.014432 }, { "epoch": 0.891164353425863, "grad_norm": 0.03648869486252188, "learning_rate": 6.169638303404912e-07, "loss": 0.34730355739593505, "memory(GiB)": 77.28, "step": 2785, "token_acc": 0.9088560885608856, "train_speed(iter/s)": 0.014433 }, { "epoch": 0.8927642894284229, "grad_norm": 0.037303942869965495, "learning_rate": 5.991333534081878e-07, "loss": 0.35375151634216306, "memory(GiB)": 77.28, "step": 2790, "token_acc": 0.9058347775852109, "train_speed(iter/s)": 0.014434 }, { "epoch": 0.8943642254309827, "grad_norm": 0.03697384190504123, "learning_rate": 5.815563636047539e-07, "loss": 0.347182297706604, "memory(GiB)": 77.28, "step": 2795, "token_acc": 0.8924109931292942, "train_speed(iter/s)": 0.014436 }, { "epoch": 0.8959641614335426, "grad_norm": 0.03652945378250148, "learning_rate": 5.64233334880181e-07, "loss": 0.34785597324371337, "memory(GiB)": 77.28, "step": 2800, "token_acc": 0.9158926728586171, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.8975640974361025, "grad_norm": 0.03760402764710459, "learning_rate": 5.471647343365982e-07, "loss": 0.3536502838134766, "memory(GiB)": 77.28, "step": 2805, "token_acc": 0.9084852734922861, "train_speed(iter/s)": 0.014439 }, { "epoch": 0.8991640334386625, "grad_norm": 0.03705771284444855, "learning_rate": 5.303510222156716e-07, "loss": 0.3537883758544922, "memory(GiB)": 77.28, "step": 2810, "token_acc": 0.8768209478148626, "train_speed(iter/s)": 0.01444 }, { "epoch": 0.9007639694412224, "grad_norm": 0.03923039459407896, "learning_rate": 5.137926518862013e-07, "loss": 0.3503025770187378, "memory(GiB)": 77.28, "step": 2815, "token_acc": 0.8973375931842386, "train_speed(iter/s)": 0.014441 }, { "epoch": 0.9023639054437822, "grad_norm": 0.03440569943973169, "learning_rate": 4.974900698318885e-07, "loss": 0.3502909421920776, "memory(GiB)": 77.28, "step": 2820, "token_acc": 0.8903985507246377, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.9039638414463421, "grad_norm": 0.037440830013703, "learning_rate": 4.814437156393048e-07, "loss": 0.359883975982666, "memory(GiB)": 77.28, "step": 2825, "token_acc": 0.8621068032187271, "train_speed(iter/s)": 0.014442 }, { "epoch": 0.905563777448902, "grad_norm": 0.03604417130894721, "learning_rate": 4.656540219860317e-07, "loss": 0.3613792657852173, "memory(GiB)": 77.28, "step": 2830, "token_acc": 0.896741523557904, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.907163713451462, "grad_norm": 0.03851080526779007, "learning_rate": 4.501214146289956e-07, "loss": 0.3496058464050293, "memory(GiB)": 77.28, "step": 2835, "token_acc": 0.9011064062286573, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.9087636494540219, "grad_norm": 0.03746777254251882, "learning_rate": 4.3484631239299356e-07, "loss": 0.3529067516326904, "memory(GiB)": 77.28, "step": 2840, "token_acc": 0.8689181453921008, "train_speed(iter/s)": 0.014443 }, { "epoch": 0.9103635854565817, "grad_norm": 0.03726783035013483, "learning_rate": 4.198291271593924e-07, "loss": 0.3502077579498291, "memory(GiB)": 77.28, "step": 2845, "token_acc": 0.8986060161408658, "train_speed(iter/s)": 0.014444 }, { "epoch": 0.9119635214591416, "grad_norm": 0.035823705524663504, "learning_rate": 4.0507026385502747e-07, "loss": 0.3497209310531616, "memory(GiB)": 77.28, "step": 2850, "token_acc": 0.9251456745853878, "train_speed(iter/s)": 0.014445 }, { "epoch": 0.9135634574617015, "grad_norm": 0.038081501743851526, "learning_rate": 3.9057012044127817e-07, "loss": 0.352987265586853, "memory(GiB)": 77.28, "step": 2855, "token_acc": 0.8892445582586428, "train_speed(iter/s)": 0.014446 }, { "epoch": 0.9151633934642615, "grad_norm": 0.0385949290213603, "learning_rate": 3.7632908790334656e-07, "loss": 0.3471065044403076, "memory(GiB)": 77.28, "step": 2860, "token_acc": 0.9146107456140351, "train_speed(iter/s)": 0.014446 }, { "epoch": 0.9167633294668214, "grad_norm": 0.03861723600804993, "learning_rate": 3.6234755023970447e-07, "loss": 0.3470769882202148, "memory(GiB)": 77.28, "step": 2865, "token_acc": 0.8663258983890955, "train_speed(iter/s)": 0.014448 }, { "epoch": 0.9183632654693812, "grad_norm": 0.037810929727173835, "learning_rate": 3.4862588445174985e-07, "loss": 0.3519733190536499, "memory(GiB)": 77.28, "step": 2870, "token_acc": 0.9010814249363868, "train_speed(iter/s)": 0.014449 }, { "epoch": 0.9199632014719411, "grad_norm": 0.0379260232969743, "learning_rate": 3.3516446053363015e-07, "loss": 0.34721758365631106, "memory(GiB)": 77.28, "step": 2875, "token_acc": 0.9072595971113645, "train_speed(iter/s)": 0.014449 }, { "epoch": 0.921563137474501, "grad_norm": 0.036881383803487856, "learning_rate": 3.219636414622751e-07, "loss": 0.35213327407836914, "memory(GiB)": 77.28, "step": 2880, "token_acc": 0.9062799288548365, "train_speed(iter/s)": 0.01445 }, { "epoch": 0.923163073477061, "grad_norm": 0.03626677080161208, "learning_rate": 3.090237831876053e-07, "loss": 0.3516512393951416, "memory(GiB)": 77.28, "step": 2885, "token_acc": 0.8761041902604757, "train_speed(iter/s)": 0.014451 }, { "epoch": 0.9247630094796209, "grad_norm": 0.03714975307806561, "learning_rate": 2.9634523462293005e-07, "loss": 0.3485568046569824, "memory(GiB)": 77.28, "step": 2890, "token_acc": 0.9238785106112594, "train_speed(iter/s)": 0.014451 }, { "epoch": 0.9263629454821807, "grad_norm": 0.036754057783206624, "learning_rate": 2.839283376355506e-07, "loss": 0.3485892295837402, "memory(GiB)": 77.28, "step": 2895, "token_acc": 0.9183364839319471, "train_speed(iter/s)": 0.01445 }, { "epoch": 0.9279628814847406, "grad_norm": 0.03647869908710096, "learning_rate": 2.717734270375272e-07, "loss": 0.3410207748413086, "memory(GiB)": 77.28, "step": 2900, "token_acc": 0.9108079748163693, "train_speed(iter/s)": 0.014451 }, { "epoch": 0.9295628174873005, "grad_norm": 0.03711266544187936, "learning_rate": 2.5988083057666534e-07, "loss": 0.35901172161102296, "memory(GiB)": 77.28, "step": 2905, "token_acc": 0.9014373716632443, "train_speed(iter/s)": 0.014451 }, { "epoch": 0.9311627534898604, "grad_norm": 0.0391959243873001, "learning_rate": 2.4825086892766745e-07, "loss": 0.3521601438522339, "memory(GiB)": 77.28, "step": 2910, "token_acc": 0.9066280456636565, "train_speed(iter/s)": 0.014452 }, { "epoch": 0.9327626894924202, "grad_norm": 0.03754600878736611, "learning_rate": 2.3688385568349515e-07, "loss": 0.34390983581542967, "memory(GiB)": 77.28, "step": 2915, "token_acc": 0.8572481572481573, "train_speed(iter/s)": 0.014453 }, { "epoch": 0.9343626254949802, "grad_norm": 0.040067928972265965, "learning_rate": 2.2578009734690264e-07, "loss": 0.3604452133178711, "memory(GiB)": 77.28, "step": 2920, "token_acc": 0.9112820512820513, "train_speed(iter/s)": 0.014453 }, { "epoch": 0.9359625614975401, "grad_norm": 0.03683689442632747, "learning_rate": 2.1493989332218468e-07, "loss": 0.34636476039886477, "memory(GiB)": 77.28, "step": 2925, "token_acc": 0.8987912682662818, "train_speed(iter/s)": 0.014453 }, { "epoch": 0.9375624975001, "grad_norm": 0.03737336362440631, "learning_rate": 2.043635359070928e-07, "loss": 0.35263738632202146, "memory(GiB)": 77.28, "step": 2930, "token_acc": 0.9111613632692618, "train_speed(iter/s)": 0.014456 }, { "epoch": 0.9391624335026599, "grad_norm": 0.037836926968173146, "learning_rate": 1.9405131028495838e-07, "loss": 0.35706591606140137, "memory(GiB)": 77.28, "step": 2935, "token_acc": 0.8956814357823892, "train_speed(iter/s)": 0.014455 }, { "epoch": 0.9407623695052197, "grad_norm": 0.03836305322378439, "learning_rate": 1.8400349451700438e-07, "loss": 0.3512787103652954, "memory(GiB)": 77.28, "step": 2940, "token_acc": 0.9075797047512716, "train_speed(iter/s)": 0.014457 }, { "epoch": 0.9423623055077797, "grad_norm": 0.0366255147217552, "learning_rate": 1.742203595348435e-07, "loss": 0.34981393814086914, "memory(GiB)": 77.28, "step": 2945, "token_acc": 0.8997175141242938, "train_speed(iter/s)": 0.014458 }, { "epoch": 0.9439622415103396, "grad_norm": 0.039903409914483774, "learning_rate": 1.6470216913317628e-07, "loss": 0.3578468322753906, "memory(GiB)": 77.28, "step": 2950, "token_acc": 0.8852280955829109, "train_speed(iter/s)": 0.014458 }, { "epoch": 0.9455621775128995, "grad_norm": 0.03632939603743224, "learning_rate": 1.5544917996267562e-07, "loss": 0.34919579029083253, "memory(GiB)": 77.28, "step": 2955, "token_acc": 0.8785700775487044, "train_speed(iter/s)": 0.014459 }, { "epoch": 0.9471621135154594, "grad_norm": 0.03871438310718043, "learning_rate": 1.464616415230702e-07, "loss": 0.35771970748901366, "memory(GiB)": 77.28, "step": 2960, "token_acc": 0.893168029543656, "train_speed(iter/s)": 0.014458 }, { "epoch": 0.9487620495180192, "grad_norm": 0.036901244083775424, "learning_rate": 1.3773979615640976e-07, "loss": 0.350262188911438, "memory(GiB)": 77.28, "step": 2965, "token_acc": 0.9129044634863793, "train_speed(iter/s)": 0.014459 }, { "epoch": 0.9503619855205792, "grad_norm": 0.03732230567834177, "learning_rate": 1.292838790405393e-07, "loss": 0.3521857500076294, "memory(GiB)": 77.28, "step": 2970, "token_acc": 0.9018378063010501, "train_speed(iter/s)": 0.014459 }, { "epoch": 0.9519619215231391, "grad_norm": 0.038418652841169985, "learning_rate": 1.2109411818274851e-07, "loss": 0.3512159585952759, "memory(GiB)": 77.28, "step": 2975, "token_acc": 0.9232655416125776, "train_speed(iter/s)": 0.01446 }, { "epoch": 0.953561857525699, "grad_norm": 0.03784470443540757, "learning_rate": 1.1317073441363458e-07, "loss": 0.35275132656097413, "memory(GiB)": 77.28, "step": 2980, "token_acc": 0.9260171180677688, "train_speed(iter/s)": 0.01446 }, { "epoch": 0.9551617935282589, "grad_norm": 0.037282968935844873, "learning_rate": 1.055139413811379e-07, "loss": 0.3569183826446533, "memory(GiB)": 77.28, "step": 2985, "token_acc": 0.885663082437276, "train_speed(iter/s)": 0.014461 }, { "epoch": 0.9567617295308187, "grad_norm": 0.03683921378138757, "learning_rate": 9.812394554478355e-08, "loss": 0.34755406379699705, "memory(GiB)": 77.28, "step": 2990, "token_acc": 0.8813957127210139, "train_speed(iter/s)": 0.014461 }, { "epoch": 0.9583616655333786, "grad_norm": 0.03816641432653712, "learning_rate": 9.10009461701189e-08, "loss": 0.35767698287963867, "memory(GiB)": 77.28, "step": 2995, "token_acc": 0.8030809205642168, "train_speed(iter/s)": 0.014462 }, { "epoch": 0.9599616015359386, "grad_norm": 0.03992625623958567, "learning_rate": 8.41451353233369e-08, "loss": 0.3515816926956177, "memory(GiB)": 77.28, "step": 3000, "token_acc": 0.8982125124131083, "train_speed(iter/s)": 0.014461 }, { "epoch": 0.9599616015359386, "eval_loss": 0.5968807339668274, "eval_runtime": 161.8894, "eval_samples_per_second": 124.085, "eval_steps_per_second": 0.624, "eval_token_acc": 0.8961120208061873, "step": 3000 }, { "epoch": 0.9615615375384985, "grad_norm": 0.03506254411144567, "learning_rate": 7.755669786609688e-08, "loss": 0.3550234317779541, "memory(GiB)": 77.28, "step": 3005, "token_acc": 0.9054439315775183, "train_speed(iter/s)": 0.014448 }, { "epoch": 0.9631614735410584, "grad_norm": 0.037502896081413176, "learning_rate": 7.123581145053849e-08, "loss": 0.35604000091552734, "memory(GiB)": 77.28, "step": 3010, "token_acc": 0.9059127526979784, "train_speed(iter/s)": 0.014448 }, { "epoch": 0.9647614095436182, "grad_norm": 0.0382845236708893, "learning_rate": 6.51826465144978e-08, "loss": 0.35213139057159426, "memory(GiB)": 77.28, "step": 3015, "token_acc": 0.8929005381010241, "train_speed(iter/s)": 0.014448 }, { "epoch": 0.9663613455461781, "grad_norm": 0.03601878704018656, "learning_rate": 5.93973662769054e-08, "loss": 0.3391100883483887, "memory(GiB)": 77.28, "step": 3020, "token_acc": 0.9075471698113208, "train_speed(iter/s)": 0.014448 }, { "epoch": 0.9679612815487381, "grad_norm": 0.03691591762096, "learning_rate": 5.388012673338661e-08, "loss": 0.3560220956802368, "memory(GiB)": 77.28, "step": 3025, "token_acc": 0.8877074270984372, "train_speed(iter/s)": 0.014448 }, { "epoch": 0.969561217551298, "grad_norm": 0.038006836164876816, "learning_rate": 4.863107665205702e-08, "loss": 0.34921257495880126, "memory(GiB)": 77.28, "step": 3030, "token_acc": 0.8738569123184508, "train_speed(iter/s)": 0.014449 }, { "epoch": 0.9711611535538578, "grad_norm": 0.03500666951506718, "learning_rate": 4.365035756950797e-08, "loss": 0.34278459548950196, "memory(GiB)": 77.28, "step": 3035, "token_acc": 0.8969732246798603, "train_speed(iter/s)": 0.014449 }, { "epoch": 0.9727610895564177, "grad_norm": 0.03689296268268185, "learning_rate": 3.8938103786995144e-08, "loss": 0.3485910177230835, "memory(GiB)": 77.28, "step": 3040, "token_acc": 0.9163443924282516, "train_speed(iter/s)": 0.01445 }, { "epoch": 0.9743610255589776, "grad_norm": 0.03704895203134622, "learning_rate": 3.449444236681254e-08, "loss": 0.3477888822555542, "memory(GiB)": 77.28, "step": 3045, "token_acc": 0.9033083219645294, "train_speed(iter/s)": 0.014451 }, { "epoch": 0.9759609615615376, "grad_norm": 0.038564010535460366, "learning_rate": 3.03194931288664e-08, "loss": 0.36015493869781495, "memory(GiB)": 77.28, "step": 3050, "token_acc": 0.9197261244245072, "train_speed(iter/s)": 0.014452 }, { "epoch": 0.9775608975640975, "grad_norm": 0.03839178767845547, "learning_rate": 2.641336864744992e-08, "loss": 0.3448947429656982, "memory(GiB)": 77.28, "step": 3055, "token_acc": 0.9067073170731708, "train_speed(iter/s)": 0.014453 }, { "epoch": 0.9791608335666573, "grad_norm": 0.037786530189202895, "learning_rate": 2.2776174248199114e-08, "loss": 0.3379628896713257, "memory(GiB)": 77.28, "step": 3060, "token_acc": 0.9009945079412202, "train_speed(iter/s)": 0.014455 }, { "epoch": 0.9807607695692172, "grad_norm": 0.035912429119548846, "learning_rate": 1.9408008005260548e-08, "loss": 0.3500987529754639, "memory(GiB)": 77.28, "step": 3065, "token_acc": 0.8876028806584362, "train_speed(iter/s)": 0.014456 }, { "epoch": 0.9823607055717771, "grad_norm": 0.03444074710514445, "learning_rate": 1.630896073864352e-08, "loss": 0.3504997730255127, "memory(GiB)": 77.28, "step": 3070, "token_acc": 0.8979777737292768, "train_speed(iter/s)": 0.014456 }, { "epoch": 0.983960641574337, "grad_norm": 0.03756464819153609, "learning_rate": 1.3479116011769766e-08, "loss": 0.34742605686187744, "memory(GiB)": 77.28, "step": 3075, "token_acc": 0.9106449106449106, "train_speed(iter/s)": 0.014457 }, { "epoch": 0.985560577576897, "grad_norm": 0.03754891232855657, "learning_rate": 1.0918550129223049e-08, "loss": 0.3474902868270874, "memory(GiB)": 77.28, "step": 3080, "token_acc": 0.9118387909319899, "train_speed(iter/s)": 0.014457 }, { "epoch": 0.9871605135794568, "grad_norm": 0.03682524226116992, "learning_rate": 8.627332134690802e-09, "loss": 0.353102445602417, "memory(GiB)": 77.28, "step": 3085, "token_acc": 0.8938781202063868, "train_speed(iter/s)": 0.014457 }, { "epoch": 0.9887604495820167, "grad_norm": 0.0349572055380618, "learning_rate": 6.605523809102288e-09, "loss": 0.35455539226531985, "memory(GiB)": 77.28, "step": 3090, "token_acc": 0.9251228678808904, "train_speed(iter/s)": 0.014457 }, { "epoch": 0.9903603855845766, "grad_norm": 0.0367341369681787, "learning_rate": 4.853179668959928e-09, "loss": 0.3528116464614868, "memory(GiB)": 77.28, "step": 3095, "token_acc": 0.8497830802603037, "train_speed(iter/s)": 0.014458 }, { "epoch": 0.9919603215871365, "grad_norm": 0.03543382063951275, "learning_rate": 3.3703469648760367e-09, "loss": 0.34554617404937743, "memory(GiB)": 77.28, "step": 3100, "token_acc": 0.8760165975103734, "train_speed(iter/s)": 0.014458 }, { "epoch": 0.9935602575896965, "grad_norm": 0.03672488758432725, "learning_rate": 2.1570656802905042e-09, "loss": 0.35210456848144533, "memory(GiB)": 77.28, "step": 3105, "token_acc": 0.875547098001903, "train_speed(iter/s)": 0.014459 }, { "epoch": 0.9951601935922563, "grad_norm": 0.03667904917275392, "learning_rate": 1.213368530399439e-09, "loss": 0.36057708263397215, "memory(GiB)": 77.28, "step": 3110, "token_acc": 0.8785273780601757, "train_speed(iter/s)": 0.014459 }, { "epoch": 0.9967601295948162, "grad_norm": 0.037172261753358984, "learning_rate": 5.392809612703165e-10, "loss": 0.347002911567688, "memory(GiB)": 77.28, "step": 3115, "token_acc": 0.8876961189099918, "train_speed(iter/s)": 0.01446 }, { "epoch": 0.9983600655973761, "grad_norm": 0.03623294899802742, "learning_rate": 1.3482114915475132e-10, "loss": 0.34892323017120364, "memory(GiB)": 77.28, "step": 3120, "token_acc": 0.9150393970537856, "train_speed(iter/s)": 0.014459 }, { "epoch": 0.999960001599936, "grad_norm": 0.03979082426503465, "learning_rate": 0.0, "loss": 0.3523369073867798, "memory(GiB)": 77.28, "step": 3125, "token_acc": 0.874745605920444, "train_speed(iter/s)": 0.014459 }, { "epoch": 0.999960001599936, "eval_loss": 0.5968554615974426, "eval_runtime": 146.0358, "eval_samples_per_second": 137.555, "eval_steps_per_second": 0.692, "eval_token_acc": 0.8961375957338398, "step": 3125 } ], "logging_steps": 5, "max_steps": 3125, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.4706850358900346e+20, "train_batch_size": 2, "trial_name": null, "trial_params": null }