Robotics
Transformers
Safetensors
internvl_chat
feature-extraction
vision-language-model
manipulation
custom_code
Instructions to use InternRobotics/VLAC-8b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use InternRobotics/VLAC-8b with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("InternRobotics/VLAC-8b", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": 0.59685546, | |
| "best_model_checkpoint": "/cpfs04/user/zhangqi/zhangqi/data/model_garden/0619_intern8b_v7-1-part15-19-resize-decay/v1-20250624-140732/checkpoint-3125", | |
| "epoch": 0.999960001599936, | |
| "eval_steps": 250, | |
| "global_step": 3125, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0003199872005119795, | |
| "grad_norm": 0.034520456918049065, | |
| "learning_rate": 2.0000000000000002e-07, | |
| "loss": 0.40204745531082153, | |
| "memory(GiB)": 40.4, | |
| "step": 1, | |
| "token_acc": 0.8817829457364341, | |
| "train_speed(iter/s)": 0.010771 | |
| }, | |
| { | |
| "epoch": 0.0015999360025598975, | |
| "grad_norm": 0.03420916628520123, | |
| "learning_rate": 1.0000000000000002e-06, | |
| "loss": 0.39483457803726196, | |
| "memory(GiB)": 60.23, | |
| "step": 5, | |
| "token_acc": 0.9005736137667304, | |
| "train_speed(iter/s)": 0.01352 | |
| }, | |
| { | |
| "epoch": 0.003199872005119795, | |
| "grad_norm": 0.03272073151772668, | |
| "learning_rate": 2.0000000000000003e-06, | |
| "loss": 0.39301304817199706, | |
| "memory(GiB)": 60.23, | |
| "step": 10, | |
| "token_acc": 0.9103283749649173, | |
| "train_speed(iter/s)": 0.014045 | |
| }, | |
| { | |
| "epoch": 0.004799808007679693, | |
| "grad_norm": 0.03294824977638289, | |
| "learning_rate": 3e-06, | |
| "loss": 0.38296959400177, | |
| "memory(GiB)": 60.23, | |
| "step": 15, | |
| "token_acc": 0.8657198192382182, | |
| "train_speed(iter/s)": 0.014012 | |
| }, | |
| { | |
| "epoch": 0.00639974401023959, | |
| "grad_norm": 0.0334494683427454, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 0.3897198915481567, | |
| "memory(GiB)": 60.23, | |
| "step": 20, | |
| "token_acc": 0.8978738236319275, | |
| "train_speed(iter/s)": 0.014066 | |
| }, | |
| { | |
| "epoch": 0.007999680012799487, | |
| "grad_norm": 0.03136602849258215, | |
| "learning_rate": 5e-06, | |
| "loss": 0.3881317138671875, | |
| "memory(GiB)": 60.23, | |
| "step": 25, | |
| "token_acc": 0.9188261541101768, | |
| "train_speed(iter/s)": 0.014214 | |
| }, | |
| { | |
| "epoch": 0.009599616015359386, | |
| "grad_norm": 0.03265063244675712, | |
| "learning_rate": 6e-06, | |
| "loss": 0.3901845693588257, | |
| "memory(GiB)": 60.23, | |
| "step": 30, | |
| "token_acc": 0.896212961495801, | |
| "train_speed(iter/s)": 0.01427 | |
| }, | |
| { | |
| "epoch": 0.011199552017919284, | |
| "grad_norm": 0.032203046144693825, | |
| "learning_rate": 7e-06, | |
| "loss": 0.3953768014907837, | |
| "memory(GiB)": 60.23, | |
| "step": 35, | |
| "token_acc": 0.8888367729831145, | |
| "train_speed(iter/s)": 0.014326 | |
| }, | |
| { | |
| "epoch": 0.01279948802047918, | |
| "grad_norm": 0.032390202609314425, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 0.38478689193725585, | |
| "memory(GiB)": 60.23, | |
| "step": 40, | |
| "token_acc": 0.8951841359773371, | |
| "train_speed(iter/s)": 0.014412 | |
| }, | |
| { | |
| "epoch": 0.014399424023039079, | |
| "grad_norm": 0.033801877503161194, | |
| "learning_rate": 9e-06, | |
| "loss": 0.38552730083465575, | |
| "memory(GiB)": 60.23, | |
| "step": 45, | |
| "token_acc": 0.9022271714922049, | |
| "train_speed(iter/s)": 0.014478 | |
| }, | |
| { | |
| "epoch": 0.015999360025598975, | |
| "grad_norm": 0.03301429535272696, | |
| "learning_rate": 1e-05, | |
| "loss": 0.38529186248779296, | |
| "memory(GiB)": 60.23, | |
| "step": 50, | |
| "token_acc": 0.8758992805755396, | |
| "train_speed(iter/s)": 0.014599 | |
| }, | |
| { | |
| "epoch": 0.017599296028158875, | |
| "grad_norm": 0.03149429825234287, | |
| "learning_rate": 1.1000000000000001e-05, | |
| "loss": 0.3803748607635498, | |
| "memory(GiB)": 76.07, | |
| "step": 55, | |
| "token_acc": 0.8477023180154535, | |
| "train_speed(iter/s)": 0.014592 | |
| }, | |
| { | |
| "epoch": 0.01919923203071877, | |
| "grad_norm": 0.033808759949065646, | |
| "learning_rate": 1.2e-05, | |
| "loss": 0.3867351055145264, | |
| "memory(GiB)": 76.07, | |
| "step": 60, | |
| "token_acc": 0.8850377977463986, | |
| "train_speed(iter/s)": 0.014608 | |
| }, | |
| { | |
| "epoch": 0.020799168033278668, | |
| "grad_norm": 0.03275791011215982, | |
| "learning_rate": 1.3000000000000001e-05, | |
| "loss": 0.39216411113739014, | |
| "memory(GiB)": 76.07, | |
| "step": 65, | |
| "token_acc": 0.901587826662256, | |
| "train_speed(iter/s)": 0.014547 | |
| }, | |
| { | |
| "epoch": 0.022399104035838568, | |
| "grad_norm": 0.03324158836650574, | |
| "learning_rate": 1.4e-05, | |
| "loss": 0.3974705457687378, | |
| "memory(GiB)": 76.07, | |
| "step": 70, | |
| "token_acc": 0.9116919816319322, | |
| "train_speed(iter/s)": 0.014544 | |
| }, | |
| { | |
| "epoch": 0.023999040038398464, | |
| "grad_norm": 0.031459981925064155, | |
| "learning_rate": 1.5000000000000002e-05, | |
| "loss": 0.37577147483825685, | |
| "memory(GiB)": 76.07, | |
| "step": 75, | |
| "token_acc": 0.9071523767214571, | |
| "train_speed(iter/s)": 0.014546 | |
| }, | |
| { | |
| "epoch": 0.02559897604095836, | |
| "grad_norm": 0.03366771334434494, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "loss": 0.381273889541626, | |
| "memory(GiB)": 76.07, | |
| "step": 80, | |
| "token_acc": 0.8764924894081397, | |
| "train_speed(iter/s)": 0.014586 | |
| }, | |
| { | |
| "epoch": 0.02719891204351826, | |
| "grad_norm": 0.033717224619741304, | |
| "learning_rate": 1.7e-05, | |
| "loss": 0.3805533409118652, | |
| "memory(GiB)": 76.07, | |
| "step": 85, | |
| "token_acc": 0.8912507701786815, | |
| "train_speed(iter/s)": 0.014606 | |
| }, | |
| { | |
| "epoch": 0.028798848046078157, | |
| "grad_norm": 0.033563527084085734, | |
| "learning_rate": 1.8e-05, | |
| "loss": 0.3851145029067993, | |
| "memory(GiB)": 76.07, | |
| "step": 90, | |
| "token_acc": 0.8561311210036423, | |
| "train_speed(iter/s)": 0.0146 | |
| }, | |
| { | |
| "epoch": 0.030398784048638054, | |
| "grad_norm": 0.03128576112566358, | |
| "learning_rate": 1.9e-05, | |
| "loss": 0.37614123821258544, | |
| "memory(GiB)": 76.07, | |
| "step": 95, | |
| "token_acc": 0.8939516782876601, | |
| "train_speed(iter/s)": 0.014631 | |
| }, | |
| { | |
| "epoch": 0.03199872005119795, | |
| "grad_norm": 0.03419951138083408, | |
| "learning_rate": 2e-05, | |
| "loss": 0.3880021333694458, | |
| "memory(GiB)": 76.07, | |
| "step": 100, | |
| "token_acc": 0.8853078862081383, | |
| "train_speed(iter/s)": 0.014644 | |
| }, | |
| { | |
| "epoch": 0.03359865605375785, | |
| "grad_norm": 0.032374666409375384, | |
| "learning_rate": 1.9999865178850847e-05, | |
| "loss": 0.3888866901397705, | |
| "memory(GiB)": 76.07, | |
| "step": 105, | |
| "token_acc": 0.8903958366188298, | |
| "train_speed(iter/s)": 0.014639 | |
| }, | |
| { | |
| "epoch": 0.03519859205631775, | |
| "grad_norm": 0.034788552767827836, | |
| "learning_rate": 1.999946071903873e-05, | |
| "loss": 0.38006932735443116, | |
| "memory(GiB)": 76.07, | |
| "step": 110, | |
| "token_acc": 0.886074321717886, | |
| "train_speed(iter/s)": 0.014607 | |
| }, | |
| { | |
| "epoch": 0.03679852805887764, | |
| "grad_norm": 0.03501245967543382, | |
| "learning_rate": 1.9998786631469602e-05, | |
| "loss": 0.3911449432373047, | |
| "memory(GiB)": 76.07, | |
| "step": 115, | |
| "token_acc": 0.8798465266558966, | |
| "train_speed(iter/s)": 0.014604 | |
| }, | |
| { | |
| "epoch": 0.03839846406143754, | |
| "grad_norm": 0.03242661684377351, | |
| "learning_rate": 1.999784293431971e-05, | |
| "loss": 0.3861077070236206, | |
| "memory(GiB)": 76.07, | |
| "step": 120, | |
| "token_acc": 0.8665442301805938, | |
| "train_speed(iter/s)": 0.01425 | |
| }, | |
| { | |
| "epoch": 0.03999840006399744, | |
| "grad_norm": 0.03463389128587641, | |
| "learning_rate": 1.9996629653035128e-05, | |
| "loss": 0.3905928373336792, | |
| "memory(GiB)": 76.07, | |
| "step": 125, | |
| "token_acc": 0.8998435054773083, | |
| "train_speed(iter/s)": 0.014271 | |
| }, | |
| { | |
| "epoch": 0.041598336066557336, | |
| "grad_norm": 0.032645290740144876, | |
| "learning_rate": 1.999514682033104e-05, | |
| "loss": 0.3899507761001587, | |
| "memory(GiB)": 76.07, | |
| "step": 130, | |
| "token_acc": 0.8884783798576902, | |
| "train_speed(iter/s)": 0.01428 | |
| }, | |
| { | |
| "epoch": 0.043198272069117236, | |
| "grad_norm": 0.033852879217125625, | |
| "learning_rate": 1.99933944761909e-05, | |
| "loss": 0.3912219047546387, | |
| "memory(GiB)": 76.07, | |
| "step": 135, | |
| "token_acc": 0.8862394436164928, | |
| "train_speed(iter/s)": 0.014311 | |
| }, | |
| { | |
| "epoch": 0.044798208071677136, | |
| "grad_norm": 0.03314594743128617, | |
| "learning_rate": 1.999137266786531e-05, | |
| "loss": 0.38516685962677, | |
| "memory(GiB)": 76.07, | |
| "step": 140, | |
| "token_acc": 0.8981660231660231, | |
| "train_speed(iter/s)": 0.014301 | |
| }, | |
| { | |
| "epoch": 0.04639814407423703, | |
| "grad_norm": 0.03523216491858916, | |
| "learning_rate": 1.998908144987078e-05, | |
| "loss": 0.3815142631530762, | |
| "memory(GiB)": 76.07, | |
| "step": 145, | |
| "token_acc": 0.8799054994093713, | |
| "train_speed(iter/s)": 0.014302 | |
| }, | |
| { | |
| "epoch": 0.04799808007679693, | |
| "grad_norm": 0.0357431601404605, | |
| "learning_rate": 1.9986520883988233e-05, | |
| "loss": 0.3848976373672485, | |
| "memory(GiB)": 76.07, | |
| "step": 150, | |
| "token_acc": 0.8563193851409052, | |
| "train_speed(iter/s)": 0.014282 | |
| }, | |
| { | |
| "epoch": 0.04959801607935683, | |
| "grad_norm": 0.03262403168423455, | |
| "learning_rate": 1.9983691039261358e-05, | |
| "loss": 0.3893115043640137, | |
| "memory(GiB)": 76.07, | |
| "step": 155, | |
| "token_acc": 0.8972887393627548, | |
| "train_speed(iter/s)": 0.014299 | |
| }, | |
| { | |
| "epoch": 0.05119795208191672, | |
| "grad_norm": 0.03531346626165974, | |
| "learning_rate": 1.998059199199474e-05, | |
| "loss": 0.38597636222839354, | |
| "memory(GiB)": 76.07, | |
| "step": 160, | |
| "token_acc": 0.8945444319460067, | |
| "train_speed(iter/s)": 0.014311 | |
| }, | |
| { | |
| "epoch": 0.05279788808447662, | |
| "grad_norm": 0.03357647993148674, | |
| "learning_rate": 1.9977223825751802e-05, | |
| "loss": 0.38405232429504393, | |
| "memory(GiB)": 76.07, | |
| "step": 165, | |
| "token_acc": 0.9117782909930716, | |
| "train_speed(iter/s)": 0.014301 | |
| }, | |
| { | |
| "epoch": 0.05439782408703652, | |
| "grad_norm": 0.03440413120355411, | |
| "learning_rate": 1.997358663135255e-05, | |
| "loss": 0.3781674146652222, | |
| "memory(GiB)": 76.07, | |
| "step": 170, | |
| "token_acc": 0.9056845887334788, | |
| "train_speed(iter/s)": 0.014302 | |
| }, | |
| { | |
| "epoch": 0.055997760089596414, | |
| "grad_norm": 0.033442118491656826, | |
| "learning_rate": 1.9969680506871138e-05, | |
| "loss": 0.3843045949935913, | |
| "memory(GiB)": 76.07, | |
| "step": 175, | |
| "token_acc": 0.900383810188416, | |
| "train_speed(iter/s)": 0.014315 | |
| }, | |
| { | |
| "epoch": 0.057597696092156314, | |
| "grad_norm": 0.033662777739076964, | |
| "learning_rate": 1.9965505557633188e-05, | |
| "loss": 0.389201283454895, | |
| "memory(GiB)": 76.07, | |
| "step": 180, | |
| "token_acc": 0.8900032883919763, | |
| "train_speed(iter/s)": 0.014316 | |
| }, | |
| { | |
| "epoch": 0.059197632094716214, | |
| "grad_norm": 0.03251706827553148, | |
| "learning_rate": 1.9961061896213006e-05, | |
| "loss": 0.38699405193328856, | |
| "memory(GiB)": 76.07, | |
| "step": 185, | |
| "token_acc": 0.876270255424334, | |
| "train_speed(iter/s)": 0.014313 | |
| }, | |
| { | |
| "epoch": 0.06079756809727611, | |
| "grad_norm": 0.03283605185775851, | |
| "learning_rate": 1.9956349642430494e-05, | |
| "loss": 0.3966814517974854, | |
| "memory(GiB)": 76.07, | |
| "step": 190, | |
| "token_acc": 0.879168042258171, | |
| "train_speed(iter/s)": 0.014349 | |
| }, | |
| { | |
| "epoch": 0.06239750409983601, | |
| "grad_norm": 0.03449933751162301, | |
| "learning_rate": 1.9951368923347945e-05, | |
| "loss": 0.39047400951385497, | |
| "memory(GiB)": 76.07, | |
| "step": 195, | |
| "token_acc": 0.8665105386416861, | |
| "train_speed(iter/s)": 0.014346 | |
| }, | |
| { | |
| "epoch": 0.0639974401023959, | |
| "grad_norm": 0.03280827137817534, | |
| "learning_rate": 1.9946119873266615e-05, | |
| "loss": 0.37484734058380126, | |
| "memory(GiB)": 76.07, | |
| "step": 200, | |
| "token_acc": 0.9069767441860465, | |
| "train_speed(iter/s)": 0.014353 | |
| }, | |
| { | |
| "epoch": 0.0655973761049558, | |
| "grad_norm": 0.03584807348524717, | |
| "learning_rate": 1.9940602633723097e-05, | |
| "loss": 0.3874636173248291, | |
| "memory(GiB)": 76.07, | |
| "step": 205, | |
| "token_acc": 0.8897243107769424, | |
| "train_speed(iter/s)": 0.014347 | |
| }, | |
| { | |
| "epoch": 0.0671973121075157, | |
| "grad_norm": 0.03414995299732699, | |
| "learning_rate": 1.99348173534855e-05, | |
| "loss": 0.3874980926513672, | |
| "memory(GiB)": 76.07, | |
| "step": 210, | |
| "token_acc": 0.881191672648959, | |
| "train_speed(iter/s)": 0.014354 | |
| }, | |
| { | |
| "epoch": 0.06879724811007559, | |
| "grad_norm": 0.03286991072544723, | |
| "learning_rate": 1.9928764188549462e-05, | |
| "loss": 0.38269970417022703, | |
| "memory(GiB)": 76.07, | |
| "step": 215, | |
| "token_acc": 0.8929658134956148, | |
| "train_speed(iter/s)": 0.014357 | |
| }, | |
| { | |
| "epoch": 0.0703971841126355, | |
| "grad_norm": 0.03359781387973185, | |
| "learning_rate": 1.9922443302133906e-05, | |
| "loss": 0.38327147960662844, | |
| "memory(GiB)": 76.07, | |
| "step": 220, | |
| "token_acc": 0.9165275459098498, | |
| "train_speed(iter/s)": 0.014351 | |
| }, | |
| { | |
| "epoch": 0.07199712011519539, | |
| "grad_norm": 0.03275039662042973, | |
| "learning_rate": 1.9915854864676665e-05, | |
| "loss": 0.3898788928985596, | |
| "memory(GiB)": 76.07, | |
| "step": 225, | |
| "token_acc": 0.8592750533049041, | |
| "train_speed(iter/s)": 0.014343 | |
| }, | |
| { | |
| "epoch": 0.07359705611775529, | |
| "grad_norm": 0.03395724860978424, | |
| "learning_rate": 1.990899905382988e-05, | |
| "loss": 0.3836425065994263, | |
| "memory(GiB)": 76.07, | |
| "step": 230, | |
| "token_acc": 0.9050742813042639, | |
| "train_speed(iter/s)": 0.014331 | |
| }, | |
| { | |
| "epoch": 0.07519699212031519, | |
| "grad_norm": 0.03323014361282172, | |
| "learning_rate": 1.9901876054455217e-05, | |
| "loss": 0.40008840560913084, | |
| "memory(GiB)": 76.07, | |
| "step": 235, | |
| "token_acc": 0.8920118343195266, | |
| "train_speed(iter/s)": 0.014328 | |
| }, | |
| { | |
| "epoch": 0.07679692812287509, | |
| "grad_norm": 0.03344217991905355, | |
| "learning_rate": 1.9894486058618863e-05, | |
| "loss": 0.3800571203231812, | |
| "memory(GiB)": 76.07, | |
| "step": 240, | |
| "token_acc": 0.9098188751191612, | |
| "train_speed(iter/s)": 0.014319 | |
| }, | |
| { | |
| "epoch": 0.07839686412543498, | |
| "grad_norm": 0.03473900387731426, | |
| "learning_rate": 1.9886829265586368e-05, | |
| "loss": 0.39225742816925047, | |
| "memory(GiB)": 76.07, | |
| "step": 245, | |
| "token_acc": 0.8883210297179632, | |
| "train_speed(iter/s)": 0.014313 | |
| }, | |
| { | |
| "epoch": 0.07999680012799489, | |
| "grad_norm": 0.03513961345431388, | |
| "learning_rate": 1.9878905881817254e-05, | |
| "loss": 0.3903574228286743, | |
| "memory(GiB)": 76.07, | |
| "step": 250, | |
| "token_acc": 0.8576667430666972, | |
| "train_speed(iter/s)": 0.014314 | |
| }, | |
| { | |
| "epoch": 0.07999680012799489, | |
| "eval_loss": 0.622439444065094, | |
| "eval_runtime": 157.3342, | |
| "eval_samples_per_second": 127.677, | |
| "eval_steps_per_second": 0.642, | |
| "eval_token_acc": 0.8873306398781322, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.08159673613055478, | |
| "grad_norm": 0.03372251695955875, | |
| "learning_rate": 1.9870716120959462e-05, | |
| "loss": 0.38556718826293945, | |
| "memory(GiB)": 76.07, | |
| "step": 255, | |
| "token_acc": 0.8786027360871298, | |
| "train_speed(iter/s)": 0.014206 | |
| }, | |
| { | |
| "epoch": 0.08319667213311467, | |
| "grad_norm": 0.03264986549168058, | |
| "learning_rate": 1.986226020384359e-05, | |
| "loss": 0.37873091697692873, | |
| "memory(GiB)": 76.07, | |
| "step": 260, | |
| "token_acc": 0.889001778003556, | |
| "train_speed(iter/s)": 0.014217 | |
| }, | |
| { | |
| "epoch": 0.08479660813567458, | |
| "grad_norm": 0.03141933647884167, | |
| "learning_rate": 1.9853538358476933e-05, | |
| "loss": 0.38749330043792723, | |
| "memory(GiB)": 76.07, | |
| "step": 265, | |
| "token_acc": 0.9063093880653744, | |
| "train_speed(iter/s)": 0.014225 | |
| }, | |
| { | |
| "epoch": 0.08639654413823447, | |
| "grad_norm": 0.03386011981593799, | |
| "learning_rate": 1.9844550820037326e-05, | |
| "loss": 0.387894868850708, | |
| "memory(GiB)": 76.07, | |
| "step": 270, | |
| "token_acc": 0.8854422161304285, | |
| "train_speed(iter/s)": 0.014241 | |
| }, | |
| { | |
| "epoch": 0.08799648014079436, | |
| "grad_norm": 0.03711364422068592, | |
| "learning_rate": 1.9835297830866827e-05, | |
| "loss": 0.38588383197784426, | |
| "memory(GiB)": 76.07, | |
| "step": 275, | |
| "token_acc": 0.8868660598179454, | |
| "train_speed(iter/s)": 0.014246 | |
| }, | |
| { | |
| "epoch": 0.08959641614335427, | |
| "grad_norm": 0.03341834892330089, | |
| "learning_rate": 1.9825779640465157e-05, | |
| "loss": 0.38894240856170653, | |
| "memory(GiB)": 76.07, | |
| "step": 280, | |
| "token_acc": 0.9306718179866924, | |
| "train_speed(iter/s)": 0.014256 | |
| }, | |
| { | |
| "epoch": 0.09119635214591416, | |
| "grad_norm": 0.03387819973021305, | |
| "learning_rate": 1.9815996505483e-05, | |
| "loss": 0.38292522430419923, | |
| "memory(GiB)": 76.07, | |
| "step": 285, | |
| "token_acc": 0.8671353884982873, | |
| "train_speed(iter/s)": 0.014257 | |
| }, | |
| { | |
| "epoch": 0.09279628814847406, | |
| "grad_norm": 0.03429150627328532, | |
| "learning_rate": 1.9805948689715043e-05, | |
| "loss": 0.376310133934021, | |
| "memory(GiB)": 76.07, | |
| "step": 290, | |
| "token_acc": 0.8656910569105691, | |
| "train_speed(iter/s)": 0.014265 | |
| }, | |
| { | |
| "epoch": 0.09439622415103396, | |
| "grad_norm": 0.03450246959931839, | |
| "learning_rate": 1.979563646409291e-05, | |
| "loss": 0.39239072799682617, | |
| "memory(GiB)": 76.07, | |
| "step": 295, | |
| "token_acc": 0.8977094446187637, | |
| "train_speed(iter/s)": 0.014273 | |
| }, | |
| { | |
| "epoch": 0.09599616015359386, | |
| "grad_norm": 0.031824087341643076, | |
| "learning_rate": 1.9785060106677818e-05, | |
| "loss": 0.3861429691314697, | |
| "memory(GiB)": 76.07, | |
| "step": 300, | |
| "token_acc": 0.9000577700751011, | |
| "train_speed(iter/s)": 0.014282 | |
| }, | |
| { | |
| "epoch": 0.09759609615615375, | |
| "grad_norm": 0.03346845050772549, | |
| "learning_rate": 1.97742199026531e-05, | |
| "loss": 0.38443379402160643, | |
| "memory(GiB)": 76.07, | |
| "step": 305, | |
| "token_acc": 0.8890675241157556, | |
| "train_speed(iter/s)": 0.014289 | |
| }, | |
| { | |
| "epoch": 0.09919603215871366, | |
| "grad_norm": 0.03191677416839948, | |
| "learning_rate": 1.9763116144316506e-05, | |
| "loss": 0.3867342948913574, | |
| "memory(GiB)": 76.07, | |
| "step": 310, | |
| "token_acc": 0.8610453181746408, | |
| "train_speed(iter/s)": 0.0143 | |
| }, | |
| { | |
| "epoch": 0.10079596816127355, | |
| "grad_norm": 0.03421794121376898, | |
| "learning_rate": 1.9751749131072335e-05, | |
| "loss": 0.38043770790100095, | |
| "memory(GiB)": 76.07, | |
| "step": 315, | |
| "token_acc": 0.895057390489576, | |
| "train_speed(iter/s)": 0.014318 | |
| }, | |
| { | |
| "epoch": 0.10239590416383344, | |
| "grad_norm": 0.0335963955600723, | |
| "learning_rate": 1.9740119169423337e-05, | |
| "loss": 0.3925303936004639, | |
| "memory(GiB)": 76.07, | |
| "step": 320, | |
| "token_acc": 0.8879252835223482, | |
| "train_speed(iter/s)": 0.014325 | |
| }, | |
| { | |
| "epoch": 0.10399584016639335, | |
| "grad_norm": 0.03247377224618784, | |
| "learning_rate": 1.9728226572962474e-05, | |
| "loss": 0.39456634521484374, | |
| "memory(GiB)": 76.07, | |
| "step": 325, | |
| "token_acc": 0.9204545454545454, | |
| "train_speed(iter/s)": 0.014349 | |
| }, | |
| { | |
| "epoch": 0.10559577616895324, | |
| "grad_norm": 0.03372138735130045, | |
| "learning_rate": 1.9716071662364454e-05, | |
| "loss": 0.39053902626037595, | |
| "memory(GiB)": 76.07, | |
| "step": 330, | |
| "token_acc": 0.8667469395946217, | |
| "train_speed(iter/s)": 0.014349 | |
| }, | |
| { | |
| "epoch": 0.10719571217151314, | |
| "grad_norm": 0.03514032505290493, | |
| "learning_rate": 1.970365476537707e-05, | |
| "loss": 0.38283843994140626, | |
| "memory(GiB)": 76.07, | |
| "step": 335, | |
| "token_acc": 0.8957358294331773, | |
| "train_speed(iter/s)": 0.01436 | |
| }, | |
| { | |
| "epoch": 0.10879564817407304, | |
| "grad_norm": 0.03192284784230212, | |
| "learning_rate": 1.9690976216812397e-05, | |
| "loss": 0.3861492156982422, | |
| "memory(GiB)": 76.07, | |
| "step": 340, | |
| "token_acc": 0.8877259752616555, | |
| "train_speed(iter/s)": 0.014363 | |
| }, | |
| { | |
| "epoch": 0.11039558417663294, | |
| "grad_norm": 0.033562102316210984, | |
| "learning_rate": 1.9678036358537726e-05, | |
| "loss": 0.38447730541229247, | |
| "memory(GiB)": 76.07, | |
| "step": 345, | |
| "token_acc": 0.8906195309765488, | |
| "train_speed(iter/s)": 0.014357 | |
| }, | |
| { | |
| "epoch": 0.11199552017919283, | |
| "grad_norm": 0.03449736551982357, | |
| "learning_rate": 1.966483553946637e-05, | |
| "loss": 0.3902695894241333, | |
| "memory(GiB)": 76.07, | |
| "step": 350, | |
| "token_acc": 0.8884874759152216, | |
| "train_speed(iter/s)": 0.014363 | |
| }, | |
| { | |
| "epoch": 0.11359545618175274, | |
| "grad_norm": 0.03299602135964767, | |
| "learning_rate": 1.9651374115548255e-05, | |
| "loss": 0.3823978424072266, | |
| "memory(GiB)": 76.07, | |
| "step": 355, | |
| "token_acc": 0.9103085026335591, | |
| "train_speed(iter/s)": 0.014362 | |
| }, | |
| { | |
| "epoch": 0.11519539218431263, | |
| "grad_norm": 0.03433798775900007, | |
| "learning_rate": 1.9637652449760297e-05, | |
| "loss": 0.3836047172546387, | |
| "memory(GiB)": 76.07, | |
| "step": 360, | |
| "token_acc": 0.8500127323656735, | |
| "train_speed(iter/s)": 0.014367 | |
| }, | |
| { | |
| "epoch": 0.11679532818687252, | |
| "grad_norm": 0.03345845540162246, | |
| "learning_rate": 1.9623670912096656e-05, | |
| "loss": 0.3858953475952148, | |
| "memory(GiB)": 76.07, | |
| "step": 365, | |
| "token_acc": 0.8927587882715049, | |
| "train_speed(iter/s)": 0.014364 | |
| }, | |
| { | |
| "epoch": 0.11839526418943243, | |
| "grad_norm": 0.03341419963683031, | |
| "learning_rate": 1.9609429879558726e-05, | |
| "loss": 0.37838385105133054, | |
| "memory(GiB)": 76.07, | |
| "step": 370, | |
| "token_acc": 0.8884803921568627, | |
| "train_speed(iter/s)": 0.014369 | |
| }, | |
| { | |
| "epoch": 0.11999520019199232, | |
| "grad_norm": 0.03318506660752264, | |
| "learning_rate": 1.9594929736144978e-05, | |
| "loss": 0.39080846309661865, | |
| "memory(GiB)": 76.07, | |
| "step": 375, | |
| "token_acc": 0.8838375667367739, | |
| "train_speed(iter/s)": 0.014371 | |
| }, | |
| { | |
| "epoch": 0.12159513619455221, | |
| "grad_norm": 0.032615752382225055, | |
| "learning_rate": 1.958017087284061e-05, | |
| "loss": 0.3769553184509277, | |
| "memory(GiB)": 76.07, | |
| "step": 380, | |
| "token_acc": 0.9018950192855945, | |
| "train_speed(iter/s)": 0.014386 | |
| }, | |
| { | |
| "epoch": 0.12319507219711212, | |
| "grad_norm": 0.03133189034498934, | |
| "learning_rate": 1.9565153687607006e-05, | |
| "loss": 0.3848905563354492, | |
| "memory(GiB)": 76.07, | |
| "step": 385, | |
| "token_acc": 0.8868577075098815, | |
| "train_speed(iter/s)": 0.014386 | |
| }, | |
| { | |
| "epoch": 0.12479500819967201, | |
| "grad_norm": 0.03197313383191992, | |
| "learning_rate": 1.9549878585371006e-05, | |
| "loss": 0.38284108638763426, | |
| "memory(GiB)": 76.07, | |
| "step": 390, | |
| "token_acc": 0.8899135446685879, | |
| "train_speed(iter/s)": 0.014394 | |
| }, | |
| { | |
| "epoch": 0.1263949442022319, | |
| "grad_norm": 0.031847003037153106, | |
| "learning_rate": 1.9534345978013972e-05, | |
| "loss": 0.3859133720397949, | |
| "memory(GiB)": 76.07, | |
| "step": 395, | |
| "token_acc": 0.8742560659240043, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.1279948802047918, | |
| "grad_norm": 0.03422769575373828, | |
| "learning_rate": 1.9518556284360696e-05, | |
| "loss": 0.38266074657440186, | |
| "memory(GiB)": 76.07, | |
| "step": 400, | |
| "token_acc": 0.9119344878507182, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.1295948162073517, | |
| "grad_norm": 0.03221204648449897, | |
| "learning_rate": 1.9502509930168113e-05, | |
| "loss": 0.38048243522644043, | |
| "memory(GiB)": 76.07, | |
| "step": 405, | |
| "token_acc": 0.9020516214427532, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.1311947522099116, | |
| "grad_norm": 0.034549366769104535, | |
| "learning_rate": 1.9486207348113803e-05, | |
| "loss": 0.37532615661621094, | |
| "memory(GiB)": 76.07, | |
| "step": 410, | |
| "token_acc": 0.8943346070775876, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.1327946882124715, | |
| "grad_norm": 0.03556652976821217, | |
| "learning_rate": 1.946964897778433e-05, | |
| "loss": 0.38798692226409914, | |
| "memory(GiB)": 76.07, | |
| "step": 415, | |
| "token_acc": 0.9074051332432764, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.1343946242150314, | |
| "grad_norm": 0.032782000611636754, | |
| "learning_rate": 1.9452835265663404e-05, | |
| "loss": 0.38746092319488523, | |
| "memory(GiB)": 76.07, | |
| "step": 420, | |
| "token_acc": 0.8914526484751204, | |
| "train_speed(iter/s)": 0.014394 | |
| }, | |
| { | |
| "epoch": 0.1359945602175913, | |
| "grad_norm": 0.03634421691537427, | |
| "learning_rate": 1.9435766665119823e-05, | |
| "loss": 0.3850360870361328, | |
| "memory(GiB)": 76.07, | |
| "step": 425, | |
| "token_acc": 0.8656546489563567, | |
| "train_speed(iter/s)": 0.014387 | |
| }, | |
| { | |
| "epoch": 0.13759449622015119, | |
| "grad_norm": 0.03409209090353386, | |
| "learning_rate": 1.941844363639525e-05, | |
| "loss": 0.3924290895462036, | |
| "memory(GiB)": 76.07, | |
| "step": 430, | |
| "token_acc": 0.8879083449450379, | |
| "train_speed(iter/s)": 0.014389 | |
| }, | |
| { | |
| "epoch": 0.13919443222271108, | |
| "grad_norm": 0.03586613576277069, | |
| "learning_rate": 1.9400866646591816e-05, | |
| "loss": 0.3824719667434692, | |
| "memory(GiB)": 76.07, | |
| "step": 435, | |
| "token_acc": 0.8478456014362658, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.140794368225271, | |
| "grad_norm": 0.03612177033189357, | |
| "learning_rate": 1.9383036169659513e-05, | |
| "loss": 0.3880664587020874, | |
| "memory(GiB)": 76.07, | |
| "step": 440, | |
| "token_acc": 0.8917012448132781, | |
| "train_speed(iter/s)": 0.014389 | |
| }, | |
| { | |
| "epoch": 0.1423943042278309, | |
| "grad_norm": 0.03585757877860267, | |
| "learning_rate": 1.936495268638342e-05, | |
| "loss": 0.39356892108917235, | |
| "memory(GiB)": 76.07, | |
| "step": 445, | |
| "token_acc": 0.8592846433925894, | |
| "train_speed(iter/s)": 0.014396 | |
| }, | |
| { | |
| "epoch": 0.14399424023039079, | |
| "grad_norm": 0.032095810341158305, | |
| "learning_rate": 1.934661668437073e-05, | |
| "loss": 0.3881976842880249, | |
| "memory(GiB)": 76.07, | |
| "step": 450, | |
| "token_acc": 0.8775109170305677, | |
| "train_speed(iter/s)": 0.014397 | |
| }, | |
| { | |
| "epoch": 0.14559417623295068, | |
| "grad_norm": 0.035715492914310906, | |
| "learning_rate": 1.932802865803763e-05, | |
| "loss": 0.3885905981063843, | |
| "memory(GiB)": 76.07, | |
| "step": 455, | |
| "token_acc": 0.8691340534797237, | |
| "train_speed(iter/s)": 0.014403 | |
| }, | |
| { | |
| "epoch": 0.14719411223551057, | |
| "grad_norm": 0.03359573622491741, | |
| "learning_rate": 1.930918910859592e-05, | |
| "loss": 0.38143932819366455, | |
| "memory(GiB)": 76.07, | |
| "step": 460, | |
| "token_acc": 0.8709529627367135, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.14879404823807046, | |
| "grad_norm": 0.03406432480471397, | |
| "learning_rate": 1.9290098544039546e-05, | |
| "loss": 0.38104383945465087, | |
| "memory(GiB)": 76.07, | |
| "step": 465, | |
| "token_acc": 0.8818467648518947, | |
| "train_speed(iter/s)": 0.014388 | |
| }, | |
| { | |
| "epoch": 0.15039398424063039, | |
| "grad_norm": 0.0334674901088086, | |
| "learning_rate": 1.927075747913088e-05, | |
| "loss": 0.38691911697387693, | |
| "memory(GiB)": 76.07, | |
| "step": 470, | |
| "token_acc": 0.8903258526689489, | |
| "train_speed(iter/s)": 0.014384 | |
| }, | |
| { | |
| "epoch": 0.15199392024319028, | |
| "grad_norm": 0.03139039879037341, | |
| "learning_rate": 1.9251166435386837e-05, | |
| "loss": 0.3794668197631836, | |
| "memory(GiB)": 76.07, | |
| "step": 475, | |
| "token_acc": 0.881838481577968, | |
| "train_speed(iter/s)": 0.014384 | |
| }, | |
| { | |
| "epoch": 0.15359385624575017, | |
| "grad_norm": 0.032712134906697395, | |
| "learning_rate": 1.923132594106483e-05, | |
| "loss": 0.3873713254928589, | |
| "memory(GiB)": 76.07, | |
| "step": 480, | |
| "token_acc": 0.8821567537520845, | |
| "train_speed(iter/s)": 0.014377 | |
| }, | |
| { | |
| "epoch": 0.15519379224831006, | |
| "grad_norm": 0.035229518924756134, | |
| "learning_rate": 1.92112365311485e-05, | |
| "loss": 0.38217613697052, | |
| "memory(GiB)": 76.07, | |
| "step": 485, | |
| "token_acc": 0.8820149162489301, | |
| "train_speed(iter/s)": 0.014383 | |
| }, | |
| { | |
| "epoch": 0.15679372825086996, | |
| "grad_norm": 0.03274511624533184, | |
| "learning_rate": 1.919089874733332e-05, | |
| "loss": 0.38786864280700684, | |
| "memory(GiB)": 76.07, | |
| "step": 490, | |
| "token_acc": 0.8996381941167217, | |
| "train_speed(iter/s)": 0.014387 | |
| }, | |
| { | |
| "epoch": 0.15839366425342985, | |
| "grad_norm": 0.03284065009666707, | |
| "learning_rate": 1.9170313138011964e-05, | |
| "loss": 0.3825819730758667, | |
| "memory(GiB)": 76.07, | |
| "step": 495, | |
| "token_acc": 0.9057554964290716, | |
| "train_speed(iter/s)": 0.014388 | |
| }, | |
| { | |
| "epoch": 0.15999360025598977, | |
| "grad_norm": 0.03419542960956006, | |
| "learning_rate": 1.9149480258259535e-05, | |
| "loss": 0.38258953094482423, | |
| "memory(GiB)": 76.07, | |
| "step": 500, | |
| "token_acc": 0.8961057623221728, | |
| "train_speed(iter/s)": 0.01439 | |
| }, | |
| { | |
| "epoch": 0.15999360025598977, | |
| "eval_loss": 0.6193732619285583, | |
| "eval_runtime": 168.67, | |
| "eval_samples_per_second": 119.096, | |
| "eval_steps_per_second": 0.599, | |
| "eval_token_acc": 0.8881378895176241, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.16159353625854966, | |
| "grad_norm": 0.03206404175508866, | |
| "learning_rate": 1.9128400669818586e-05, | |
| "loss": 0.3774104118347168, | |
| "memory(GiB)": 76.07, | |
| "step": 505, | |
| "token_acc": 0.8925198620896417, | |
| "train_speed(iter/s)": 0.014323 | |
| }, | |
| { | |
| "epoch": 0.16319347226110956, | |
| "grad_norm": 0.03264569403840349, | |
| "learning_rate": 1.9107074941083987e-05, | |
| "loss": 0.3852546215057373, | |
| "memory(GiB)": 76.07, | |
| "step": 510, | |
| "token_acc": 0.8948775055679288, | |
| "train_speed(iter/s)": 0.014323 | |
| }, | |
| { | |
| "epoch": 0.16479340826366945, | |
| "grad_norm": 0.033527933798423434, | |
| "learning_rate": 1.9085503647087588e-05, | |
| "loss": 0.37959980964660645, | |
| "memory(GiB)": 76.07, | |
| "step": 515, | |
| "token_acc": 0.8879507475813544, | |
| "train_speed(iter/s)": 0.014326 | |
| }, | |
| { | |
| "epoch": 0.16639334426622934, | |
| "grad_norm": 0.03295561806491276, | |
| "learning_rate": 1.906368736948272e-05, | |
| "loss": 0.3861686706542969, | |
| "memory(GiB)": 76.07, | |
| "step": 520, | |
| "token_acc": 0.889853813865972, | |
| "train_speed(iter/s)": 0.014325 | |
| }, | |
| { | |
| "epoch": 0.16799328026878924, | |
| "grad_norm": 0.03184366828026341, | |
| "learning_rate": 1.9041626696528503e-05, | |
| "loss": 0.38342669010162356, | |
| "memory(GiB)": 76.07, | |
| "step": 525, | |
| "token_acc": 0.8992944194996793, | |
| "train_speed(iter/s)": 0.014338 | |
| }, | |
| { | |
| "epoch": 0.16959321627134916, | |
| "grad_norm": 0.033738127296183994, | |
| "learning_rate": 1.9019322223073997e-05, | |
| "loss": 0.3832501173019409, | |
| "memory(GiB)": 76.56, | |
| "step": 530, | |
| "token_acc": 0.9125608082823999, | |
| "train_speed(iter/s)": 0.014338 | |
| }, | |
| { | |
| "epoch": 0.17119315227390905, | |
| "grad_norm": 0.0333234741433263, | |
| "learning_rate": 1.899677455054215e-05, | |
| "loss": 0.38559613227844236, | |
| "memory(GiB)": 76.56, | |
| "step": 535, | |
| "token_acc": 0.8407811400422238, | |
| "train_speed(iter/s)": 0.014346 | |
| }, | |
| { | |
| "epoch": 0.17279308827646894, | |
| "grad_norm": 0.03099693893435516, | |
| "learning_rate": 1.8973984286913584e-05, | |
| "loss": 0.38624236583709715, | |
| "memory(GiB)": 76.56, | |
| "step": 540, | |
| "token_acc": 0.9047673619069447, | |
| "train_speed(iter/s)": 0.014351 | |
| }, | |
| { | |
| "epoch": 0.17439302427902884, | |
| "grad_norm": 0.03564589208589755, | |
| "learning_rate": 1.895095204671021e-05, | |
| "loss": 0.3812048673629761, | |
| "memory(GiB)": 76.56, | |
| "step": 545, | |
| "token_acc": 0.9132128940843075, | |
| "train_speed(iter/s)": 0.014351 | |
| }, | |
| { | |
| "epoch": 0.17599296028158873, | |
| "grad_norm": 0.03306838339780197, | |
| "learning_rate": 1.892767845097864e-05, | |
| "loss": 0.38694233894348146, | |
| "memory(GiB)": 76.56, | |
| "step": 550, | |
| "token_acc": 0.8896024995660475, | |
| "train_speed(iter/s)": 0.014362 | |
| }, | |
| { | |
| "epoch": 0.17759289628414862, | |
| "grad_norm": 0.03511437169806579, | |
| "learning_rate": 1.890416412727346e-05, | |
| "loss": 0.3801495790481567, | |
| "memory(GiB)": 76.56, | |
| "step": 555, | |
| "token_acc": 0.8592943801422396, | |
| "train_speed(iter/s)": 0.01437 | |
| }, | |
| { | |
| "epoch": 0.17919283228670854, | |
| "grad_norm": 0.033895161074874745, | |
| "learning_rate": 1.88804097096403e-05, | |
| "loss": 0.37548644542694093, | |
| "memory(GiB)": 76.56, | |
| "step": 560, | |
| "token_acc": 0.9068198850861854, | |
| "train_speed(iter/s)": 0.014382 | |
| }, | |
| { | |
| "epoch": 0.18079276828926844, | |
| "grad_norm": 0.033440476927491095, | |
| "learning_rate": 1.8856415838598738e-05, | |
| "loss": 0.3744084596633911, | |
| "memory(GiB)": 76.56, | |
| "step": 565, | |
| "token_acc": 0.8932863323185387, | |
| "train_speed(iter/s)": 0.01439 | |
| }, | |
| { | |
| "epoch": 0.18239270429182833, | |
| "grad_norm": 0.035885470124335045, | |
| "learning_rate": 1.8832183161125026e-05, | |
| "loss": 0.3785930395126343, | |
| "memory(GiB)": 76.56, | |
| "step": 570, | |
| "token_acc": 0.848502994011976, | |
| "train_speed(iter/s)": 0.014392 | |
| }, | |
| { | |
| "epoch": 0.18399264029438822, | |
| "grad_norm": 0.03324044359853696, | |
| "learning_rate": 1.8807712330634645e-05, | |
| "loss": 0.3850206136703491, | |
| "memory(GiB)": 76.56, | |
| "step": 575, | |
| "token_acc": 0.9094766619519095, | |
| "train_speed(iter/s)": 0.014389 | |
| }, | |
| { | |
| "epoch": 0.18559257629694811, | |
| "grad_norm": 0.03263482668047798, | |
| "learning_rate": 1.87830040069647e-05, | |
| "loss": 0.37779667377471926, | |
| "memory(GiB)": 76.56, | |
| "step": 580, | |
| "token_acc": 0.9197788863421869, | |
| "train_speed(iter/s)": 0.014394 | |
| }, | |
| { | |
| "epoch": 0.187192512299508, | |
| "grad_norm": 0.03550703857977458, | |
| "learning_rate": 1.87580588563561e-05, | |
| "loss": 0.3798608541488647, | |
| "memory(GiB)": 76.56, | |
| "step": 585, | |
| "token_acc": 0.8933184500079732, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.18879244830206793, | |
| "grad_norm": 0.03391669539615144, | |
| "learning_rate": 1.873287755143563e-05, | |
| "loss": 0.3751659393310547, | |
| "memory(GiB)": 76.56, | |
| "step": 590, | |
| "token_acc": 0.9166312809624911, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.19039238430462782, | |
| "grad_norm": 0.03459224478752944, | |
| "learning_rate": 1.8707460771197773e-05, | |
| "loss": 0.38129582405090334, | |
| "memory(GiB)": 76.56, | |
| "step": 595, | |
| "token_acc": 0.9053976730879267, | |
| "train_speed(iter/s)": 0.014401 | |
| }, | |
| { | |
| "epoch": 0.1919923203071877, | |
| "grad_norm": 0.03339910116296889, | |
| "learning_rate": 1.868180920098644e-05, | |
| "loss": 0.38383800983428956, | |
| "memory(GiB)": 76.56, | |
| "step": 600, | |
| "token_acc": 0.872634898388227, | |
| "train_speed(iter/s)": 0.014405 | |
| }, | |
| { | |
| "epoch": 0.1935922563097476, | |
| "grad_norm": 0.033692221359167995, | |
| "learning_rate": 1.8655923532476463e-05, | |
| "loss": 0.3776890516281128, | |
| "memory(GiB)": 76.56, | |
| "step": 605, | |
| "token_acc": 0.9167274052478134, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.1951921923123075, | |
| "grad_norm": 0.0332686161147481, | |
| "learning_rate": 1.8629804463654956e-05, | |
| "loss": 0.3806722402572632, | |
| "memory(GiB)": 76.56, | |
| "step": 610, | |
| "token_acc": 0.8899387576552931, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.1967921283148674, | |
| "grad_norm": 0.034972178070293056, | |
| "learning_rate": 1.8603452698802498e-05, | |
| "loss": 0.38915410041809084, | |
| "memory(GiB)": 77.28, | |
| "step": 615, | |
| "token_acc": 0.8858360966366651, | |
| "train_speed(iter/s)": 0.014415 | |
| }, | |
| { | |
| "epoch": 0.1983920643174273, | |
| "grad_norm": 0.032230881125325274, | |
| "learning_rate": 1.857686894847413e-05, | |
| "loss": 0.37490866184234617, | |
| "memory(GiB)": 77.28, | |
| "step": 620, | |
| "token_acc": 0.8671481128219103, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.1999920003199872, | |
| "grad_norm": 0.03461719194107402, | |
| "learning_rate": 1.8550053929480202e-05, | |
| "loss": 0.3814939737319946, | |
| "memory(GiB)": 77.28, | |
| "step": 625, | |
| "token_acc": 0.9177888022678952, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.2015919363225471, | |
| "grad_norm": 0.03369236467656219, | |
| "learning_rate": 1.8523008364867056e-05, | |
| "loss": 0.38451409339904785, | |
| "memory(GiB)": 77.28, | |
| "step": 630, | |
| "token_acc": 0.870737913486005, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.203191872325107, | |
| "grad_norm": 0.03255294220837347, | |
| "learning_rate": 1.8495732983897504e-05, | |
| "loss": 0.37762107849121096, | |
| "memory(GiB)": 77.28, | |
| "step": 635, | |
| "token_acc": 0.8674445294567712, | |
| "train_speed(iter/s)": 0.014415 | |
| }, | |
| { | |
| "epoch": 0.20479180832766689, | |
| "grad_norm": 0.03474015187119267, | |
| "learning_rate": 1.8468228522031197e-05, | |
| "loss": 0.3729959726333618, | |
| "memory(GiB)": 77.28, | |
| "step": 640, | |
| "token_acc": 0.8980558325024925, | |
| "train_speed(iter/s)": 0.014415 | |
| }, | |
| { | |
| "epoch": 0.20639174433022678, | |
| "grad_norm": 0.034565861862923035, | |
| "learning_rate": 1.8440495720904758e-05, | |
| "loss": 0.380579400062561, | |
| "memory(GiB)": 77.28, | |
| "step": 645, | |
| "token_acc": 0.8993572889278411, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.2079916803327867, | |
| "grad_norm": 0.03667995528577527, | |
| "learning_rate": 1.8412535328311813e-05, | |
| "loss": 0.3839728593826294, | |
| "memory(GiB)": 77.28, | |
| "step": 650, | |
| "token_acc": 0.8749459108610991, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.2095916163353466, | |
| "grad_norm": 0.03454743457582257, | |
| "learning_rate": 1.8384348098182815e-05, | |
| "loss": 0.3817548990249634, | |
| "memory(GiB)": 77.28, | |
| "step": 655, | |
| "token_acc": 0.838635049161365, | |
| "train_speed(iter/s)": 0.014414 | |
| }, | |
| { | |
| "epoch": 0.21119155233790649, | |
| "grad_norm": 0.03545621066201229, | |
| "learning_rate": 1.8355934790564718e-05, | |
| "loss": 0.38348143100738524, | |
| "memory(GiB)": 77.28, | |
| "step": 660, | |
| "token_acc": 0.905241935483871, | |
| "train_speed(iter/s)": 0.014419 | |
| }, | |
| { | |
| "epoch": 0.21279148834046638, | |
| "grad_norm": 0.03572649708176257, | |
| "learning_rate": 1.832729617160047e-05, | |
| "loss": 0.3777714967727661, | |
| "memory(GiB)": 77.28, | |
| "step": 665, | |
| "token_acc": 0.9266425992779783, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.21439142434302627, | |
| "grad_norm": 0.033679470408814874, | |
| "learning_rate": 1.8298433013508384e-05, | |
| "loss": 0.38007168769836425, | |
| "memory(GiB)": 77.28, | |
| "step": 670, | |
| "token_acc": 0.8724329548200048, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.21599136034558616, | |
| "grad_norm": 0.034843072179395064, | |
| "learning_rate": 1.826934609456129e-05, | |
| "loss": 0.3841479063034058, | |
| "memory(GiB)": 77.28, | |
| "step": 675, | |
| "token_acc": 0.9051177216974482, | |
| "train_speed(iter/s)": 0.014421 | |
| }, | |
| { | |
| "epoch": 0.21759129634814608, | |
| "grad_norm": 0.0365705080123855, | |
| "learning_rate": 1.8240036199065546e-05, | |
| "loss": 0.38644914627075194, | |
| "memory(GiB)": 77.28, | |
| "step": 680, | |
| "token_acc": 0.8996160175534833, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.21919123235070598, | |
| "grad_norm": 0.03502298426190971, | |
| "learning_rate": 1.8210504117339917e-05, | |
| "loss": 0.38111186027526855, | |
| "memory(GiB)": 77.28, | |
| "step": 685, | |
| "token_acc": 0.9016673362796304, | |
| "train_speed(iter/s)": 0.014421 | |
| }, | |
| { | |
| "epoch": 0.22079116835326587, | |
| "grad_norm": 0.03495070664363774, | |
| "learning_rate": 1.8180750645694236e-05, | |
| "loss": 0.3825707912445068, | |
| "memory(GiB)": 77.28, | |
| "step": 690, | |
| "token_acc": 0.889507494646681, | |
| "train_speed(iter/s)": 0.014427 | |
| }, | |
| { | |
| "epoch": 0.22239110435582576, | |
| "grad_norm": 0.03462540294483746, | |
| "learning_rate": 1.8150776586407957e-05, | |
| "loss": 0.3783039808273315, | |
| "memory(GiB)": 77.28, | |
| "step": 695, | |
| "token_acc": 0.912316715542522, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.22399104035838566, | |
| "grad_norm": 0.03365404014142329, | |
| "learning_rate": 1.8120582747708503e-05, | |
| "loss": 0.3824033498764038, | |
| "memory(GiB)": 77.28, | |
| "step": 700, | |
| "token_acc": 0.8982280781462971, | |
| "train_speed(iter/s)": 0.014425 | |
| }, | |
| { | |
| "epoch": 0.22559097636094555, | |
| "grad_norm": 0.03525313113291282, | |
| "learning_rate": 1.8090169943749477e-05, | |
| "loss": 0.3850820779800415, | |
| "memory(GiB)": 77.28, | |
| "step": 705, | |
| "token_acc": 0.8981919931123548, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.22719091236350547, | |
| "grad_norm": 0.03679372138793972, | |
| "learning_rate": 1.8059538994588715e-05, | |
| "loss": 0.3753945827484131, | |
| "memory(GiB)": 77.28, | |
| "step": 710, | |
| "token_acc": 0.8688331368917326, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.22879084836606536, | |
| "grad_norm": 0.034266978650896916, | |
| "learning_rate": 1.8028690726166172e-05, | |
| "loss": 0.37668046951293943, | |
| "memory(GiB)": 77.28, | |
| "step": 715, | |
| "token_acc": 0.8903355032548823, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.23039078436862526, | |
| "grad_norm": 0.036082400513325966, | |
| "learning_rate": 1.7997625970281652e-05, | |
| "loss": 0.3769336223602295, | |
| "memory(GiB)": 77.28, | |
| "step": 720, | |
| "token_acc": 0.9020576131687242, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.23199072037118515, | |
| "grad_norm": 0.03522824011355726, | |
| "learning_rate": 1.796634556457236e-05, | |
| "loss": 0.38350567817687986, | |
| "memory(GiB)": 77.28, | |
| "step": 725, | |
| "token_acc": 0.9060884549109707, | |
| "train_speed(iter/s)": 0.014425 | |
| }, | |
| { | |
| "epoch": 0.23359065637374504, | |
| "grad_norm": 0.03384650643032488, | |
| "learning_rate": 1.793485035249036e-05, | |
| "loss": 0.3775055408477783, | |
| "memory(GiB)": 77.28, | |
| "step": 730, | |
| "token_acc": 0.8859484777517564, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.23519059237630494, | |
| "grad_norm": 0.03311621627978966, | |
| "learning_rate": 1.7903141183279776e-05, | |
| "loss": 0.3862148284912109, | |
| "memory(GiB)": 77.28, | |
| "step": 735, | |
| "token_acc": 0.8621900826446282, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.23679052837886486, | |
| "grad_norm": 0.03335783787305468, | |
| "learning_rate": 1.7871218911953942e-05, | |
| "loss": 0.37302775382995607, | |
| "memory(GiB)": 77.28, | |
| "step": 740, | |
| "token_acc": 0.8644029170464904, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.23839046438142475, | |
| "grad_norm": 0.03535545477880254, | |
| "learning_rate": 1.7839084399272317e-05, | |
| "loss": 0.3812894821166992, | |
| "memory(GiB)": 77.28, | |
| "step": 745, | |
| "token_acc": 0.8859926610148045, | |
| "train_speed(iter/s)": 0.014425 | |
| }, | |
| { | |
| "epoch": 0.23999040038398464, | |
| "grad_norm": 0.03536304324563333, | |
| "learning_rate": 1.780673851171728e-05, | |
| "loss": 0.38368926048278806, | |
| "memory(GiB)": 77.28, | |
| "step": 750, | |
| "token_acc": 0.915541118139853, | |
| "train_speed(iter/s)": 0.014421 | |
| }, | |
| { | |
| "epoch": 0.23999040038398464, | |
| "eval_loss": 0.6164008378982544, | |
| "eval_runtime": 169.1145, | |
| "eval_samples_per_second": 118.783, | |
| "eval_steps_per_second": 0.597, | |
| "eval_token_acc": 0.8890133389641892, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.24159033638654454, | |
| "grad_norm": 0.03680542582321454, | |
| "learning_rate": 1.777418212147079e-05, | |
| "loss": 0.3746520519256592, | |
| "memory(GiB)": 77.28, | |
| "step": 755, | |
| "token_acc": 0.906258484930763, | |
| "train_speed(iter/s)": 0.014378 | |
| }, | |
| { | |
| "epoch": 0.24319027238910443, | |
| "grad_norm": 0.03617919710711229, | |
| "learning_rate": 1.7741416106390828e-05, | |
| "loss": 0.37985007762908934, | |
| "memory(GiB)": 77.28, | |
| "step": 760, | |
| "token_acc": 0.9109599395313681, | |
| "train_speed(iter/s)": 0.014379 | |
| }, | |
| { | |
| "epoch": 0.24479020839166432, | |
| "grad_norm": 0.03522579073367174, | |
| "learning_rate": 1.7708441349987753e-05, | |
| "loss": 0.3773144960403442, | |
| "memory(GiB)": 77.28, | |
| "step": 765, | |
| "token_acc": 0.8976910828025477, | |
| "train_speed(iter/s)": 0.014379 | |
| }, | |
| { | |
| "epoch": 0.24639014439422424, | |
| "grad_norm": 0.035862654993067136, | |
| "learning_rate": 1.767525874140048e-05, | |
| "loss": 0.38391575813293455, | |
| "memory(GiB)": 77.28, | |
| "step": 770, | |
| "token_acc": 0.8621361746361746, | |
| "train_speed(iter/s)": 0.014384 | |
| }, | |
| { | |
| "epoch": 0.24799008039678413, | |
| "grad_norm": 0.03436492411019931, | |
| "learning_rate": 1.7641869175372493e-05, | |
| "loss": 0.3757505416870117, | |
| "memory(GiB)": 77.28, | |
| "step": 775, | |
| "token_acc": 0.8865568083261058, | |
| "train_speed(iter/s)": 0.014384 | |
| }, | |
| { | |
| "epoch": 0.24959001639934403, | |
| "grad_norm": 0.03460527205552933, | |
| "learning_rate": 1.7608273552227723e-05, | |
| "loss": 0.3736558437347412, | |
| "memory(GiB)": 77.28, | |
| "step": 780, | |
| "token_acc": 0.9036800600826136, | |
| "train_speed(iter/s)": 0.014387 | |
| }, | |
| { | |
| "epoch": 0.25118995240190395, | |
| "grad_norm": 0.032946309550249894, | |
| "learning_rate": 1.7574472777846276e-05, | |
| "loss": 0.3870768308639526, | |
| "memory(GiB)": 77.28, | |
| "step": 785, | |
| "token_acc": 0.8922848664688428, | |
| "train_speed(iter/s)": 0.014391 | |
| }, | |
| { | |
| "epoch": 0.2527898884044638, | |
| "grad_norm": 0.033912193247707154, | |
| "learning_rate": 1.7540467763639994e-05, | |
| "loss": 0.3805867910385132, | |
| "memory(GiB)": 77.28, | |
| "step": 790, | |
| "token_acc": 0.8922994076467421, | |
| "train_speed(iter/s)": 0.014395 | |
| }, | |
| { | |
| "epoch": 0.25438982440702373, | |
| "grad_norm": 0.03576586207074456, | |
| "learning_rate": 1.7506259426527903e-05, | |
| "loss": 0.3851534128189087, | |
| "memory(GiB)": 77.28, | |
| "step": 795, | |
| "token_acc": 0.9005177922220998, | |
| "train_speed(iter/s)": 0.014396 | |
| }, | |
| { | |
| "epoch": 0.2559897604095836, | |
| "grad_norm": 0.03520759857550378, | |
| "learning_rate": 1.7471848688911465e-05, | |
| "loss": 0.3831015586853027, | |
| "memory(GiB)": 77.28, | |
| "step": 800, | |
| "token_acc": 0.9037107258938245, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.2575896964121435, | |
| "grad_norm": 0.0354593082946657, | |
| "learning_rate": 1.7437236478649718e-05, | |
| "loss": 0.37855699062347414, | |
| "memory(GiB)": 77.28, | |
| "step": 805, | |
| "token_acc": 0.8879225143308954, | |
| "train_speed(iter/s)": 0.014398 | |
| }, | |
| { | |
| "epoch": 0.2591896324147034, | |
| "grad_norm": 0.0337808522927956, | |
| "learning_rate": 1.7402423729034252e-05, | |
| "loss": 0.3711889982223511, | |
| "memory(GiB)": 77.28, | |
| "step": 810, | |
| "token_acc": 0.8532670454545455, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.2607895684172633, | |
| "grad_norm": 0.03492768229901829, | |
| "learning_rate": 1.736741137876405e-05, | |
| "loss": 0.3790097951889038, | |
| "memory(GiB)": 77.28, | |
| "step": 815, | |
| "token_acc": 0.9026868367577331, | |
| "train_speed(iter/s)": 0.014404 | |
| }, | |
| { | |
| "epoch": 0.2623895044198232, | |
| "grad_norm": 0.034967340753827056, | |
| "learning_rate": 1.7332200371920173e-05, | |
| "loss": 0.38438780307769777, | |
| "memory(GiB)": 77.28, | |
| "step": 820, | |
| "token_acc": 0.8772080999569152, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.2639894404223831, | |
| "grad_norm": 0.034264119000574224, | |
| "learning_rate": 1.72967916579403e-05, | |
| "loss": 0.37496380805969237, | |
| "memory(GiB)": 77.28, | |
| "step": 825, | |
| "token_acc": 0.8874313065059387, | |
| "train_speed(iter/s)": 0.014415 | |
| }, | |
| { | |
| "epoch": 0.265589376424943, | |
| "grad_norm": 0.033897273321268885, | |
| "learning_rate": 1.7261186191593135e-05, | |
| "loss": 0.3849215269088745, | |
| "memory(GiB)": 77.28, | |
| "step": 830, | |
| "token_acc": 0.8913907284768212, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.2671893124275029, | |
| "grad_norm": 0.03586062681802787, | |
| "learning_rate": 1.7225384932952655e-05, | |
| "loss": 0.3776970148086548, | |
| "memory(GiB)": 77.28, | |
| "step": 835, | |
| "token_acc": 0.8961673537944724, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.2687892484300628, | |
| "grad_norm": 0.03463767475104641, | |
| "learning_rate": 1.7189388847372227e-05, | |
| "loss": 0.3832270622253418, | |
| "memory(GiB)": 77.28, | |
| "step": 840, | |
| "token_acc": 0.8957481602616517, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.2703891844326227, | |
| "grad_norm": 0.03322572736677012, | |
| "learning_rate": 1.715319890545857e-05, | |
| "loss": 0.373725152015686, | |
| "memory(GiB)": 77.28, | |
| "step": 845, | |
| "token_acc": 0.87657254682695, | |
| "train_speed(iter/s)": 0.014419 | |
| }, | |
| { | |
| "epoch": 0.2719891204351826, | |
| "grad_norm": 0.03432594388504518, | |
| "learning_rate": 1.7116816083045603e-05, | |
| "loss": 0.38315093517303467, | |
| "memory(GiB)": 77.28, | |
| "step": 850, | |
| "token_acc": 0.8969713732540451, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.2735890564377425, | |
| "grad_norm": 0.0333573566270864, | |
| "learning_rate": 1.7080241361168108e-05, | |
| "loss": 0.3734123229980469, | |
| "memory(GiB)": 77.28, | |
| "step": 855, | |
| "token_acc": 0.8995640238979493, | |
| "train_speed(iter/s)": 0.014422 | |
| }, | |
| { | |
| "epoch": 0.27518899244030237, | |
| "grad_norm": 0.03455173370569199, | |
| "learning_rate": 1.704347572603529e-05, | |
| "loss": 0.38244330883026123, | |
| "memory(GiB)": 77.28, | |
| "step": 860, | |
| "token_acc": 0.8684960263907633, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.2767889284428623, | |
| "grad_norm": 0.035362819343963146, | |
| "learning_rate": 1.700652016900419e-05, | |
| "loss": 0.38104417324066164, | |
| "memory(GiB)": 77.28, | |
| "step": 865, | |
| "token_acc": 0.8948292371528886, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.27838886444542216, | |
| "grad_norm": 0.034943075348089055, | |
| "learning_rate": 1.696937568655294e-05, | |
| "loss": 0.375447678565979, | |
| "memory(GiB)": 77.28, | |
| "step": 870, | |
| "token_acc": 0.8895320791123975, | |
| "train_speed(iter/s)": 0.014425 | |
| }, | |
| { | |
| "epoch": 0.2799888004479821, | |
| "grad_norm": 0.03518132486138768, | |
| "learning_rate": 1.6932043280253892e-05, | |
| "loss": 0.3870342969894409, | |
| "memory(GiB)": 77.28, | |
| "step": 875, | |
| "token_acc": 0.8991515927645269, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.281588736450542, | |
| "grad_norm": 0.03358472672640051, | |
| "learning_rate": 1.689452395674664e-05, | |
| "loss": 0.3791643619537354, | |
| "memory(GiB)": 77.28, | |
| "step": 880, | |
| "token_acc": 0.882903981264637, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.28318867245310186, | |
| "grad_norm": 0.0335812057163469, | |
| "learning_rate": 1.6856818727710847e-05, | |
| "loss": 0.37133069038391114, | |
| "memory(GiB)": 77.28, | |
| "step": 885, | |
| "token_acc": 0.8640576725025747, | |
| "train_speed(iter/s)": 0.014429 | |
| }, | |
| { | |
| "epoch": 0.2847886084556618, | |
| "grad_norm": 0.033689064925450846, | |
| "learning_rate": 1.6818928609838967e-05, | |
| "loss": 0.3744334697723389, | |
| "memory(GiB)": 77.28, | |
| "step": 890, | |
| "token_acc": 0.904192992533027, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.28638854445822165, | |
| "grad_norm": 0.03324735662329384, | |
| "learning_rate": 1.678085462480885e-05, | |
| "loss": 0.3733969688415527, | |
| "memory(GiB)": 77.28, | |
| "step": 895, | |
| "token_acc": 0.8976343135087331, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.28798848046078157, | |
| "grad_norm": 0.034296406767401026, | |
| "learning_rate": 1.6742597799256182e-05, | |
| "loss": 0.37558152675628664, | |
| "memory(GiB)": 77.28, | |
| "step": 900, | |
| "token_acc": 0.9029866553696251, | |
| "train_speed(iter/s)": 0.014431 | |
| }, | |
| { | |
| "epoch": 0.2895884164633415, | |
| "grad_norm": 0.037582572024316786, | |
| "learning_rate": 1.6704159164746797e-05, | |
| "loss": 0.3907860040664673, | |
| "memory(GiB)": 77.28, | |
| "step": 905, | |
| "token_acc": 0.9069654950016124, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.29118835246590136, | |
| "grad_norm": 0.033743665763862556, | |
| "learning_rate": 1.6665539757748866e-05, | |
| "loss": 0.373353385925293, | |
| "memory(GiB)": 77.28, | |
| "step": 910, | |
| "token_acc": 0.8887350534927627, | |
| "train_speed(iter/s)": 0.014432 | |
| }, | |
| { | |
| "epoch": 0.2927882884684613, | |
| "grad_norm": 0.03614831200848796, | |
| "learning_rate": 1.6626740619604967e-05, | |
| "loss": 0.37723698616027834, | |
| "memory(GiB)": 77.28, | |
| "step": 915, | |
| "token_acc": 0.8396020383402086, | |
| "train_speed(iter/s)": 0.014431 | |
| }, | |
| { | |
| "epoch": 0.29438822447102114, | |
| "grad_norm": 0.0345492804244864, | |
| "learning_rate": 1.658776279650397e-05, | |
| "loss": 0.38145616054534914, | |
| "memory(GiB)": 77.28, | |
| "step": 920, | |
| "token_acc": 0.9019520851818988, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.29598816047358106, | |
| "grad_norm": 0.03512572590148749, | |
| "learning_rate": 1.6548607339452853e-05, | |
| "loss": 0.37775335311889646, | |
| "memory(GiB)": 77.28, | |
| "step": 925, | |
| "token_acc": 0.897300230633564, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.29758809647614093, | |
| "grad_norm": 0.0369285958635259, | |
| "learning_rate": 1.6509275304248366e-05, | |
| "loss": 0.3776986837387085, | |
| "memory(GiB)": 77.28, | |
| "step": 930, | |
| "token_acc": 0.8829104695246428, | |
| "train_speed(iter/s)": 0.014433 | |
| }, | |
| { | |
| "epoch": 0.29918803247870085, | |
| "grad_norm": 0.03462506767370347, | |
| "learning_rate": 1.6469767751448538e-05, | |
| "loss": 0.3799281597137451, | |
| "memory(GiB)": 77.28, | |
| "step": 935, | |
| "token_acc": 0.8700686947988224, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.30078796848126077, | |
| "grad_norm": 0.03338974052579205, | |
| "learning_rate": 1.6430085746344107e-05, | |
| "loss": 0.37139339447021485, | |
| "memory(GiB)": 77.28, | |
| "step": 940, | |
| "token_acc": 0.8986585010207058, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.30238790448382064, | |
| "grad_norm": 0.03046768581019517, | |
| "learning_rate": 1.639023035892978e-05, | |
| "loss": 0.36957426071166993, | |
| "memory(GiB)": 77.28, | |
| "step": 945, | |
| "token_acc": 0.9041682898324893, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.30398784048638056, | |
| "grad_norm": 0.03387287029515358, | |
| "learning_rate": 1.6350202663875385e-05, | |
| "loss": 0.3741326808929443, | |
| "memory(GiB)": 77.28, | |
| "step": 950, | |
| "token_acc": 0.887836853605244, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.3055877764889404, | |
| "grad_norm": 0.03266389732849567, | |
| "learning_rate": 1.6310003740496887e-05, | |
| "loss": 0.37487266063690183, | |
| "memory(GiB)": 77.28, | |
| "step": 955, | |
| "token_acc": 0.8825019485580671, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.30718771249150034, | |
| "grad_norm": 0.03351674125437608, | |
| "learning_rate": 1.6269634672727296e-05, | |
| "loss": 0.37188766002655027, | |
| "memory(GiB)": 77.28, | |
| "step": 960, | |
| "token_acc": 0.900720576461169, | |
| "train_speed(iter/s)": 0.014434 | |
| }, | |
| { | |
| "epoch": 0.30878764849406026, | |
| "grad_norm": 0.031488337411913495, | |
| "learning_rate": 1.6229096549087434e-05, | |
| "loss": 0.3766692399978638, | |
| "memory(GiB)": 77.28, | |
| "step": 965, | |
| "token_acc": 0.8986156351791531, | |
| "train_speed(iter/s)": 0.014434 | |
| }, | |
| { | |
| "epoch": 0.31038758449662013, | |
| "grad_norm": 0.03332048991285344, | |
| "learning_rate": 1.618839046265658e-05, | |
| "loss": 0.3791315793991089, | |
| "memory(GiB)": 77.28, | |
| "step": 970, | |
| "token_acc": 0.8830157184587565, | |
| "train_speed(iter/s)": 0.014434 | |
| }, | |
| { | |
| "epoch": 0.31198752049918005, | |
| "grad_norm": 0.03451155538352893, | |
| "learning_rate": 1.614751751104301e-05, | |
| "loss": 0.3785123825073242, | |
| "memory(GiB)": 77.28, | |
| "step": 975, | |
| "token_acc": 0.8958753965964811, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.3135874565017399, | |
| "grad_norm": 0.033059221136730675, | |
| "learning_rate": 1.6106478796354382e-05, | |
| "loss": 0.37357268333435056, | |
| "memory(GiB)": 77.28, | |
| "step": 980, | |
| "token_acc": 0.9054635545703481, | |
| "train_speed(iter/s)": 0.014433 | |
| }, | |
| { | |
| "epoch": 0.31518739250429983, | |
| "grad_norm": 0.037287525323499084, | |
| "learning_rate": 1.6065275425168034e-05, | |
| "loss": 0.37153091430664065, | |
| "memory(GiB)": 77.28, | |
| "step": 985, | |
| "token_acc": 0.9115008156606852, | |
| "train_speed(iter/s)": 0.014434 | |
| }, | |
| { | |
| "epoch": 0.3167873285068597, | |
| "grad_norm": 0.033380291242419424, | |
| "learning_rate": 1.602390850850113e-05, | |
| "loss": 0.3818410634994507, | |
| "memory(GiB)": 77.28, | |
| "step": 990, | |
| "token_acc": 0.8696263559662515, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.3183872645094196, | |
| "grad_norm": 0.03439438956072722, | |
| "learning_rate": 1.5982379161780722e-05, | |
| "loss": 0.366620135307312, | |
| "memory(GiB)": 77.28, | |
| "step": 995, | |
| "token_acc": 0.8729515742957098, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.31998720051197954, | |
| "grad_norm": 0.034020697710137944, | |
| "learning_rate": 1.5940688504813664e-05, | |
| "loss": 0.3724443197250366, | |
| "memory(GiB)": 77.28, | |
| "step": 1000, | |
| "token_acc": 0.9151111111111111, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.31998720051197954, | |
| "eval_loss": 0.6141124963760376, | |
| "eval_runtime": 158.9547, | |
| "eval_samples_per_second": 126.376, | |
| "eval_steps_per_second": 0.635, | |
| "eval_token_acc": 0.8899123960362797, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.3215871365145394, | |
| "grad_norm": 0.033011811195180485, | |
| "learning_rate": 1.5898837661756405e-05, | |
| "loss": 0.37675890922546384, | |
| "memory(GiB)": 77.28, | |
| "step": 1005, | |
| "token_acc": 0.9039758494444088, | |
| "train_speed(iter/s)": 0.014394 | |
| }, | |
| { | |
| "epoch": 0.3231870725170993, | |
| "grad_norm": 0.035486853244652936, | |
| "learning_rate": 1.5856827761084698e-05, | |
| "loss": 0.36834869384765623, | |
| "memory(GiB)": 77.28, | |
| "step": 1010, | |
| "token_acc": 0.8983255653374763, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.3247870085196592, | |
| "grad_norm": 0.03406105920529523, | |
| "learning_rate": 1.5814659935563165e-05, | |
| "loss": 0.3808779239654541, | |
| "memory(GiB)": 77.28, | |
| "step": 1015, | |
| "token_acc": 0.8966199971715457, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.3263869445222191, | |
| "grad_norm": 0.03308081465556082, | |
| "learning_rate": 1.577233532221474e-05, | |
| "loss": 0.37457520961761476, | |
| "memory(GiB)": 77.28, | |
| "step": 1020, | |
| "token_acc": 0.8870108821486455, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.32798688052477903, | |
| "grad_norm": 0.033407344837741056, | |
| "learning_rate": 1.5729855062290024e-05, | |
| "loss": 0.3800173044204712, | |
| "memory(GiB)": 77.28, | |
| "step": 1025, | |
| "token_acc": 0.8932816214187413, | |
| "train_speed(iter/s)": 0.014398 | |
| }, | |
| { | |
| "epoch": 0.3295868165273389, | |
| "grad_norm": 0.03687625272041186, | |
| "learning_rate": 1.568722030123651e-05, | |
| "loss": 0.3687458515167236, | |
| "memory(GiB)": 77.28, | |
| "step": 1030, | |
| "token_acc": 0.8835139318885449, | |
| "train_speed(iter/s)": 0.014397 | |
| }, | |
| { | |
| "epoch": 0.3311867525298988, | |
| "grad_norm": 0.03432528592893544, | |
| "learning_rate": 1.5644432188667695e-05, | |
| "loss": 0.3709027528762817, | |
| "memory(GiB)": 77.28, | |
| "step": 1035, | |
| "token_acc": 0.8903526550466153, | |
| "train_speed(iter/s)": 0.014398 | |
| }, | |
| { | |
| "epoch": 0.3327866885324587, | |
| "grad_norm": 0.03319653665975899, | |
| "learning_rate": 1.5601491878332077e-05, | |
| "loss": 0.3777631759643555, | |
| "memory(GiB)": 77.28, | |
| "step": 1040, | |
| "token_acc": 0.8910492205289893, | |
| "train_speed(iter/s)": 0.014398 | |
| }, | |
| { | |
| "epoch": 0.3343866245350186, | |
| "grad_norm": 0.034202821127900754, | |
| "learning_rate": 1.5558400528082057e-05, | |
| "loss": 0.3790686845779419, | |
| "memory(GiB)": 77.28, | |
| "step": 1045, | |
| "token_acc": 0.9055801594331266, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.33598656053757847, | |
| "grad_norm": 0.03691156666887596, | |
| "learning_rate": 1.551515929984271e-05, | |
| "loss": 0.3713582992553711, | |
| "memory(GiB)": 77.28, | |
| "step": 1050, | |
| "token_acc": 0.9086751254057244, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.3375864965401384, | |
| "grad_norm": 0.03449412127363822, | |
| "learning_rate": 1.547176935958044e-05, | |
| "loss": 0.3742972373962402, | |
| "memory(GiB)": 77.28, | |
| "step": 1055, | |
| "token_acc": 0.8761001100110011, | |
| "train_speed(iter/s)": 0.014401 | |
| }, | |
| { | |
| "epoch": 0.3391864325426983, | |
| "grad_norm": 0.03434565900369347, | |
| "learning_rate": 1.5428231877271584e-05, | |
| "loss": 0.3786214828491211, | |
| "memory(GiB)": 77.28, | |
| "step": 1060, | |
| "token_acc": 0.871280724450194, | |
| "train_speed(iter/s)": 0.014397 | |
| }, | |
| { | |
| "epoch": 0.3407863685452582, | |
| "grad_norm": 0.033670135783735435, | |
| "learning_rate": 1.538454802687081e-05, | |
| "loss": 0.3775958776473999, | |
| "memory(GiB)": 77.28, | |
| "step": 1065, | |
| "token_acc": 0.8966864910790144, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.3423863045478181, | |
| "grad_norm": 0.03556691326509067, | |
| "learning_rate": 1.5340718986279505e-05, | |
| "loss": 0.38387582302093504, | |
| "memory(GiB)": 77.28, | |
| "step": 1070, | |
| "token_acc": 0.8821359223300971, | |
| "train_speed(iter/s)": 0.014401 | |
| }, | |
| { | |
| "epoch": 0.34398624055037796, | |
| "grad_norm": 0.03410584414537992, | |
| "learning_rate": 1.529674593731399e-05, | |
| "loss": 0.367924427986145, | |
| "memory(GiB)": 77.28, | |
| "step": 1075, | |
| "token_acc": 0.8812294182217344, | |
| "train_speed(iter/s)": 0.014403 | |
| }, | |
| { | |
| "epoch": 0.3455861765529379, | |
| "grad_norm": 0.03472114991770262, | |
| "learning_rate": 1.5252630065673662e-05, | |
| "loss": 0.38024375438690183, | |
| "memory(GiB)": 77.28, | |
| "step": 1080, | |
| "token_acc": 0.9087554085008908, | |
| "train_speed(iter/s)": 0.014402 | |
| }, | |
| { | |
| "epoch": 0.3471861125554978, | |
| "grad_norm": 0.034826116899087524, | |
| "learning_rate": 1.5208372560909031e-05, | |
| "loss": 0.37552039623260497, | |
| "memory(GiB)": 77.28, | |
| "step": 1085, | |
| "token_acc": 0.914223331253899, | |
| "train_speed(iter/s)": 0.014403 | |
| }, | |
| { | |
| "epoch": 0.34878604855805767, | |
| "grad_norm": 0.03415469833651797, | |
| "learning_rate": 1.5163974616389621e-05, | |
| "loss": 0.37450971603393557, | |
| "memory(GiB)": 77.28, | |
| "step": 1090, | |
| "token_acc": 0.8556051457075348, | |
| "train_speed(iter/s)": 0.014403 | |
| }, | |
| { | |
| "epoch": 0.3503859845606176, | |
| "grad_norm": 0.03655513507503648, | |
| "learning_rate": 1.5119437429271813e-05, | |
| "loss": 0.3794886589050293, | |
| "memory(GiB)": 77.28, | |
| "step": 1095, | |
| "token_acc": 0.8877699941622884, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.35198592056317746, | |
| "grad_norm": 0.034995454028194976, | |
| "learning_rate": 1.5074762200466557e-05, | |
| "loss": 0.3700634717941284, | |
| "memory(GiB)": 77.28, | |
| "step": 1100, | |
| "token_acc": 0.9116356483582992, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.3535858565657374, | |
| "grad_norm": 0.034538306373934693, | |
| "learning_rate": 1.5029950134606991e-05, | |
| "loss": 0.3690228223800659, | |
| "memory(GiB)": 77.28, | |
| "step": 1105, | |
| "token_acc": 0.8942924687605539, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.35518579256829724, | |
| "grad_norm": 0.0331069504176894, | |
| "learning_rate": 1.4985002440015959e-05, | |
| "loss": 0.36534135341644286, | |
| "memory(GiB)": 77.28, | |
| "step": 1110, | |
| "token_acc": 0.8909802740551122, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.35678572857085716, | |
| "grad_norm": 0.034796730271752487, | |
| "learning_rate": 1.4939920328673422e-05, | |
| "loss": 0.38107268810272216, | |
| "memory(GiB)": 77.28, | |
| "step": 1115, | |
| "token_acc": 0.9336683417085427, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.3583856645734171, | |
| "grad_norm": 0.03428619908077693, | |
| "learning_rate": 1.4894705016183803e-05, | |
| "loss": 0.36655797958374026, | |
| "memory(GiB)": 77.28, | |
| "step": 1120, | |
| "token_acc": 0.8758409785932721, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.35998560057597695, | |
| "grad_norm": 0.03650887961633004, | |
| "learning_rate": 1.4849357721743169e-05, | |
| "loss": 0.37060978412628176, | |
| "memory(GiB)": 77.28, | |
| "step": 1125, | |
| "token_acc": 0.8783166728372208, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.36158553657853687, | |
| "grad_norm": 0.0365625802848291, | |
| "learning_rate": 1.4803879668106393e-05, | |
| "loss": 0.38014461994171145, | |
| "memory(GiB)": 77.28, | |
| "step": 1130, | |
| "token_acc": 0.9106974995299868, | |
| "train_speed(iter/s)": 0.014407 | |
| }, | |
| { | |
| "epoch": 0.36318547258109674, | |
| "grad_norm": 0.03441102167916761, | |
| "learning_rate": 1.4758272081554168e-05, | |
| "loss": 0.3692239999771118, | |
| "memory(GiB)": 77.28, | |
| "step": 1135, | |
| "token_acc": 0.875740776142229, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.36478540858365666, | |
| "grad_norm": 0.03330407208979561, | |
| "learning_rate": 1.4712536191859934e-05, | |
| "loss": 0.37282414436340333, | |
| "memory(GiB)": 77.28, | |
| "step": 1140, | |
| "token_acc": 0.9172197640117994, | |
| "train_speed(iter/s)": 0.014412 | |
| }, | |
| { | |
| "epoch": 0.3663853445862166, | |
| "grad_norm": 0.035699108901044725, | |
| "learning_rate": 1.4666673232256738e-05, | |
| "loss": 0.37760913372039795, | |
| "memory(GiB)": 77.28, | |
| "step": 1145, | |
| "token_acc": 0.8891951488423374, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.36798528058877644, | |
| "grad_norm": 0.03532503045003448, | |
| "learning_rate": 1.4620684439403962e-05, | |
| "loss": 0.37476723194122313, | |
| "memory(GiB)": 77.28, | |
| "step": 1150, | |
| "token_acc": 0.9057826520438684, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.36958521659133636, | |
| "grad_norm": 0.0344910408139177, | |
| "learning_rate": 1.4574571053353987e-05, | |
| "loss": 0.374307918548584, | |
| "memory(GiB)": 77.28, | |
| "step": 1155, | |
| "token_acc": 0.9003899902502438, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.37118515259389623, | |
| "grad_norm": 0.035041872884459944, | |
| "learning_rate": 1.452833431751875e-05, | |
| "loss": 0.3697278738021851, | |
| "memory(GiB)": 77.28, | |
| "step": 1160, | |
| "token_acc": 0.9063315478643044, | |
| "train_speed(iter/s)": 0.014412 | |
| }, | |
| { | |
| "epoch": 0.37278508859645615, | |
| "grad_norm": 0.03519132694721856, | |
| "learning_rate": 1.448197547863622e-05, | |
| "loss": 0.36422038078308105, | |
| "memory(GiB)": 77.28, | |
| "step": 1165, | |
| "token_acc": 0.9000765696784073, | |
| "train_speed(iter/s)": 0.014412 | |
| }, | |
| { | |
| "epoch": 0.374385024599016, | |
| "grad_norm": 0.03547211442268733, | |
| "learning_rate": 1.4435495786736796e-05, | |
| "loss": 0.3784764289855957, | |
| "memory(GiB)": 77.28, | |
| "step": 1170, | |
| "token_acc": 0.8931984260820686, | |
| "train_speed(iter/s)": 0.014412 | |
| }, | |
| { | |
| "epoch": 0.37598496060157593, | |
| "grad_norm": 0.033084975573475006, | |
| "learning_rate": 1.438889649510956e-05, | |
| "loss": 0.3620013236999512, | |
| "memory(GiB)": 77.28, | |
| "step": 1175, | |
| "token_acc": 0.8830564784053156, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.37758489660413586, | |
| "grad_norm": 0.03494219380332394, | |
| "learning_rate": 1.4342178860268523e-05, | |
| "loss": 0.3709207773208618, | |
| "memory(GiB)": 77.28, | |
| "step": 1180, | |
| "token_acc": 0.8974101081216997, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.3791848326066957, | |
| "grad_norm": 0.03635733513697145, | |
| "learning_rate": 1.4295344141918734e-05, | |
| "loss": 0.37572057247161866, | |
| "memory(GiB)": 77.28, | |
| "step": 1185, | |
| "token_acc": 0.8881118881118881, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.38078476860925564, | |
| "grad_norm": 0.036630394189626006, | |
| "learning_rate": 1.4248393602922299e-05, | |
| "loss": 0.38127038478851316, | |
| "memory(GiB)": 77.28, | |
| "step": 1190, | |
| "token_acc": 0.8691920686593667, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.3823847046118155, | |
| "grad_norm": 0.03496102213628827, | |
| "learning_rate": 1.420132850926434e-05, | |
| "loss": 0.37142717838287354, | |
| "memory(GiB)": 77.28, | |
| "step": 1195, | |
| "token_acc": 0.8981158408932309, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.3839846406143754, | |
| "grad_norm": 0.03318251083183633, | |
| "learning_rate": 1.4154150130018867e-05, | |
| "loss": 0.37023210525512695, | |
| "memory(GiB)": 77.28, | |
| "step": 1200, | |
| "token_acc": 0.8824277666727239, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.38558457661693535, | |
| "grad_norm": 0.03307058094990319, | |
| "learning_rate": 1.4106859737314532e-05, | |
| "loss": 0.36745152473449705, | |
| "memory(GiB)": 77.28, | |
| "step": 1205, | |
| "token_acc": 0.8875419619544946, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.3871845126194952, | |
| "grad_norm": 0.035424472590586585, | |
| "learning_rate": 1.4059458606300358e-05, | |
| "loss": 0.3661919832229614, | |
| "memory(GiB)": 77.28, | |
| "step": 1210, | |
| "token_acc": 0.8780977896851976, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.38878444862205513, | |
| "grad_norm": 0.03420289825157965, | |
| "learning_rate": 1.4011948015111334e-05, | |
| "loss": 0.37414982318878176, | |
| "memory(GiB)": 77.28, | |
| "step": 1215, | |
| "token_acc": 0.8649971756731313, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.390384384624615, | |
| "grad_norm": 0.03335207107599188, | |
| "learning_rate": 1.396432924483396e-05, | |
| "loss": 0.3709057569503784, | |
| "memory(GiB)": 77.28, | |
| "step": 1220, | |
| "token_acc": 0.8992544446568533, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.3919843206271749, | |
| "grad_norm": 0.03659090220095111, | |
| "learning_rate": 1.3916603579471705e-05, | |
| "loss": 0.3810150146484375, | |
| "memory(GiB)": 77.28, | |
| "step": 1225, | |
| "token_acc": 0.8939136988882608, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.3935842566297348, | |
| "grad_norm": 0.03381760469834974, | |
| "learning_rate": 1.3868772305910376e-05, | |
| "loss": 0.3754213809967041, | |
| "memory(GiB)": 77.28, | |
| "step": 1230, | |
| "token_acc": 0.8942501005227181, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.3951841926322947, | |
| "grad_norm": 0.03498771807662288, | |
| "learning_rate": 1.3820836713883424e-05, | |
| "loss": 0.3726653099060059, | |
| "memory(GiB)": 77.28, | |
| "step": 1235, | |
| "token_acc": 0.8871177618737801, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.3967841286348546, | |
| "grad_norm": 0.03417566824022459, | |
| "learning_rate": 1.3772798095937172e-05, | |
| "loss": 0.363895320892334, | |
| "memory(GiB)": 77.28, | |
| "step": 1240, | |
| "token_acc": 0.8693128333856291, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.3983840646374145, | |
| "grad_norm": 0.03427076519706647, | |
| "learning_rate": 1.3724657747395957e-05, | |
| "loss": 0.3746422052383423, | |
| "memory(GiB)": 77.28, | |
| "step": 1245, | |
| "token_acc": 0.8969516235917826, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.3999840006399744, | |
| "grad_norm": 0.034195401871935746, | |
| "learning_rate": 1.3676416966327201e-05, | |
| "loss": 0.37307212352752683, | |
| "memory(GiB)": 77.28, | |
| "step": 1250, | |
| "token_acc": 0.8579698957931301, | |
| "train_speed(iter/s)": 0.014414 | |
| }, | |
| { | |
| "epoch": 0.3999840006399744, | |
| "eval_loss": 0.6099496483802795, | |
| "eval_runtime": 171.3813, | |
| "eval_samples_per_second": 117.212, | |
| "eval_steps_per_second": 0.589, | |
| "eval_token_acc": 0.8910344140161096, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.4015839366425343, | |
| "grad_norm": 0.03442247514389261, | |
| "learning_rate": 1.362807705350641e-05, | |
| "loss": 0.37490437030792234, | |
| "memory(GiB)": 77.28, | |
| "step": 1255, | |
| "token_acc": 0.8993468545892059, | |
| "train_speed(iter/s)": 0.014386 | |
| }, | |
| { | |
| "epoch": 0.4031838726450942, | |
| "grad_norm": 0.03543108584022621, | |
| "learning_rate": 1.3579639312382105e-05, | |
| "loss": 0.3771961212158203, | |
| "memory(GiB)": 77.28, | |
| "step": 1260, | |
| "token_acc": 0.8801626016260162, | |
| "train_speed(iter/s)": 0.014386 | |
| }, | |
| { | |
| "epoch": 0.4047838086476541, | |
| "grad_norm": 0.0351732239969475, | |
| "learning_rate": 1.3531105049040667e-05, | |
| "loss": 0.37178664207458495, | |
| "memory(GiB)": 77.28, | |
| "step": 1265, | |
| "token_acc": 0.9065207478340174, | |
| "train_speed(iter/s)": 0.014385 | |
| }, | |
| { | |
| "epoch": 0.406383744650214, | |
| "grad_norm": 0.0345010504737042, | |
| "learning_rate": 1.3482475572171132e-05, | |
| "loss": 0.3657317399978638, | |
| "memory(GiB)": 77.28, | |
| "step": 1270, | |
| "token_acc": 0.877511961722488, | |
| "train_speed(iter/s)": 0.014385 | |
| }, | |
| { | |
| "epoch": 0.4079836806527739, | |
| "grad_norm": 0.03426174629461238, | |
| "learning_rate": 1.3433752193029888e-05, | |
| "loss": 0.37921135425567626, | |
| "memory(GiB)": 77.28, | |
| "step": 1275, | |
| "token_acc": 0.9078838174273859, | |
| "train_speed(iter/s)": 0.014385 | |
| }, | |
| { | |
| "epoch": 0.40958361665533377, | |
| "grad_norm": 0.03606013606177771, | |
| "learning_rate": 1.3384936225405326e-05, | |
| "loss": 0.37555053234100344, | |
| "memory(GiB)": 77.28, | |
| "step": 1280, | |
| "token_acc": 0.8769176512078999, | |
| "train_speed(iter/s)": 0.014388 | |
| }, | |
| { | |
| "epoch": 0.4111835526578937, | |
| "grad_norm": 0.03638594766243525, | |
| "learning_rate": 1.333602898558242e-05, | |
| "loss": 0.37437245845794676, | |
| "memory(GiB)": 77.28, | |
| "step": 1285, | |
| "token_acc": 0.9019975868078831, | |
| "train_speed(iter/s)": 0.014389 | |
| }, | |
| { | |
| "epoch": 0.41278348866045356, | |
| "grad_norm": 0.03480203069849946, | |
| "learning_rate": 1.3287031792307226e-05, | |
| "loss": 0.37502617835998536, | |
| "memory(GiB)": 77.28, | |
| "step": 1290, | |
| "token_acc": 0.8862950291809217, | |
| "train_speed(iter/s)": 0.014388 | |
| }, | |
| { | |
| "epoch": 0.4143834246630135, | |
| "grad_norm": 0.034125749594009575, | |
| "learning_rate": 1.323794596675132e-05, | |
| "loss": 0.36830193996429444, | |
| "memory(GiB)": 77.28, | |
| "step": 1295, | |
| "token_acc": 0.8786538933922869, | |
| "train_speed(iter/s)": 0.01439 | |
| }, | |
| { | |
| "epoch": 0.4159833606655734, | |
| "grad_norm": 0.03467851818797935, | |
| "learning_rate": 1.318877283247619e-05, | |
| "loss": 0.36499571800231934, | |
| "memory(GiB)": 77.28, | |
| "step": 1300, | |
| "token_acc": 0.9122148024485254, | |
| "train_speed(iter/s)": 0.014391 | |
| }, | |
| { | |
| "epoch": 0.41758329666813326, | |
| "grad_norm": 0.03351147905784924, | |
| "learning_rate": 1.3139513715397521e-05, | |
| "loss": 0.36349053382873536, | |
| "memory(GiB)": 77.28, | |
| "step": 1305, | |
| "token_acc": 0.8831595210505987, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.4191832326706932, | |
| "grad_norm": 0.036200622491475404, | |
| "learning_rate": 1.3090169943749475e-05, | |
| "loss": 0.3686731576919556, | |
| "memory(GiB)": 77.28, | |
| "step": 1310, | |
| "token_acc": 0.8656188048711413, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.42078316867325305, | |
| "grad_norm": 0.03434195756254507, | |
| "learning_rate": 1.304074284804885e-05, | |
| "loss": 0.37625932693481445, | |
| "memory(GiB)": 77.28, | |
| "step": 1315, | |
| "token_acc": 0.8982833717653087, | |
| "train_speed(iter/s)": 0.014397 | |
| }, | |
| { | |
| "epoch": 0.42238310467581297, | |
| "grad_norm": 0.034749866744640846, | |
| "learning_rate": 1.2991233761059214e-05, | |
| "loss": 0.37158203125, | |
| "memory(GiB)": 77.28, | |
| "step": 1320, | |
| "token_acc": 0.8929796780153074, | |
| "train_speed(iter/s)": 0.014398 | |
| }, | |
| { | |
| "epoch": 0.4239830406783729, | |
| "grad_norm": 0.03548467311511409, | |
| "learning_rate": 1.2941644017754964e-05, | |
| "loss": 0.37488343715667727, | |
| "memory(GiB)": 77.28, | |
| "step": 1325, | |
| "token_acc": 0.904258943781942, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.42558297668093276, | |
| "grad_norm": 0.0341920805825176, | |
| "learning_rate": 1.289197495528534e-05, | |
| "loss": 0.3711984872817993, | |
| "memory(GiB)": 77.28, | |
| "step": 1330, | |
| "token_acc": 0.9195646027707096, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.4271829126834927, | |
| "grad_norm": 0.03554475718209227, | |
| "learning_rate": 1.284222791293836e-05, | |
| "loss": 0.368884015083313, | |
| "memory(GiB)": 77.28, | |
| "step": 1335, | |
| "token_acc": 0.8715034965034965, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.42878284868605254, | |
| "grad_norm": 0.03575254500276844, | |
| "learning_rate": 1.2792404232104699e-05, | |
| "loss": 0.36724443435668946, | |
| "memory(GiB)": 77.28, | |
| "step": 1340, | |
| "token_acc": 0.8930875576036866, | |
| "train_speed(iter/s)": 0.014401 | |
| }, | |
| { | |
| "epoch": 0.43038278468861246, | |
| "grad_norm": 0.03441881916218118, | |
| "learning_rate": 1.2742505256241543e-05, | |
| "loss": 0.3715341806411743, | |
| "memory(GiB)": 77.28, | |
| "step": 1345, | |
| "token_acc": 0.853706238998631, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.43198272069117233, | |
| "grad_norm": 0.03496918226927363, | |
| "learning_rate": 1.2692532330836346e-05, | |
| "loss": 0.3687546491622925, | |
| "memory(GiB)": 77.28, | |
| "step": 1350, | |
| "token_acc": 0.8844972353061642, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.43358265669373225, | |
| "grad_norm": 0.0342197412687382, | |
| "learning_rate": 1.2642486803370553e-05, | |
| "loss": 0.3681937217712402, | |
| "memory(GiB)": 77.28, | |
| "step": 1355, | |
| "token_acc": 0.8881036513545347, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.43518259269629217, | |
| "grad_norm": 0.03574024280169566, | |
| "learning_rate": 1.2592370023283268e-05, | |
| "loss": 0.36503190994262696, | |
| "memory(GiB)": 77.28, | |
| "step": 1360, | |
| "token_acc": 0.8921713441654358, | |
| "train_speed(iter/s)": 0.014403 | |
| }, | |
| { | |
| "epoch": 0.43678252869885204, | |
| "grad_norm": 0.03347504729151743, | |
| "learning_rate": 1.2542183341934873e-05, | |
| "loss": 0.3655604362487793, | |
| "memory(GiB)": 77.28, | |
| "step": 1365, | |
| "token_acc": 0.8905417406749556, | |
| "train_speed(iter/s)": 0.014404 | |
| }, | |
| { | |
| "epoch": 0.43838246470141196, | |
| "grad_norm": 0.03600326432455147, | |
| "learning_rate": 1.2491928112570568e-05, | |
| "loss": 0.366928768157959, | |
| "memory(GiB)": 77.28, | |
| "step": 1370, | |
| "token_acc": 0.896969696969697, | |
| "train_speed(iter/s)": 0.014405 | |
| }, | |
| { | |
| "epoch": 0.4399824007039718, | |
| "grad_norm": 0.03491325824773157, | |
| "learning_rate": 1.2441605690283915e-05, | |
| "loss": 0.37325053215026854, | |
| "memory(GiB)": 77.28, | |
| "step": 1375, | |
| "token_acc": 0.9224045391811072, | |
| "train_speed(iter/s)": 0.014404 | |
| }, | |
| { | |
| "epoch": 0.44158233670653174, | |
| "grad_norm": 0.03780738973130896, | |
| "learning_rate": 1.2391217431980273e-05, | |
| "loss": 0.3637607336044312, | |
| "memory(GiB)": 77.28, | |
| "step": 1380, | |
| "token_acc": 0.918383623554433, | |
| "train_speed(iter/s)": 0.014407 | |
| }, | |
| { | |
| "epoch": 0.44318227270909166, | |
| "grad_norm": 0.035690154757200145, | |
| "learning_rate": 1.234076469634022e-05, | |
| "loss": 0.3695350170135498, | |
| "memory(GiB)": 77.28, | |
| "step": 1385, | |
| "token_acc": 0.9101499423298731, | |
| "train_speed(iter/s)": 0.014405 | |
| }, | |
| { | |
| "epoch": 0.4447822087116515, | |
| "grad_norm": 0.03590046624532822, | |
| "learning_rate": 1.2290248843782915e-05, | |
| "loss": 0.364530086517334, | |
| "memory(GiB)": 77.28, | |
| "step": 1390, | |
| "token_acc": 0.9150886503437462, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.44638214471421145, | |
| "grad_norm": 0.03472603260778397, | |
| "learning_rate": 1.2239671236429413e-05, | |
| "loss": 0.3661569833755493, | |
| "memory(GiB)": 77.28, | |
| "step": 1395, | |
| "token_acc": 0.8987637821583695, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.4479820807167713, | |
| "grad_norm": 0.03445762563216705, | |
| "learning_rate": 1.218903323806595e-05, | |
| "loss": 0.3707982778549194, | |
| "memory(GiB)": 77.28, | |
| "step": 1400, | |
| "token_acc": 0.8745701357466064, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.44958201671933123, | |
| "grad_norm": 0.035218814155010984, | |
| "learning_rate": 1.2138336214107148e-05, | |
| "loss": 0.3614500045776367, | |
| "memory(GiB)": 77.28, | |
| "step": 1405, | |
| "token_acc": 0.8926116838487973, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.4511819527218911, | |
| "grad_norm": 0.03368066952337403, | |
| "learning_rate": 1.2087581531559208e-05, | |
| "loss": 0.3688710451126099, | |
| "memory(GiB)": 77.28, | |
| "step": 1410, | |
| "token_acc": 0.8967142129393785, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.452781888724451, | |
| "grad_norm": 0.03439504879116651, | |
| "learning_rate": 1.2036770558983067e-05, | |
| "loss": 0.3658963441848755, | |
| "memory(GiB)": 77.28, | |
| "step": 1415, | |
| "token_acc": 0.8647400820793434, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.45438182472701094, | |
| "grad_norm": 0.03294429069191412, | |
| "learning_rate": 1.1985904666457455e-05, | |
| "loss": 0.36890151500701907, | |
| "memory(GiB)": 77.28, | |
| "step": 1420, | |
| "token_acc": 0.9237490071485306, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.4559817607295708, | |
| "grad_norm": 0.03476827611852477, | |
| "learning_rate": 1.1934985225541998e-05, | |
| "loss": 0.3723160266876221, | |
| "memory(GiB)": 77.28, | |
| "step": 1425, | |
| "token_acc": 0.9109958092197166, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.4575816967321307, | |
| "grad_norm": 0.03464210636372699, | |
| "learning_rate": 1.18840136092402e-05, | |
| "loss": 0.3672841310501099, | |
| "memory(GiB)": 77.28, | |
| "step": 1430, | |
| "token_acc": 0.8790931989924433, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.4591816327346906, | |
| "grad_norm": 0.03405244756060422, | |
| "learning_rate": 1.1832991191962435e-05, | |
| "loss": 0.3602238416671753, | |
| "memory(GiB)": 77.28, | |
| "step": 1435, | |
| "token_acc": 0.8997259591429995, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.4607815687372505, | |
| "grad_norm": 0.03479537032371878, | |
| "learning_rate": 1.1781919349488894e-05, | |
| "loss": 0.3703394889831543, | |
| "memory(GiB)": 77.28, | |
| "step": 1440, | |
| "token_acc": 0.8827277423798864, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.46238150473981043, | |
| "grad_norm": 0.03630153249015714, | |
| "learning_rate": 1.1730799458932473e-05, | |
| "loss": 0.37370154857635496, | |
| "memory(GiB)": 77.28, | |
| "step": 1445, | |
| "token_acc": 0.9269114990969296, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.4639814407423703, | |
| "grad_norm": 0.03556854160517035, | |
| "learning_rate": 1.1679632898701649e-05, | |
| "loss": 0.36541726589202883, | |
| "memory(GiB)": 77.28, | |
| "step": 1450, | |
| "token_acc": 0.9014066496163683, | |
| "train_speed(iter/s)": 0.014415 | |
| }, | |
| { | |
| "epoch": 0.4655813767449302, | |
| "grad_norm": 0.03600309817806044, | |
| "learning_rate": 1.1628421048463315e-05, | |
| "loss": 0.37421836853027346, | |
| "memory(GiB)": 77.28, | |
| "step": 1455, | |
| "token_acc": 0.8827207275483138, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.4671813127474901, | |
| "grad_norm": 0.03322462203870746, | |
| "learning_rate": 1.1577165289105565e-05, | |
| "loss": 0.36063060760498045, | |
| "memory(GiB)": 77.28, | |
| "step": 1460, | |
| "token_acc": 0.8796332422941865, | |
| "train_speed(iter/s)": 0.014414 | |
| }, | |
| { | |
| "epoch": 0.46878124875005, | |
| "grad_norm": 0.03627115996462612, | |
| "learning_rate": 1.1525867002700484e-05, | |
| "loss": 0.3762346744537354, | |
| "memory(GiB)": 77.28, | |
| "step": 1465, | |
| "token_acc": 0.89023396577814, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.47038118475260987, | |
| "grad_norm": 0.035647939753576684, | |
| "learning_rate": 1.1474527572466847e-05, | |
| "loss": 0.3616278409957886, | |
| "memory(GiB)": 77.28, | |
| "step": 1470, | |
| "token_acc": 0.8720430107526882, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.4719811207551698, | |
| "grad_norm": 0.035285173854949954, | |
| "learning_rate": 1.1423148382732854e-05, | |
| "loss": 0.37021946907043457, | |
| "memory(GiB)": 77.28, | |
| "step": 1475, | |
| "token_acc": 0.9171724384148519, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.4735810567577297, | |
| "grad_norm": 0.035629576623768464, | |
| "learning_rate": 1.1371730818898785e-05, | |
| "loss": 0.3663011074066162, | |
| "memory(GiB)": 77.28, | |
| "step": 1480, | |
| "token_acc": 0.9093475533249686, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.4751809927602896, | |
| "grad_norm": 0.036145329500511955, | |
| "learning_rate": 1.132027626739965e-05, | |
| "loss": 0.3670144557952881, | |
| "memory(GiB)": 77.28, | |
| "step": 1485, | |
| "token_acc": 0.9013305685156385, | |
| "train_speed(iter/s)": 0.014419 | |
| }, | |
| { | |
| "epoch": 0.4767809287628495, | |
| "grad_norm": 0.03762454278136116, | |
| "learning_rate": 1.1268786115667798e-05, | |
| "loss": 0.370996880531311, | |
| "memory(GiB)": 77.28, | |
| "step": 1490, | |
| "token_acc": 0.8893922824558663, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.47838086476540936, | |
| "grad_norm": 0.03489585116510581, | |
| "learning_rate": 1.1217261752095518e-05, | |
| "loss": 0.3688071250915527, | |
| "memory(GiB)": 77.28, | |
| "step": 1495, | |
| "token_acc": 0.8983111749910169, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.4799808007679693, | |
| "grad_norm": 0.03446273860874737, | |
| "learning_rate": 1.1165704565997593e-05, | |
| "loss": 0.36016933917999266, | |
| "memory(GiB)": 77.28, | |
| "step": 1500, | |
| "token_acc": 0.8913821585903083, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.4799808007679693, | |
| "eval_loss": 0.6074870824813843, | |
| "eval_runtime": 172.104, | |
| "eval_samples_per_second": 116.72, | |
| "eval_steps_per_second": 0.587, | |
| "eval_token_acc": 0.8923138161661085, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.4815807367705292, | |
| "grad_norm": 0.03567717193695566, | |
| "learning_rate": 1.1114115947573834e-05, | |
| "loss": 0.3687129497528076, | |
| "memory(GiB)": 77.28, | |
| "step": 1505, | |
| "token_acc": 0.8902910121040433, | |
| "train_speed(iter/s)": 0.014394 | |
| }, | |
| { | |
| "epoch": 0.48318067277308907, | |
| "grad_norm": 0.035522027399690424, | |
| "learning_rate": 1.1062497287871606e-05, | |
| "loss": 0.3638231039047241, | |
| "memory(GiB)": 77.28, | |
| "step": 1510, | |
| "token_acc": 0.8678424740275429, | |
| "train_speed(iter/s)": 0.014394 | |
| }, | |
| { | |
| "epoch": 0.484780608775649, | |
| "grad_norm": 0.03466224643090752, | |
| "learning_rate": 1.1010849978748314e-05, | |
| "loss": 0.3652355194091797, | |
| "memory(GiB)": 77.28, | |
| "step": 1515, | |
| "token_acc": 0.8848318880267763, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.48638054477820886, | |
| "grad_norm": 0.0354542903926529, | |
| "learning_rate": 1.0959175412833869e-05, | |
| "loss": 0.3614229917526245, | |
| "memory(GiB)": 77.28, | |
| "step": 1520, | |
| "token_acc": 0.8956547443097842, | |
| "train_speed(iter/s)": 0.014394 | |
| }, | |
| { | |
| "epoch": 0.4879804807807688, | |
| "grad_norm": 0.03440586258662547, | |
| "learning_rate": 1.0907474983493144e-05, | |
| "loss": 0.3634510517120361, | |
| "memory(GiB)": 77.28, | |
| "step": 1525, | |
| "token_acc": 0.9006639427987743, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.48958041678332864, | |
| "grad_norm": 0.0360801859171815, | |
| "learning_rate": 1.08557500847884e-05, | |
| "loss": 0.36115612983703616, | |
| "memory(GiB)": 77.28, | |
| "step": 1530, | |
| "token_acc": 0.9074234296591106, | |
| "train_speed(iter/s)": 0.014393 | |
| }, | |
| { | |
| "epoch": 0.49118035278588856, | |
| "grad_norm": 0.03497423282601686, | |
| "learning_rate": 1.080400211144169e-05, | |
| "loss": 0.3642597675323486, | |
| "memory(GiB)": 77.28, | |
| "step": 1535, | |
| "token_acc": 0.8553005879006258, | |
| "train_speed(iter/s)": 0.014394 | |
| }, | |
| { | |
| "epoch": 0.4927802887884485, | |
| "grad_norm": 0.03446763731370447, | |
| "learning_rate": 1.0752232458797262e-05, | |
| "loss": 0.3559999942779541, | |
| "memory(GiB)": 77.28, | |
| "step": 1540, | |
| "token_acc": 0.8824950269963058, | |
| "train_speed(iter/s)": 0.014397 | |
| }, | |
| { | |
| "epoch": 0.49438022479100835, | |
| "grad_norm": 0.035387308834996176, | |
| "learning_rate": 1.070044252278393e-05, | |
| "loss": 0.3755119562149048, | |
| "memory(GiB)": 77.28, | |
| "step": 1545, | |
| "token_acc": 0.8683636363636363, | |
| "train_speed(iter/s)": 0.014398 | |
| }, | |
| { | |
| "epoch": 0.49598016079356827, | |
| "grad_norm": 0.035623508164582596, | |
| "learning_rate": 1.064863369987743e-05, | |
| "loss": 0.36371660232543945, | |
| "memory(GiB)": 77.28, | |
| "step": 1550, | |
| "token_acc": 0.9095354523227384, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.49758009679612814, | |
| "grad_norm": 0.03586927734844086, | |
| "learning_rate": 1.0596807387062772e-05, | |
| "loss": 0.3677802562713623, | |
| "memory(GiB)": 77.28, | |
| "step": 1555, | |
| "token_acc": 0.9039025142680858, | |
| "train_speed(iter/s)": 0.0144 | |
| }, | |
| { | |
| "epoch": 0.49918003279868806, | |
| "grad_norm": 0.03653622777112098, | |
| "learning_rate": 1.0544964981796563e-05, | |
| "loss": 0.3684211254119873, | |
| "memory(GiB)": 77.28, | |
| "step": 1560, | |
| "token_acc": 0.868405540819334, | |
| "train_speed(iter/s)": 0.014403 | |
| }, | |
| { | |
| "epoch": 0.500779968801248, | |
| "grad_norm": 0.0370656544294769, | |
| "learning_rate": 1.0493107881969335e-05, | |
| "loss": 0.3586920738220215, | |
| "memory(GiB)": 77.28, | |
| "step": 1565, | |
| "token_acc": 0.9100284977608902, | |
| "train_speed(iter/s)": 0.014404 | |
| }, | |
| { | |
| "epoch": 0.5023799048038079, | |
| "grad_norm": 0.03616388731261157, | |
| "learning_rate": 1.0441237485867845e-05, | |
| "loss": 0.36218621730804446, | |
| "memory(GiB)": 77.28, | |
| "step": 1570, | |
| "token_acc": 0.902942631058358, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.5039798408063677, | |
| "grad_norm": 0.03609161295790287, | |
| "learning_rate": 1.0389355192137379e-05, | |
| "loss": 0.3653876304626465, | |
| "memory(GiB)": 77.28, | |
| "step": 1575, | |
| "token_acc": 0.9041706462909901, | |
| "train_speed(iter/s)": 0.014407 | |
| }, | |
| { | |
| "epoch": 0.5055797768089276, | |
| "grad_norm": 0.03748808681261972, | |
| "learning_rate": 1.0337462399744025e-05, | |
| "loss": 0.37090017795562746, | |
| "memory(GiB)": 77.28, | |
| "step": 1580, | |
| "token_acc": 0.8675850435760473, | |
| "train_speed(iter/s)": 0.014405 | |
| }, | |
| { | |
| "epoch": 0.5071797128114875, | |
| "grad_norm": 0.0345478093663887, | |
| "learning_rate": 1.0285560507936962e-05, | |
| "loss": 0.3756566047668457, | |
| "memory(GiB)": 77.28, | |
| "step": 1585, | |
| "token_acc": 0.8505338078291815, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.5087796488140475, | |
| "grad_norm": 0.03650247257124013, | |
| "learning_rate": 1.0233650916210736e-05, | |
| "loss": 0.3637782096862793, | |
| "memory(GiB)": 77.28, | |
| "step": 1590, | |
| "token_acc": 0.9002235318024792, | |
| "train_speed(iter/s)": 0.014405 | |
| }, | |
| { | |
| "epoch": 0.5103795848166074, | |
| "grad_norm": 0.03633358814639768, | |
| "learning_rate": 1.0181735024267504e-05, | |
| "loss": 0.3628427028656006, | |
| "memory(GiB)": 77.28, | |
| "step": 1595, | |
| "token_acc": 0.8564662273476112, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.5119795208191672, | |
| "grad_norm": 0.037908299488290956, | |
| "learning_rate": 1.012981423197931e-05, | |
| "loss": 0.3728133201599121, | |
| "memory(GiB)": 77.28, | |
| "step": 1600, | |
| "token_acc": 0.8976991588322613, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.5135794568217271, | |
| "grad_norm": 0.03477409396173477, | |
| "learning_rate": 1.007788993935033e-05, | |
| "loss": 0.36496148109436033, | |
| "memory(GiB)": 77.28, | |
| "step": 1605, | |
| "token_acc": 0.8824123989218329, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.515179392824287, | |
| "grad_norm": 0.03591338948302039, | |
| "learning_rate": 1.002596354647912e-05, | |
| "loss": 0.3671183347702026, | |
| "memory(GiB)": 77.28, | |
| "step": 1610, | |
| "token_acc": 0.9008127633955448, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.516779328826847, | |
| "grad_norm": 0.035196111530376294, | |
| "learning_rate": 9.974036453520881e-06, | |
| "loss": 0.3602726459503174, | |
| "memory(GiB)": 77.28, | |
| "step": 1615, | |
| "token_acc": 0.8955383382313652, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.5183792648294068, | |
| "grad_norm": 0.03748636943340592, | |
| "learning_rate": 9.922110060649672e-06, | |
| "loss": 0.36945409774780275, | |
| "memory(GiB)": 77.28, | |
| "step": 1620, | |
| "token_acc": 0.9212632180623035, | |
| "train_speed(iter/s)": 0.014412 | |
| }, | |
| { | |
| "epoch": 0.5199792008319667, | |
| "grad_norm": 0.03548428460759863, | |
| "learning_rate": 9.870185768020694e-06, | |
| "loss": 0.3491816997528076, | |
| "memory(GiB)": 77.28, | |
| "step": 1625, | |
| "token_acc": 0.9078094620868438, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.5215791368345266, | |
| "grad_norm": 0.03518573566978696, | |
| "learning_rate": 9.818264975732497e-06, | |
| "loss": 0.3619969367980957, | |
| "memory(GiB)": 77.28, | |
| "step": 1630, | |
| "token_acc": 0.9038128249566725, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.5231790728370865, | |
| "grad_norm": 0.03522651488263579, | |
| "learning_rate": 9.766349083789266e-06, | |
| "loss": 0.36349639892578123, | |
| "memory(GiB)": 77.28, | |
| "step": 1635, | |
| "token_acc": 0.8999687890137328, | |
| "train_speed(iter/s)": 0.014409 | |
| }, | |
| { | |
| "epoch": 0.5247790088396465, | |
| "grad_norm": 0.03809564693798896, | |
| "learning_rate": 9.71443949206304e-06, | |
| "loss": 0.3725806713104248, | |
| "memory(GiB)": 77.28, | |
| "step": 1640, | |
| "token_acc": 0.9121447028423773, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.5263789448422063, | |
| "grad_norm": 0.034721878832050516, | |
| "learning_rate": 9.662537600255979e-06, | |
| "loss": 0.363213849067688, | |
| "memory(GiB)": 77.28, | |
| "step": 1645, | |
| "token_acc": 0.9216789268714842, | |
| "train_speed(iter/s)": 0.01441 | |
| }, | |
| { | |
| "epoch": 0.5279788808447662, | |
| "grad_norm": 0.03790554016155405, | |
| "learning_rate": 9.610644807862625e-06, | |
| "loss": 0.3574589729309082, | |
| "memory(GiB)": 77.28, | |
| "step": 1650, | |
| "token_acc": 0.8960802187784868, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.5295788168473261, | |
| "grad_norm": 0.03479166503013798, | |
| "learning_rate": 9.558762514132157e-06, | |
| "loss": 0.36415691375732423, | |
| "memory(GiB)": 77.28, | |
| "step": 1655, | |
| "token_acc": 0.8750883808625972, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.531178752849886, | |
| "grad_norm": 0.035643614279757305, | |
| "learning_rate": 9.506892118030668e-06, | |
| "loss": 0.35752391815185547, | |
| "memory(GiB)": 77.28, | |
| "step": 1660, | |
| "token_acc": 0.8826297984997794, | |
| "train_speed(iter/s)": 0.014414 | |
| }, | |
| { | |
| "epoch": 0.532778688852446, | |
| "grad_norm": 0.0354932657107638, | |
| "learning_rate": 9.455035018203439e-06, | |
| "loss": 0.3576699495315552, | |
| "memory(GiB)": 77.28, | |
| "step": 1665, | |
| "token_acc": 0.9069622618009715, | |
| "train_speed(iter/s)": 0.014412 | |
| }, | |
| { | |
| "epoch": 0.5343786248550058, | |
| "grad_norm": 0.03500590822032312, | |
| "learning_rate": 9.40319261293723e-06, | |
| "loss": 0.3677717447280884, | |
| "memory(GiB)": 77.28, | |
| "step": 1670, | |
| "token_acc": 0.9211569519894288, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.5359785608575657, | |
| "grad_norm": 0.0342264071437337, | |
| "learning_rate": 9.351366300122569e-06, | |
| "loss": 0.36440818309783934, | |
| "memory(GiB)": 77.28, | |
| "step": 1675, | |
| "token_acc": 0.8545367258761402, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.5375784968601256, | |
| "grad_norm": 0.035171456175800336, | |
| "learning_rate": 9.299557477216073e-06, | |
| "loss": 0.3585089445114136, | |
| "memory(GiB)": 77.28, | |
| "step": 1680, | |
| "token_acc": 0.8948815566835872, | |
| "train_speed(iter/s)": 0.014414 | |
| }, | |
| { | |
| "epoch": 0.5391784328626855, | |
| "grad_norm": 0.035301103192222384, | |
| "learning_rate": 9.247767541202738e-06, | |
| "loss": 0.364825439453125, | |
| "memory(GiB)": 77.28, | |
| "step": 1685, | |
| "token_acc": 0.9007202881152461, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.5407783688652454, | |
| "grad_norm": 0.0364786603543792, | |
| "learning_rate": 9.195997888558312e-06, | |
| "loss": 0.36471312046051024, | |
| "memory(GiB)": 77.28, | |
| "step": 1690, | |
| "token_acc": 0.9036003130707018, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.5423783048678052, | |
| "grad_norm": 0.03610181518648113, | |
| "learning_rate": 9.144249915211605e-06, | |
| "loss": 0.363938045501709, | |
| "memory(GiB)": 77.28, | |
| "step": 1695, | |
| "token_acc": 0.8853854642913448, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.5439782408703652, | |
| "grad_norm": 0.03450955343562785, | |
| "learning_rate": 9.092525016506858e-06, | |
| "loss": 0.3608727931976318, | |
| "memory(GiB)": 77.28, | |
| "step": 1700, | |
| "token_acc": 0.9012345679012346, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.5455781768729251, | |
| "grad_norm": 0.03928334892137232, | |
| "learning_rate": 9.040824587166136e-06, | |
| "loss": 0.36118714809417723, | |
| "memory(GiB)": 77.28, | |
| "step": 1705, | |
| "token_acc": 0.910617705664674, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.547178112875485, | |
| "grad_norm": 0.03595714484013575, | |
| "learning_rate": 8.98915002125169e-06, | |
| "loss": 0.35936105251312256, | |
| "memory(GiB)": 77.28, | |
| "step": 1710, | |
| "token_acc": 0.8989370970552361, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.5487780488780449, | |
| "grad_norm": 0.037004676299287526, | |
| "learning_rate": 8.9375027121284e-06, | |
| "loss": 0.36121673583984376, | |
| "memory(GiB)": 77.28, | |
| "step": 1715, | |
| "token_acc": 0.8800587685321224, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.5503779848806047, | |
| "grad_norm": 0.03719630007378892, | |
| "learning_rate": 8.885884052426168e-06, | |
| "loss": 0.3646020650863647, | |
| "memory(GiB)": 77.28, | |
| "step": 1720, | |
| "token_acc": 0.886611426079372, | |
| "train_speed(iter/s)": 0.014419 | |
| }, | |
| { | |
| "epoch": 0.5519779208831647, | |
| "grad_norm": 0.03665089520428984, | |
| "learning_rate": 8.83429543400241e-06, | |
| "loss": 0.36258678436279296, | |
| "memory(GiB)": 77.28, | |
| "step": 1725, | |
| "token_acc": 0.9009743487770928, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.5535778568857246, | |
| "grad_norm": 0.036346266670361026, | |
| "learning_rate": 8.78273824790448e-06, | |
| "loss": 0.34870684146881104, | |
| "memory(GiB)": 77.28, | |
| "step": 1730, | |
| "token_acc": 0.8874141161773891, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.5551777928882845, | |
| "grad_norm": 0.03699883692335831, | |
| "learning_rate": 8.731213884332205e-06, | |
| "loss": 0.3484686851501465, | |
| "memory(GiB)": 77.28, | |
| "step": 1735, | |
| "token_acc": 0.8768292682926829, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.5567777288908443, | |
| "grad_norm": 0.034484229533255854, | |
| "learning_rate": 8.679723732600355e-06, | |
| "loss": 0.3594592809677124, | |
| "memory(GiB)": 77.28, | |
| "step": 1740, | |
| "token_acc": 0.9233852496564361, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.5583776648934042, | |
| "grad_norm": 0.03539114391370881, | |
| "learning_rate": 8.628269181101216e-06, | |
| "loss": 0.3632354736328125, | |
| "memory(GiB)": 77.28, | |
| "step": 1745, | |
| "token_acc": 0.9032677848467322, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.5599776008959642, | |
| "grad_norm": 0.037092075176258815, | |
| "learning_rate": 8.576851617267151e-06, | |
| "loss": 0.36093626022338865, | |
| "memory(GiB)": 77.28, | |
| "step": 1750, | |
| "token_acc": 0.8888888888888888, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.5599776008959642, | |
| "eval_loss": 0.6050233244895935, | |
| "eval_runtime": 160.4027, | |
| "eval_samples_per_second": 125.235, | |
| "eval_steps_per_second": 0.63, | |
| "eval_token_acc": 0.8933715689431194, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.5615775368985241, | |
| "grad_norm": 0.03548048223547666, | |
| "learning_rate": 8.525472427533156e-06, | |
| "loss": 0.3627908229827881, | |
| "memory(GiB)": 77.28, | |
| "step": 1755, | |
| "token_acc": 0.8926028719681429, | |
| "train_speed(iter/s)": 0.014398 | |
| }, | |
| { | |
| "epoch": 0.563177472901084, | |
| "grad_norm": 0.03655306695315087, | |
| "learning_rate": 8.474132997299521e-06, | |
| "loss": 0.36844007968902587, | |
| "memory(GiB)": 77.28, | |
| "step": 1760, | |
| "token_acc": 0.9042783419344098, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.5647774089036438, | |
| "grad_norm": 0.035314820603192965, | |
| "learning_rate": 8.422834710894434e-06, | |
| "loss": 0.3652467966079712, | |
| "memory(GiB)": 77.28, | |
| "step": 1765, | |
| "token_acc": 0.9266847055791779, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.5663773449062037, | |
| "grad_norm": 0.03577687703884473, | |
| "learning_rate": 8.371578951536689e-06, | |
| "loss": 0.3631904602050781, | |
| "memory(GiB)": 77.28, | |
| "step": 1770, | |
| "token_acc": 0.9114650595494332, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.5679772809087636, | |
| "grad_norm": 0.034291004661375586, | |
| "learning_rate": 8.320367101298351e-06, | |
| "loss": 0.3591639280319214, | |
| "memory(GiB)": 77.28, | |
| "step": 1775, | |
| "token_acc": 0.8908784817875727, | |
| "train_speed(iter/s)": 0.014399 | |
| }, | |
| { | |
| "epoch": 0.5695772169113236, | |
| "grad_norm": 0.03531566113853678, | |
| "learning_rate": 8.26920054106753e-06, | |
| "loss": 0.36348772048950195, | |
| "memory(GiB)": 77.28, | |
| "step": 1780, | |
| "token_acc": 0.9099979214300561, | |
| "train_speed(iter/s)": 0.014401 | |
| }, | |
| { | |
| "epoch": 0.5711771529138835, | |
| "grad_norm": 0.034798094575765916, | |
| "learning_rate": 8.218080650511107e-06, | |
| "loss": 0.35968499183654784, | |
| "memory(GiB)": 77.28, | |
| "step": 1785, | |
| "token_acc": 0.8964790217162134, | |
| "train_speed(iter/s)": 0.014402 | |
| }, | |
| { | |
| "epoch": 0.5727770889164433, | |
| "grad_norm": 0.03657750435790097, | |
| "learning_rate": 8.167008808037568e-06, | |
| "loss": 0.3568159341812134, | |
| "memory(GiB)": 77.28, | |
| "step": 1790, | |
| "token_acc": 0.905320813771518, | |
| "train_speed(iter/s)": 0.014402 | |
| }, | |
| { | |
| "epoch": 0.5743770249190032, | |
| "grad_norm": 0.034079547262996786, | |
| "learning_rate": 8.115986390759805e-06, | |
| "loss": 0.3550254821777344, | |
| "memory(GiB)": 77.28, | |
| "step": 1795, | |
| "token_acc": 0.8698279018674479, | |
| "train_speed(iter/s)": 0.014402 | |
| }, | |
| { | |
| "epoch": 0.5759769609215631, | |
| "grad_norm": 0.0358502386641742, | |
| "learning_rate": 8.065014774458004e-06, | |
| "loss": 0.3728140592575073, | |
| "memory(GiB)": 77.28, | |
| "step": 1800, | |
| "token_acc": 0.8613029680791487, | |
| "train_speed(iter/s)": 0.014403 | |
| }, | |
| { | |
| "epoch": 0.5775768969241231, | |
| "grad_norm": 0.03701314908573154, | |
| "learning_rate": 8.014095333542548e-06, | |
| "loss": 0.36500091552734376, | |
| "memory(GiB)": 77.28, | |
| "step": 1805, | |
| "token_acc": 0.8857192859642982, | |
| "train_speed(iter/s)": 0.014405 | |
| }, | |
| { | |
| "epoch": 0.579176832926683, | |
| "grad_norm": 0.03679183269002458, | |
| "learning_rate": 7.963229441016938e-06, | |
| "loss": 0.3736963987350464, | |
| "memory(GiB)": 77.28, | |
| "step": 1810, | |
| "token_acc": 0.9040948275862069, | |
| "train_speed(iter/s)": 0.014406 | |
| }, | |
| { | |
| "epoch": 0.5807767689292428, | |
| "grad_norm": 0.03681323611591806, | |
| "learning_rate": 7.912418468440794e-06, | |
| "loss": 0.35898847579956056, | |
| "memory(GiB)": 77.28, | |
| "step": 1815, | |
| "token_acc": 0.9207317073170732, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.5823767049318027, | |
| "grad_norm": 0.0357736878813674, | |
| "learning_rate": 7.861663785892857e-06, | |
| "loss": 0.361141300201416, | |
| "memory(GiB)": 77.28, | |
| "step": 1820, | |
| "token_acc": 0.9049714034315882, | |
| "train_speed(iter/s)": 0.014408 | |
| }, | |
| { | |
| "epoch": 0.5839766409343626, | |
| "grad_norm": 0.0351745332589475, | |
| "learning_rate": 7.810966761934053e-06, | |
| "loss": 0.3606626272201538, | |
| "memory(GiB)": 77.28, | |
| "step": 1825, | |
| "token_acc": 0.8948683015440508, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.5855765769369226, | |
| "grad_norm": 0.037435806949626366, | |
| "learning_rate": 7.760328763570589e-06, | |
| "loss": 0.3612012147903442, | |
| "memory(GiB)": 77.28, | |
| "step": 1830, | |
| "token_acc": 0.8970428858956495, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.5871765129394825, | |
| "grad_norm": 0.03532540907383151, | |
| "learning_rate": 7.709751156217088e-06, | |
| "loss": 0.3607369661331177, | |
| "memory(GiB)": 77.28, | |
| "step": 1835, | |
| "token_acc": 0.8445970365016263, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.5887764489420423, | |
| "grad_norm": 0.037979717396771834, | |
| "learning_rate": 7.659235303659784e-06, | |
| "loss": 0.36890883445739747, | |
| "memory(GiB)": 77.28, | |
| "step": 1840, | |
| "token_acc": 0.9026708176306735, | |
| "train_speed(iter/s)": 0.014411 | |
| }, | |
| { | |
| "epoch": 0.5903763849446022, | |
| "grad_norm": 0.036073467557711535, | |
| "learning_rate": 7.608782568019729e-06, | |
| "loss": 0.35541131496429446, | |
| "memory(GiB)": 77.28, | |
| "step": 1845, | |
| "token_acc": 0.8726491133799033, | |
| "train_speed(iter/s)": 0.014415 | |
| }, | |
| { | |
| "epoch": 0.5919763209471621, | |
| "grad_norm": 0.03583872104637772, | |
| "learning_rate": 7.558394309716088e-06, | |
| "loss": 0.36942641735076903, | |
| "memory(GiB)": 77.28, | |
| "step": 1850, | |
| "token_acc": 0.8708656432979902, | |
| "train_speed(iter/s)": 0.014415 | |
| }, | |
| { | |
| "epoch": 0.593576256949722, | |
| "grad_norm": 0.036236485857737255, | |
| "learning_rate": 7.508071887429433e-06, | |
| "loss": 0.3710246801376343, | |
| "memory(GiB)": 77.28, | |
| "step": 1855, | |
| "token_acc": 0.921398891966759, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.5951761929522819, | |
| "grad_norm": 0.03640169386223587, | |
| "learning_rate": 7.4578166580651335e-06, | |
| "loss": 0.3630064010620117, | |
| "memory(GiB)": 77.28, | |
| "step": 1860, | |
| "token_acc": 0.9057997783524196, | |
| "train_speed(iter/s)": 0.014416 | |
| }, | |
| { | |
| "epoch": 0.5967761289548418, | |
| "grad_norm": 0.03390146765654374, | |
| "learning_rate": 7.4076299767167325e-06, | |
| "loss": 0.3687079429626465, | |
| "memory(GiB)": 77.28, | |
| "step": 1865, | |
| "token_acc": 0.8828963051251489, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.5983760649574017, | |
| "grad_norm": 0.034010107936428, | |
| "learning_rate": 7.35751319662945e-06, | |
| "loss": 0.36475975513458253, | |
| "memory(GiB)": 77.28, | |
| "step": 1870, | |
| "token_acc": 0.9084216196803735, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.5999760009599616, | |
| "grad_norm": 0.03677793324767255, | |
| "learning_rate": 7.307467669163655e-06, | |
| "loss": 0.36134514808654783, | |
| "memory(GiB)": 77.28, | |
| "step": 1875, | |
| "token_acc": 0.8969276511397423, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.6015759369625215, | |
| "grad_norm": 0.03620375763366839, | |
| "learning_rate": 7.25749474375846e-06, | |
| "loss": 0.3645354747772217, | |
| "memory(GiB)": 77.28, | |
| "step": 1880, | |
| "token_acc": 0.9285598836269597, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.6031758729650813, | |
| "grad_norm": 0.03789666553237776, | |
| "learning_rate": 7.207595767895303e-06, | |
| "loss": 0.3591428756713867, | |
| "memory(GiB)": 77.28, | |
| "step": 1885, | |
| "token_acc": 0.8843816469158311, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.6047758089676413, | |
| "grad_norm": 0.03881137375316804, | |
| "learning_rate": 7.157772087061645e-06, | |
| "loss": 0.3609945297241211, | |
| "memory(GiB)": 77.28, | |
| "step": 1890, | |
| "token_acc": 0.8922645477915401, | |
| "train_speed(iter/s)": 0.014419 | |
| }, | |
| { | |
| "epoch": 0.6063757449702012, | |
| "grad_norm": 0.036554160329644855, | |
| "learning_rate": 7.108025044714661e-06, | |
| "loss": 0.35931782722473143, | |
| "memory(GiB)": 77.28, | |
| "step": 1895, | |
| "token_acc": 0.9164502825721704, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.6079756809727611, | |
| "grad_norm": 0.035159911064239865, | |
| "learning_rate": 7.058355982245038e-06, | |
| "loss": 0.35569937229156495, | |
| "memory(GiB)": 77.28, | |
| "step": 1900, | |
| "token_acc": 0.8982567884679853, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.609575616975321, | |
| "grad_norm": 0.03716807984128876, | |
| "learning_rate": 7.00876623894079e-06, | |
| "loss": 0.35586116313934324, | |
| "memory(GiB)": 77.28, | |
| "step": 1905, | |
| "token_acc": 0.8946164199192463, | |
| "train_speed(iter/s)": 0.014419 | |
| }, | |
| { | |
| "epoch": 0.6111755529778808, | |
| "grad_norm": 0.037084671519224476, | |
| "learning_rate": 6.959257151951153e-06, | |
| "loss": 0.3600043773651123, | |
| "memory(GiB)": 77.28, | |
| "step": 1910, | |
| "token_acc": 0.9071520500091929, | |
| "train_speed(iter/s)": 0.014421 | |
| }, | |
| { | |
| "epoch": 0.6127754889804408, | |
| "grad_norm": 0.03475843599873702, | |
| "learning_rate": 6.909830056250527e-06, | |
| "loss": 0.36089887619018557, | |
| "memory(GiB)": 77.28, | |
| "step": 1915, | |
| "token_acc": 0.9130308318789995, | |
| "train_speed(iter/s)": 0.014422 | |
| }, | |
| { | |
| "epoch": 0.6143754249830007, | |
| "grad_norm": 0.0383438952624416, | |
| "learning_rate": 6.860486284602479e-06, | |
| "loss": 0.35850651264190675, | |
| "memory(GiB)": 77.28, | |
| "step": 1920, | |
| "token_acc": 0.9072142546718818, | |
| "train_speed(iter/s)": 0.014423 | |
| }, | |
| { | |
| "epoch": 0.6159753609855606, | |
| "grad_norm": 0.038359374478266664, | |
| "learning_rate": 6.8112271675238154e-06, | |
| "loss": 0.3597878456115723, | |
| "memory(GiB)": 77.28, | |
| "step": 1925, | |
| "token_acc": 0.8963350785340314, | |
| "train_speed(iter/s)": 0.014425 | |
| }, | |
| { | |
| "epoch": 0.6175752969881205, | |
| "grad_norm": 0.03627563124845106, | |
| "learning_rate": 6.762054033248681e-06, | |
| "loss": 0.35578844547271726, | |
| "memory(GiB)": 77.28, | |
| "step": 1930, | |
| "token_acc": 0.8670747704416266, | |
| "train_speed(iter/s)": 0.014425 | |
| }, | |
| { | |
| "epoch": 0.6191752329906803, | |
| "grad_norm": 0.03684144075866297, | |
| "learning_rate": 6.712968207692778e-06, | |
| "loss": 0.3531275033950806, | |
| "memory(GiB)": 77.28, | |
| "step": 1935, | |
| "token_acc": 0.8941378235110695, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.6207751689932403, | |
| "grad_norm": 0.03687953126630672, | |
| "learning_rate": 6.663971014417585e-06, | |
| "loss": 0.3559092044830322, | |
| "memory(GiB)": 77.28, | |
| "step": 1940, | |
| "token_acc": 0.8794438073394495, | |
| "train_speed(iter/s)": 0.014427 | |
| }, | |
| { | |
| "epoch": 0.6223751049958002, | |
| "grad_norm": 0.03271894900825819, | |
| "learning_rate": 6.615063774594677e-06, | |
| "loss": 0.3499966859817505, | |
| "memory(GiB)": 77.28, | |
| "step": 1945, | |
| "token_acc": 0.9143808777429467, | |
| "train_speed(iter/s)": 0.014427 | |
| }, | |
| { | |
| "epoch": 0.6239750409983601, | |
| "grad_norm": 0.03670229290341502, | |
| "learning_rate": 6.566247806970119e-06, | |
| "loss": 0.3593435525894165, | |
| "memory(GiB)": 77.28, | |
| "step": 1950, | |
| "token_acc": 0.8722057635335309, | |
| "train_speed(iter/s)": 0.014427 | |
| }, | |
| { | |
| "epoch": 0.62557497700092, | |
| "grad_norm": 0.03589472224235785, | |
| "learning_rate": 6.5175244278288705e-06, | |
| "loss": 0.35672483444213865, | |
| "memory(GiB)": 77.28, | |
| "step": 1955, | |
| "token_acc": 0.8869902912621359, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.6271749130034798, | |
| "grad_norm": 0.0354115189065044, | |
| "learning_rate": 6.468894950959336e-06, | |
| "loss": 0.3563361167907715, | |
| "memory(GiB)": 77.28, | |
| "step": 1960, | |
| "token_acc": 0.872582685703958, | |
| "train_speed(iter/s)": 0.014427 | |
| }, | |
| { | |
| "epoch": 0.6287748490060397, | |
| "grad_norm": 0.03855982219631724, | |
| "learning_rate": 6.420360687617897e-06, | |
| "loss": 0.35960986614227297, | |
| "memory(GiB)": 77.28, | |
| "step": 1965, | |
| "token_acc": 0.9085308941571775, | |
| "train_speed(iter/s)": 0.014429 | |
| }, | |
| { | |
| "epoch": 0.6303747850085997, | |
| "grad_norm": 0.0363939489470217, | |
| "learning_rate": 6.3719229464935915e-06, | |
| "loss": 0.36258764266967775, | |
| "memory(GiB)": 77.28, | |
| "step": 1970, | |
| "token_acc": 0.8915779283639884, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.6319747210111596, | |
| "grad_norm": 0.03622652969014867, | |
| "learning_rate": 6.323583033672799e-06, | |
| "loss": 0.35306107997894287, | |
| "memory(GiB)": 77.28, | |
| "step": 1975, | |
| "token_acc": 0.892795055051188, | |
| "train_speed(iter/s)": 0.014429 | |
| }, | |
| { | |
| "epoch": 0.6335746570137194, | |
| "grad_norm": 0.0359741868188003, | |
| "learning_rate": 6.275342252604044e-06, | |
| "loss": 0.3589993715286255, | |
| "memory(GiB)": 77.28, | |
| "step": 1980, | |
| "token_acc": 0.8946890603722197, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.6351745930162793, | |
| "grad_norm": 0.03712206781639858, | |
| "learning_rate": 6.22720190406283e-06, | |
| "loss": 0.3716681241989136, | |
| "memory(GiB)": 77.28, | |
| "step": 1985, | |
| "token_acc": 0.9078609119199026, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.6367745290188392, | |
| "grad_norm": 0.0356723794869841, | |
| "learning_rate": 6.179163286116581e-06, | |
| "loss": 0.35133976936340333, | |
| "memory(GiB)": 77.28, | |
| "step": 1990, | |
| "token_acc": 0.9327153762268267, | |
| "train_speed(iter/s)": 0.014431 | |
| }, | |
| { | |
| "epoch": 0.6383744650213992, | |
| "grad_norm": 0.03536609511126974, | |
| "learning_rate": 6.13122769408963e-06, | |
| "loss": 0.35833446979522704, | |
| "memory(GiB)": 77.28, | |
| "step": 1995, | |
| "token_acc": 0.882003614768913, | |
| "train_speed(iter/s)": 0.014432 | |
| }, | |
| { | |
| "epoch": 0.6399744010239591, | |
| "grad_norm": 0.03362321620964987, | |
| "learning_rate": 6.083396420528298e-06, | |
| "loss": 0.3585667610168457, | |
| "memory(GiB)": 77.28, | |
| "step": 2000, | |
| "token_acc": 0.9170406167299505, | |
| "train_speed(iter/s)": 0.014433 | |
| }, | |
| { | |
| "epoch": 0.6399744010239591, | |
| "eval_loss": 0.6020672917366028, | |
| "eval_runtime": 164.3521, | |
| "eval_samples_per_second": 122.225, | |
| "eval_steps_per_second": 0.615, | |
| "eval_token_acc": 0.8943001355471165, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.6415743370265189, | |
| "grad_norm": 0.03472639275538625, | |
| "learning_rate": 6.0356707551660434e-06, | |
| "loss": 0.36132421493530276, | |
| "memory(GiB)": 77.28, | |
| "step": 2005, | |
| "token_acc": 0.915687276443536, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.6431742730290788, | |
| "grad_norm": 0.0354392362366712, | |
| "learning_rate": 5.988051984888668e-06, | |
| "loss": 0.35641605854034425, | |
| "memory(GiB)": 77.28, | |
| "step": 2010, | |
| "token_acc": 0.9036523929471033, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.6447742090316387, | |
| "grad_norm": 0.036793660802490545, | |
| "learning_rate": 5.940541393699646e-06, | |
| "loss": 0.35499589443206786, | |
| "memory(GiB)": 77.28, | |
| "step": 2015, | |
| "token_acc": 0.9017251405311106, | |
| "train_speed(iter/s)": 0.014413 | |
| }, | |
| { | |
| "epoch": 0.6463741450341987, | |
| "grad_norm": 0.0356096679234017, | |
| "learning_rate": 5.893140262685469e-06, | |
| "loss": 0.3537860870361328, | |
| "memory(GiB)": 77.28, | |
| "step": 2020, | |
| "token_acc": 0.9089422028353326, | |
| "train_speed(iter/s)": 0.014415 | |
| }, | |
| { | |
| "epoch": 0.6479740810367586, | |
| "grad_norm": 0.038785732749065785, | |
| "learning_rate": 5.845849869981137e-06, | |
| "loss": 0.36054995059967043, | |
| "memory(GiB)": 77.28, | |
| "step": 2025, | |
| "token_acc": 0.8981469809655868, | |
| "train_speed(iter/s)": 0.014417 | |
| }, | |
| { | |
| "epoch": 0.6495740170393184, | |
| "grad_norm": 0.03604630935256211, | |
| "learning_rate": 5.7986714907356614e-06, | |
| "loss": 0.3670691728591919, | |
| "memory(GiB)": 77.28, | |
| "step": 2030, | |
| "token_acc": 0.9045626349892009, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.6511739530418783, | |
| "grad_norm": 0.03791812035130847, | |
| "learning_rate": 5.751606397077703e-06, | |
| "loss": 0.35528743267059326, | |
| "memory(GiB)": 77.28, | |
| "step": 2035, | |
| "token_acc": 0.9075596816976127, | |
| "train_speed(iter/s)": 0.014418 | |
| }, | |
| { | |
| "epoch": 0.6527738890444382, | |
| "grad_norm": 0.035478901481675915, | |
| "learning_rate": 5.704655858081268e-06, | |
| "loss": 0.34533185958862306, | |
| "memory(GiB)": 77.28, | |
| "step": 2040, | |
| "token_acc": 0.9188615123194562, | |
| "train_speed(iter/s)": 0.01442 | |
| }, | |
| { | |
| "epoch": 0.6543738250469981, | |
| "grad_norm": 0.03751046597155776, | |
| "learning_rate": 5.6578211397314765e-06, | |
| "loss": 0.3631927967071533, | |
| "memory(GiB)": 77.28, | |
| "step": 2045, | |
| "token_acc": 0.8758772533370028, | |
| "train_speed(iter/s)": 0.014419 | |
| }, | |
| { | |
| "epoch": 0.6559737610495581, | |
| "grad_norm": 0.035283669234402425, | |
| "learning_rate": 5.611103504890444e-06, | |
| "loss": 0.3572983264923096, | |
| "memory(GiB)": 77.28, | |
| "step": 2050, | |
| "token_acc": 0.894204990719736, | |
| "train_speed(iter/s)": 0.014419 | |
| }, | |
| { | |
| "epoch": 0.6575736970521179, | |
| "grad_norm": 0.035514482756984364, | |
| "learning_rate": 5.564504213263205e-06, | |
| "loss": 0.34580564498901367, | |
| "memory(GiB)": 77.28, | |
| "step": 2055, | |
| "token_acc": 0.8778079008520526, | |
| "train_speed(iter/s)": 0.01442 | |
| }, | |
| { | |
| "epoch": 0.6591736330546778, | |
| "grad_norm": 0.03510405358704929, | |
| "learning_rate": 5.5180245213637785e-06, | |
| "loss": 0.35724987983703616, | |
| "memory(GiB)": 77.28, | |
| "step": 2060, | |
| "token_acc": 0.9040819075845345, | |
| "train_speed(iter/s)": 0.014421 | |
| }, | |
| { | |
| "epoch": 0.6607735690572377, | |
| "grad_norm": 0.03558952127633272, | |
| "learning_rate": 5.4716656824812505e-06, | |
| "loss": 0.3560892343521118, | |
| "memory(GiB)": 77.28, | |
| "step": 2065, | |
| "token_acc": 0.9103578154425612, | |
| "train_speed(iter/s)": 0.014421 | |
| }, | |
| { | |
| "epoch": 0.6623735050597976, | |
| "grad_norm": 0.0352867930448959, | |
| "learning_rate": 5.425428946646016e-06, | |
| "loss": 0.3594446897506714, | |
| "memory(GiB)": 77.28, | |
| "step": 2070, | |
| "token_acc": 0.9159539473684211, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.6639734410623576, | |
| "grad_norm": 0.035189795121078615, | |
| "learning_rate": 5.379315560596038e-06, | |
| "loss": 0.3580685377120972, | |
| "memory(GiB)": 77.28, | |
| "step": 2075, | |
| "token_acc": 0.872678750138997, | |
| "train_speed(iter/s)": 0.014425 | |
| }, | |
| { | |
| "epoch": 0.6655733770649174, | |
| "grad_norm": 0.03660603391888094, | |
| "learning_rate": 5.333326767743263e-06, | |
| "loss": 0.35906505584716797, | |
| "memory(GiB)": 77.28, | |
| "step": 2080, | |
| "token_acc": 0.8538508186779866, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.6671733130674773, | |
| "grad_norm": 0.0357681196465874, | |
| "learning_rate": 5.287463808140069e-06, | |
| "loss": 0.3485325813293457, | |
| "memory(GiB)": 77.28, | |
| "step": 2085, | |
| "token_acc": 0.8672191853288662, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.6687732490700372, | |
| "grad_norm": 0.03662434567811883, | |
| "learning_rate": 5.241727918445836e-06, | |
| "loss": 0.3556757688522339, | |
| "memory(GiB)": 77.28, | |
| "step": 2090, | |
| "token_acc": 0.915863277826468, | |
| "train_speed(iter/s)": 0.014427 | |
| }, | |
| { | |
| "epoch": 0.6703731850725971, | |
| "grad_norm": 0.036729664500264415, | |
| "learning_rate": 5.1961203318936116e-06, | |
| "loss": 0.3540231466293335, | |
| "memory(GiB)": 77.28, | |
| "step": 2095, | |
| "token_acc": 0.8912253374870197, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.6719731210751569, | |
| "grad_norm": 0.03638060418817606, | |
| "learning_rate": 5.1506422782568345e-06, | |
| "loss": 0.36181719303131105, | |
| "memory(GiB)": 77.28, | |
| "step": 2100, | |
| "token_acc": 0.9020928899082569, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.6735730570777169, | |
| "grad_norm": 0.035195041704010034, | |
| "learning_rate": 5.105294983816203e-06, | |
| "loss": 0.35322787761688235, | |
| "memory(GiB)": 77.28, | |
| "step": 2105, | |
| "token_acc": 0.8900983606557377, | |
| "train_speed(iter/s)": 0.014429 | |
| }, | |
| { | |
| "epoch": 0.6751729930802768, | |
| "grad_norm": 0.03617857368359474, | |
| "learning_rate": 5.060079671326577e-06, | |
| "loss": 0.355142879486084, | |
| "memory(GiB)": 77.28, | |
| "step": 2110, | |
| "token_acc": 0.8857596191987307, | |
| "train_speed(iter/s)": 0.014429 | |
| }, | |
| { | |
| "epoch": 0.6767729290828367, | |
| "grad_norm": 0.035676130230209005, | |
| "learning_rate": 5.014997559984045e-06, | |
| "loss": 0.35041203498840334, | |
| "memory(GiB)": 77.28, | |
| "step": 2115, | |
| "token_acc": 0.8745164003364172, | |
| "train_speed(iter/s)": 0.014431 | |
| }, | |
| { | |
| "epoch": 0.6783728650853966, | |
| "grad_norm": 0.03733616225344439, | |
| "learning_rate": 4.970049865393009e-06, | |
| "loss": 0.35726475715637207, | |
| "memory(GiB)": 77.28, | |
| "step": 2120, | |
| "token_acc": 0.8842804428044281, | |
| "train_speed(iter/s)": 0.014432 | |
| }, | |
| { | |
| "epoch": 0.6799728010879564, | |
| "grad_norm": 0.03652134614213375, | |
| "learning_rate": 4.925237799533445e-06, | |
| "loss": 0.3587599039077759, | |
| "memory(GiB)": 77.28, | |
| "step": 2125, | |
| "token_acc": 0.9209918373633144, | |
| "train_speed(iter/s)": 0.014433 | |
| }, | |
| { | |
| "epoch": 0.6815727370905164, | |
| "grad_norm": 0.03713234057671444, | |
| "learning_rate": 4.880562570728188e-06, | |
| "loss": 0.3505564212799072, | |
| "memory(GiB)": 77.28, | |
| "step": 2130, | |
| "token_acc": 0.9003831417624522, | |
| "train_speed(iter/s)": 0.014434 | |
| }, | |
| { | |
| "epoch": 0.6831726730930763, | |
| "grad_norm": 0.03570712641296637, | |
| "learning_rate": 4.836025383610382e-06, | |
| "loss": 0.35914387702941897, | |
| "memory(GiB)": 77.28, | |
| "step": 2135, | |
| "token_acc": 0.8888649580012923, | |
| "train_speed(iter/s)": 0.014434 | |
| }, | |
| { | |
| "epoch": 0.6847726090956362, | |
| "grad_norm": 0.034457774830109436, | |
| "learning_rate": 4.791627439090975e-06, | |
| "loss": 0.35318760871887206, | |
| "memory(GiB)": 77.28, | |
| "step": 2140, | |
| "token_acc": 0.9001070281840885, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.6863725450981961, | |
| "grad_norm": 0.03671839147293295, | |
| "learning_rate": 4.74736993432634e-06, | |
| "loss": 0.3529956579208374, | |
| "memory(GiB)": 77.28, | |
| "step": 2145, | |
| "token_acc": 0.909256801592568, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.6879724811007559, | |
| "grad_norm": 0.03474714702977324, | |
| "learning_rate": 4.703254062686017e-06, | |
| "loss": 0.3566461086273193, | |
| "memory(GiB)": 77.28, | |
| "step": 2150, | |
| "token_acc": 0.9030673019654556, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.6895724171033158, | |
| "grad_norm": 0.035790167210903036, | |
| "learning_rate": 4.6592810137205e-06, | |
| "loss": 0.35962681770324706, | |
| "memory(GiB)": 77.28, | |
| "step": 2155, | |
| "token_acc": 0.9103856266432954, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.6911723531058758, | |
| "grad_norm": 0.03487739858408488, | |
| "learning_rate": 4.615451973129196e-06, | |
| "loss": 0.35558667182922366, | |
| "memory(GiB)": 77.28, | |
| "step": 2160, | |
| "token_acc": 0.8970679975046787, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.6927722891084357, | |
| "grad_norm": 0.03853196821530562, | |
| "learning_rate": 4.571768122728421e-06, | |
| "loss": 0.35672924518585203, | |
| "memory(GiB)": 77.28, | |
| "step": 2165, | |
| "token_acc": 0.8965443686006825, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.6943722251109956, | |
| "grad_norm": 0.0373570970369309, | |
| "learning_rate": 4.528230640419562e-06, | |
| "loss": 0.3587866067886353, | |
| "memory(GiB)": 77.28, | |
| "step": 2170, | |
| "token_acc": 0.8806665033080128, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.6959721611135554, | |
| "grad_norm": 0.03604883184517471, | |
| "learning_rate": 4.4848407001572945e-06, | |
| "loss": 0.3512024164199829, | |
| "memory(GiB)": 77.28, | |
| "step": 2175, | |
| "token_acc": 0.8832857595940374, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.6975720971161153, | |
| "grad_norm": 0.03504294349528598, | |
| "learning_rate": 4.441599471917946e-06, | |
| "loss": 0.34823672771453856, | |
| "memory(GiB)": 77.28, | |
| "step": 2180, | |
| "token_acc": 0.8825027861805445, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.6991720331186753, | |
| "grad_norm": 0.035895231783871086, | |
| "learning_rate": 4.398508121667925e-06, | |
| "loss": 0.34151611328125, | |
| "memory(GiB)": 77.28, | |
| "step": 2185, | |
| "token_acc": 0.879415347137637, | |
| "train_speed(iter/s)": 0.01444 | |
| }, | |
| { | |
| "epoch": 0.7007719691212352, | |
| "grad_norm": 0.03711717710215307, | |
| "learning_rate": 4.355567811332311e-06, | |
| "loss": 0.35381360054016114, | |
| "memory(GiB)": 77.28, | |
| "step": 2190, | |
| "token_acc": 0.8886005190656818, | |
| "train_speed(iter/s)": 0.01444 | |
| }, | |
| { | |
| "epoch": 0.702371905123795, | |
| "grad_norm": 0.03875724771094195, | |
| "learning_rate": 4.312779698763493e-06, | |
| "loss": 0.35048136711120603, | |
| "memory(GiB)": 77.28, | |
| "step": 2195, | |
| "token_acc": 0.9109351806036615, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.7039718411263549, | |
| "grad_norm": 0.037222751841702796, | |
| "learning_rate": 4.270144937709981e-06, | |
| "loss": 0.3498215913772583, | |
| "memory(GiB)": 77.28, | |
| "step": 2200, | |
| "token_acc": 0.8952087007642563, | |
| "train_speed(iter/s)": 0.014441 | |
| }, | |
| { | |
| "epoch": 0.7055717771289148, | |
| "grad_norm": 0.03655432132006705, | |
| "learning_rate": 4.227664677785264e-06, | |
| "loss": 0.3591599702835083, | |
| "memory(GiB)": 77.28, | |
| "step": 2205, | |
| "token_acc": 0.8989089904709294, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.7071717131314748, | |
| "grad_norm": 0.03539648204157617, | |
| "learning_rate": 4.1853400644368395e-06, | |
| "loss": 0.3569194316864014, | |
| "memory(GiB)": 77.28, | |
| "step": 2210, | |
| "token_acc": 0.9273023393544566, | |
| "train_speed(iter/s)": 0.014441 | |
| }, | |
| { | |
| "epoch": 0.7087716491340347, | |
| "grad_norm": 0.037916985081009914, | |
| "learning_rate": 4.143172238915302e-06, | |
| "loss": 0.35884747505187986, | |
| "memory(GiB)": 77.28, | |
| "step": 2215, | |
| "token_acc": 0.8967870817379724, | |
| "train_speed(iter/s)": 0.014441 | |
| }, | |
| { | |
| "epoch": 0.7103715851365945, | |
| "grad_norm": 0.03801135802626227, | |
| "learning_rate": 4.101162338243595e-06, | |
| "loss": 0.357472562789917, | |
| "memory(GiB)": 77.28, | |
| "step": 2220, | |
| "token_acc": 0.8912637476654908, | |
| "train_speed(iter/s)": 0.01444 | |
| }, | |
| { | |
| "epoch": 0.7119715211391544, | |
| "grad_norm": 0.0387640824372489, | |
| "learning_rate": 4.059311495186338e-06, | |
| "loss": 0.3565319538116455, | |
| "memory(GiB)": 77.28, | |
| "step": 2225, | |
| "token_acc": 0.8952764555108019, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.7135714571417143, | |
| "grad_norm": 0.03926080873946399, | |
| "learning_rate": 4.017620838219276e-06, | |
| "loss": 0.3521524667739868, | |
| "memory(GiB)": 77.28, | |
| "step": 2230, | |
| "token_acc": 0.8861508810572687, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.7151713931442742, | |
| "grad_norm": 0.03756015577315046, | |
| "learning_rate": 3.9760914914988716e-06, | |
| "loss": 0.3639491558074951, | |
| "memory(GiB)": 77.28, | |
| "step": 2235, | |
| "token_acc": 0.8872466216216216, | |
| "train_speed(iter/s)": 0.01444 | |
| }, | |
| { | |
| "epoch": 0.7167713291468342, | |
| "grad_norm": 0.036199547656564544, | |
| "learning_rate": 3.93472457483197e-06, | |
| "loss": 0.3500187635421753, | |
| "memory(GiB)": 77.28, | |
| "step": 2240, | |
| "token_acc": 0.8480381530457403, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.718371265149394, | |
| "grad_norm": 0.03683592500962426, | |
| "learning_rate": 3.893521203645618e-06, | |
| "loss": 0.35996718406677247, | |
| "memory(GiB)": 77.28, | |
| "step": 2245, | |
| "token_acc": 0.9068561551757249, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.7199712011519539, | |
| "grad_norm": 0.03450560655549409, | |
| "learning_rate": 3.852482488956992e-06, | |
| "loss": 0.35292108058929444, | |
| "memory(GiB)": 77.28, | |
| "step": 2250, | |
| "token_acc": 0.8864724387908631, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.7199712011519539, | |
| "eval_loss": 0.6000239849090576, | |
| "eval_runtime": 169.3665, | |
| "eval_samples_per_second": 118.607, | |
| "eval_steps_per_second": 0.596, | |
| "eval_token_acc": 0.8950660718419391, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.7215711371545138, | |
| "grad_norm": 0.036073313606157474, | |
| "learning_rate": 3.8116095373434204e-06, | |
| "loss": 0.35668814182281494, | |
| "memory(GiB)": 77.28, | |
| "step": 2255, | |
| "token_acc": 0.9087738494153047, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.7231710731570737, | |
| "grad_norm": 0.036174459675283856, | |
| "learning_rate": 3.7709034509125706e-06, | |
| "loss": 0.35418474674224854, | |
| "memory(GiB)": 77.28, | |
| "step": 2260, | |
| "token_acc": 0.8707964601769912, | |
| "train_speed(iter/s)": 0.014425 | |
| }, | |
| { | |
| "epoch": 0.7247710091596337, | |
| "grad_norm": 0.03567475035555587, | |
| "learning_rate": 3.7303653272727057e-06, | |
| "loss": 0.357358717918396, | |
| "memory(GiB)": 77.28, | |
| "step": 2265, | |
| "token_acc": 0.9060252913463923, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.7263709451621935, | |
| "grad_norm": 0.035715034790481305, | |
| "learning_rate": 3.689996259503116e-06, | |
| "loss": 0.3499811887741089, | |
| "memory(GiB)": 77.28, | |
| "step": 2270, | |
| "token_acc": 0.9101883788803397, | |
| "train_speed(iter/s)": 0.014427 | |
| }, | |
| { | |
| "epoch": 0.7279708811647534, | |
| "grad_norm": 0.03612086417148584, | |
| "learning_rate": 3.6497973361246153e-06, | |
| "loss": 0.3532618284225464, | |
| "memory(GiB)": 77.28, | |
| "step": 2275, | |
| "token_acc": 0.8859261596718208, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.7295708171673133, | |
| "grad_norm": 0.037097792645410424, | |
| "learning_rate": 3.609769641070221e-06, | |
| "loss": 0.34888529777526855, | |
| "memory(GiB)": 77.28, | |
| "step": 2280, | |
| "token_acc": 0.9103887168902649, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.7311707531698732, | |
| "grad_norm": 0.03547959936969023, | |
| "learning_rate": 3.569914253655896e-06, | |
| "loss": 0.35082759857177737, | |
| "memory(GiB)": 77.28, | |
| "step": 2285, | |
| "token_acc": 0.9120581352383298, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.7327706891724332, | |
| "grad_norm": 0.03706499179009722, | |
| "learning_rate": 3.530232248551466e-06, | |
| "loss": 0.36017541885375975, | |
| "memory(GiB)": 77.28, | |
| "step": 2290, | |
| "token_acc": 0.8559717087285003, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.734370625174993, | |
| "grad_norm": 0.03739569626098127, | |
| "learning_rate": 3.4907246957516416e-06, | |
| "loss": 0.3543466329574585, | |
| "memory(GiB)": 77.28, | |
| "step": 2295, | |
| "token_acc": 0.9116985376827896, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.7359705611775529, | |
| "grad_norm": 0.03646822377433634, | |
| "learning_rate": 3.4513926605471504e-06, | |
| "loss": 0.3665087461471558, | |
| "memory(GiB)": 77.28, | |
| "step": 2300, | |
| "token_acc": 0.8735919899874843, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.7375704971801128, | |
| "grad_norm": 0.03643726700416454, | |
| "learning_rate": 3.412237203496036e-06, | |
| "loss": 0.35367345809936523, | |
| "memory(GiB)": 77.28, | |
| "step": 2305, | |
| "token_acc": 0.8936760355029586, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.7391704331826727, | |
| "grad_norm": 0.03681350508730061, | |
| "learning_rate": 3.3732593803950354e-06, | |
| "loss": 0.3540062189102173, | |
| "memory(GiB)": 77.28, | |
| "step": 2310, | |
| "token_acc": 0.9164918170373478, | |
| "train_speed(iter/s)": 0.014431 | |
| }, | |
| { | |
| "epoch": 0.7407703691852325, | |
| "grad_norm": 0.03619863113544937, | |
| "learning_rate": 3.3344602422511343e-06, | |
| "loss": 0.3489154577255249, | |
| "memory(GiB)": 77.28, | |
| "step": 2315, | |
| "token_acc": 0.9134242883611251, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.7423703051877925, | |
| "grad_norm": 0.03739761580100826, | |
| "learning_rate": 3.2958408352532055e-06, | |
| "loss": 0.34918310642242434, | |
| "memory(GiB)": 77.28, | |
| "step": 2320, | |
| "token_acc": 0.8605150214592274, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.7439702411903524, | |
| "grad_norm": 0.035263909838795474, | |
| "learning_rate": 3.257402200743821e-06, | |
| "loss": 0.3549443960189819, | |
| "memory(GiB)": 77.28, | |
| "step": 2325, | |
| "token_acc": 0.8859731923730414, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.7455701771929123, | |
| "grad_norm": 0.038532084755221324, | |
| "learning_rate": 3.2191453751911505e-06, | |
| "loss": 0.362837553024292, | |
| "memory(GiB)": 77.28, | |
| "step": 2330, | |
| "token_acc": 0.9077399380804954, | |
| "train_speed(iter/s)": 0.014429 | |
| }, | |
| { | |
| "epoch": 0.7471701131954722, | |
| "grad_norm": 0.03622027927597768, | |
| "learning_rate": 3.1810713901610367e-06, | |
| "loss": 0.3503484964370728, | |
| "memory(GiB)": 77.28, | |
| "step": 2335, | |
| "token_acc": 0.8994184794314021, | |
| "train_speed(iter/s)": 0.014431 | |
| }, | |
| { | |
| "epoch": 0.748770049198032, | |
| "grad_norm": 0.03656899746448185, | |
| "learning_rate": 3.1431812722891598e-06, | |
| "loss": 0.3492277145385742, | |
| "memory(GiB)": 77.28, | |
| "step": 2340, | |
| "token_acc": 0.884628359383785, | |
| "train_speed(iter/s)": 0.014432 | |
| }, | |
| { | |
| "epoch": 0.750369985200592, | |
| "grad_norm": 0.03972433850747652, | |
| "learning_rate": 3.1054760432533626e-06, | |
| "loss": 0.3659966230392456, | |
| "memory(GiB)": 77.28, | |
| "step": 2345, | |
| "token_acc": 0.9043888952885613, | |
| "train_speed(iter/s)": 0.014433 | |
| }, | |
| { | |
| "epoch": 0.7519699212031519, | |
| "grad_norm": 0.037936615779197595, | |
| "learning_rate": 3.0679567197461135e-06, | |
| "loss": 0.35586345195770264, | |
| "memory(GiB)": 77.28, | |
| "step": 2350, | |
| "token_acc": 0.8697364435019691, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.7535698572057118, | |
| "grad_norm": 0.038657371745029284, | |
| "learning_rate": 3.0306243134470668e-06, | |
| "loss": 0.3520052909851074, | |
| "memory(GiB)": 77.28, | |
| "step": 2355, | |
| "token_acc": 0.9114033196809658, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.7551697932082717, | |
| "grad_norm": 0.03759781411569022, | |
| "learning_rate": 2.993479830995815e-06, | |
| "loss": 0.359484601020813, | |
| "memory(GiB)": 77.28, | |
| "step": 2360, | |
| "token_acc": 0.8960244648318043, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.7567697292108315, | |
| "grad_norm": 0.0361038891255062, | |
| "learning_rate": 2.9565242739647115e-06, | |
| "loss": 0.3532958269119263, | |
| "memory(GiB)": 77.28, | |
| "step": 2365, | |
| "token_acc": 0.9104216388225935, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7583696652133914, | |
| "grad_norm": 0.03903281093821544, | |
| "learning_rate": 2.919758638831893e-06, | |
| "loss": 0.3664171934127808, | |
| "memory(GiB)": 77.28, | |
| "step": 2370, | |
| "token_acc": 0.8849834016793595, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.7599696012159514, | |
| "grad_norm": 0.03883483895946455, | |
| "learning_rate": 2.8831839169543998e-06, | |
| "loss": 0.3517657995223999, | |
| "memory(GiB)": 77.28, | |
| "step": 2375, | |
| "token_acc": 0.903478904515174, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.7615695372185113, | |
| "grad_norm": 0.03569351570239587, | |
| "learning_rate": 2.84680109454143e-06, | |
| "loss": 0.35557854175567627, | |
| "memory(GiB)": 77.28, | |
| "step": 2380, | |
| "token_acc": 0.8889802631578947, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.7631694732210712, | |
| "grad_norm": 0.038188596422853896, | |
| "learning_rate": 2.810611152627777e-06, | |
| "loss": 0.3597451686859131, | |
| "memory(GiB)": 77.28, | |
| "step": 2385, | |
| "token_acc": 0.8827844799478317, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.764769409223631, | |
| "grad_norm": 0.03572439909987441, | |
| "learning_rate": 2.774615067047346e-06, | |
| "loss": 0.34901888370513917, | |
| "memory(GiB)": 77.28, | |
| "step": 2390, | |
| "token_acc": 0.8962715798636298, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.7663693452261909, | |
| "grad_norm": 0.03686595519302669, | |
| "learning_rate": 2.738813808406866e-06, | |
| "loss": 0.3472025156021118, | |
| "memory(GiB)": 77.28, | |
| "step": 2395, | |
| "token_acc": 0.9280912364945978, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.7679692812287509, | |
| "grad_norm": 0.03715332128853523, | |
| "learning_rate": 2.7032083420597e-06, | |
| "loss": 0.34778246879577634, | |
| "memory(GiB)": 77.28, | |
| "step": 2400, | |
| "token_acc": 0.9090736161308731, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7695692172313108, | |
| "grad_norm": 0.03817279860399444, | |
| "learning_rate": 2.667799628079829e-06, | |
| "loss": 0.35284740924835206, | |
| "memory(GiB)": 77.28, | |
| "step": 2405, | |
| "token_acc": 0.9096980255516841, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.7711691532338707, | |
| "grad_norm": 0.036302722459302404, | |
| "learning_rate": 2.6325886212359496e-06, | |
| "loss": 0.34749345779418944, | |
| "memory(GiB)": 77.28, | |
| "step": 2410, | |
| "token_acc": 0.9061160009027308, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7727690892364305, | |
| "grad_norm": 0.038102620992520056, | |
| "learning_rate": 2.5975762709657506e-06, | |
| "loss": 0.3531970739364624, | |
| "memory(GiB)": 77.28, | |
| "step": 2415, | |
| "token_acc": 0.8826328310864393, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.7743690252389904, | |
| "grad_norm": 0.03445225499859096, | |
| "learning_rate": 2.5627635213502832e-06, | |
| "loss": 0.3450269937515259, | |
| "memory(GiB)": 77.28, | |
| "step": 2420, | |
| "token_acc": 0.9214078466002271, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7759689612415503, | |
| "grad_norm": 0.03854094961415296, | |
| "learning_rate": 2.528151311088537e-06, | |
| "loss": 0.3500360012054443, | |
| "memory(GiB)": 77.28, | |
| "step": 2425, | |
| "token_acc": 0.8813531353135313, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.7775688972441103, | |
| "grad_norm": 0.03576826677739602, | |
| "learning_rate": 2.4937405734720964e-06, | |
| "loss": 0.3535548210144043, | |
| "memory(GiB)": 77.28, | |
| "step": 2430, | |
| "token_acc": 0.8837966985230234, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.7791688332466701, | |
| "grad_norm": 0.03767939273785534, | |
| "learning_rate": 2.459532236360007e-06, | |
| "loss": 0.34597823619842527, | |
| "memory(GiB)": 77.28, | |
| "step": 2435, | |
| "token_acc": 0.8772578890097933, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.78076876924923, | |
| "grad_norm": 0.036004849313210435, | |
| "learning_rate": 2.4255272221537295e-06, | |
| "loss": 0.34565279483795164, | |
| "memory(GiB)": 77.28, | |
| "step": 2440, | |
| "token_acc": 0.8803288090231314, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.7823687052517899, | |
| "grad_norm": 0.03905322522036309, | |
| "learning_rate": 2.391726447772279e-06, | |
| "loss": 0.36594700813293457, | |
| "memory(GiB)": 77.28, | |
| "step": 2445, | |
| "token_acc": 0.8882537089968695, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.7839686412543498, | |
| "grad_norm": 0.03730014372598652, | |
| "learning_rate": 2.3581308246275103e-06, | |
| "loss": 0.3568562507629395, | |
| "memory(GiB)": 77.28, | |
| "step": 2450, | |
| "token_acc": 0.9234494610217153, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7855685772569098, | |
| "grad_norm": 0.03868286134685204, | |
| "learning_rate": 2.324741258599521e-06, | |
| "loss": 0.35208520889282224, | |
| "memory(GiB)": 77.28, | |
| "step": 2455, | |
| "token_acc": 0.8954419212546969, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.7871685132594696, | |
| "grad_norm": 0.03733286652687736, | |
| "learning_rate": 2.29155865001225e-06, | |
| "loss": 0.34863691329956054, | |
| "memory(GiB)": 77.28, | |
| "step": 2460, | |
| "token_acc": 0.9080920564216778, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.7887684492620295, | |
| "grad_norm": 0.03699225546025446, | |
| "learning_rate": 2.2585838936091753e-06, | |
| "loss": 0.34832584857940674, | |
| "memory(GiB)": 77.28, | |
| "step": 2465, | |
| "token_acc": 0.9085607651038022, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7903683852645894, | |
| "grad_norm": 0.03946439413106149, | |
| "learning_rate": 2.225817878529214e-06, | |
| "loss": 0.35381317138671875, | |
| "memory(GiB)": 77.28, | |
| "step": 2470, | |
| "token_acc": 0.8874495646634105, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7919683212671493, | |
| "grad_norm": 0.0392896601295871, | |
| "learning_rate": 2.1932614882827196e-06, | |
| "loss": 0.35070300102233887, | |
| "memory(GiB)": 77.28, | |
| "step": 2475, | |
| "token_acc": 0.9032003160806006, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.7935682572697093, | |
| "grad_norm": 0.03806309185869093, | |
| "learning_rate": 2.160915600727688e-06, | |
| "loss": 0.34960522651672366, | |
| "memory(GiB)": 77.28, | |
| "step": 2480, | |
| "token_acc": 0.9318849089841457, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7951681932722691, | |
| "grad_norm": 0.037966940284694224, | |
| "learning_rate": 2.1287810880460636e-06, | |
| "loss": 0.3503120422363281, | |
| "memory(GiB)": 77.28, | |
| "step": 2485, | |
| "token_acc": 0.9095194647201946, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.796768129274829, | |
| "grad_norm": 0.036666564553806735, | |
| "learning_rate": 2.0968588167202265e-06, | |
| "loss": 0.3496053695678711, | |
| "memory(GiB)": 77.28, | |
| "step": 2490, | |
| "token_acc": 0.9117557251908397, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.7983680652773889, | |
| "grad_norm": 0.03639630529287135, | |
| "learning_rate": 2.0651496475096455e-06, | |
| "loss": 0.34689855575561523, | |
| "memory(GiB)": 77.28, | |
| "step": 2495, | |
| "token_acc": 0.8635149023638232, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7999680012799488, | |
| "grad_norm": 0.038547849012489435, | |
| "learning_rate": 2.03365443542764e-06, | |
| "loss": 0.35553674697875975, | |
| "memory(GiB)": 77.28, | |
| "step": 2500, | |
| "token_acc": 0.9040584668014305, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.7999680012799488, | |
| "eval_loss": 0.5981466770172119, | |
| "eval_runtime": 165.8098, | |
| "eval_samples_per_second": 121.151, | |
| "eval_steps_per_second": 0.609, | |
| "eval_token_acc": 0.8956903623836094, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.8015679372825087, | |
| "grad_norm": 0.03758764678842079, | |
| "learning_rate": 2.0023740297183536e-06, | |
| "loss": 0.3542864084243774, | |
| "memory(GiB)": 77.28, | |
| "step": 2505, | |
| "token_acc": 0.9013850415512465, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.8031678732850686, | |
| "grad_norm": 0.03968783826575613, | |
| "learning_rate": 1.971309273833828e-06, | |
| "loss": 0.35315916538238523, | |
| "memory(GiB)": 77.28, | |
| "step": 2510, | |
| "token_acc": 0.8885698905436928, | |
| "train_speed(iter/s)": 0.014423 | |
| }, | |
| { | |
| "epoch": 0.8047678092876285, | |
| "grad_norm": 0.03665700191714146, | |
| "learning_rate": 1.940461005411288e-06, | |
| "loss": 0.35584971904754636, | |
| "memory(GiB)": 77.28, | |
| "step": 2515, | |
| "token_acc": 0.9148000549677064, | |
| "train_speed(iter/s)": 0.014422 | |
| }, | |
| { | |
| "epoch": 0.8063677452901884, | |
| "grad_norm": 0.03809565053490125, | |
| "learning_rate": 1.9098300562505266e-06, | |
| "loss": 0.352116060256958, | |
| "memory(GiB)": 77.28, | |
| "step": 2520, | |
| "token_acc": 0.9041350472355583, | |
| "train_speed(iter/s)": 0.014423 | |
| }, | |
| { | |
| "epoch": 0.8079676812927483, | |
| "grad_norm": 0.037082731941368616, | |
| "learning_rate": 1.8794172522915022e-06, | |
| "loss": 0.3564736843109131, | |
| "memory(GiB)": 77.28, | |
| "step": 2525, | |
| "token_acc": 0.9011320754716982, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.8095676172953082, | |
| "grad_norm": 0.03536758455742058, | |
| "learning_rate": 1.849223413592046e-06, | |
| "loss": 0.3573369026184082, | |
| "memory(GiB)": 77.28, | |
| "step": 2530, | |
| "token_acc": 0.8907506702412868, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.811167553297868, | |
| "grad_norm": 0.0385223348984184, | |
| "learning_rate": 1.8192493543057676e-06, | |
| "loss": 0.35864074230194093, | |
| "memory(GiB)": 77.28, | |
| "step": 2535, | |
| "token_acc": 0.892925430210325, | |
| "train_speed(iter/s)": 0.014424 | |
| }, | |
| { | |
| "epoch": 0.812767489300428, | |
| "grad_norm": 0.039588078774316006, | |
| "learning_rate": 1.7894958826600884e-06, | |
| "loss": 0.355703067779541, | |
| "memory(GiB)": 77.28, | |
| "step": 2540, | |
| "token_acc": 0.9034001743679163, | |
| "train_speed(iter/s)": 0.014426 | |
| }, | |
| { | |
| "epoch": 0.8143674253029879, | |
| "grad_norm": 0.037317655071007885, | |
| "learning_rate": 1.7599638009344566e-06, | |
| "loss": 0.35617387294769287, | |
| "memory(GiB)": 77.28, | |
| "step": 2545, | |
| "token_acc": 0.8941311852704258, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.8159673613055478, | |
| "grad_norm": 0.03777407929611349, | |
| "learning_rate": 1.730653905438714e-06, | |
| "loss": 0.3580180168151855, | |
| "memory(GiB)": 77.28, | |
| "step": 2550, | |
| "token_acc": 0.8959574468085106, | |
| "train_speed(iter/s)": 0.014428 | |
| }, | |
| { | |
| "epoch": 0.8175672973081076, | |
| "grad_norm": 0.035142023960295414, | |
| "learning_rate": 1.701566986491614e-06, | |
| "loss": 0.34624552726745605, | |
| "memory(GiB)": 77.28, | |
| "step": 2555, | |
| "token_acc": 0.9051190699418714, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.8191672333106675, | |
| "grad_norm": 0.037714565360549845, | |
| "learning_rate": 1.672703828399529e-06, | |
| "loss": 0.35172338485717775, | |
| "memory(GiB)": 77.28, | |
| "step": 2560, | |
| "token_acc": 0.9457239778610962, | |
| "train_speed(iter/s)": 0.014431 | |
| }, | |
| { | |
| "epoch": 0.8207671693132275, | |
| "grad_norm": 0.036887384415936156, | |
| "learning_rate": 1.6440652094352838e-06, | |
| "loss": 0.3510489225387573, | |
| "memory(GiB)": 77.28, | |
| "step": 2565, | |
| "token_acc": 0.8979176452168467, | |
| "train_speed(iter/s)": 0.014432 | |
| }, | |
| { | |
| "epoch": 0.8223671053157874, | |
| "grad_norm": 0.03561026944223861, | |
| "learning_rate": 1.6156519018171856e-06, | |
| "loss": 0.35076611042022704, | |
| "memory(GiB)": 77.28, | |
| "step": 2570, | |
| "token_acc": 0.9080580318126201, | |
| "train_speed(iter/s)": 0.014432 | |
| }, | |
| { | |
| "epoch": 0.8239670413183473, | |
| "grad_norm": 0.03630258451216745, | |
| "learning_rate": 1.587464671688187e-06, | |
| "loss": 0.3570599317550659, | |
| "memory(GiB)": 77.28, | |
| "step": 2575, | |
| "token_acc": 0.9031298682906104, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.8255669773209071, | |
| "grad_norm": 0.038192907527631666, | |
| "learning_rate": 1.5595042790952442e-06, | |
| "loss": 0.3558261632919312, | |
| "memory(GiB)": 77.28, | |
| "step": 2580, | |
| "token_acc": 0.8623452294246177, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.827166913323467, | |
| "grad_norm": 0.036755690198104415, | |
| "learning_rate": 1.5317714779688076e-06, | |
| "loss": 0.3490342140197754, | |
| "memory(GiB)": 77.28, | |
| "step": 2585, | |
| "token_acc": 0.8992491314580298, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.828766849326027, | |
| "grad_norm": 0.03779058071089615, | |
| "learning_rate": 1.5042670161024975e-06, | |
| "loss": 0.3526420831680298, | |
| "memory(GiB)": 77.28, | |
| "step": 2590, | |
| "token_acc": 0.9187872225230103, | |
| "train_speed(iter/s)": 0.014435 | |
| }, | |
| { | |
| "epoch": 0.8303667853285869, | |
| "grad_norm": 0.0378490380899306, | |
| "learning_rate": 1.4769916351329495e-06, | |
| "loss": 0.3495866060256958, | |
| "memory(GiB)": 77.28, | |
| "step": 2595, | |
| "token_acc": 0.9153539571076106, | |
| "train_speed(iter/s)": 0.014437 | |
| }, | |
| { | |
| "epoch": 0.8319667213311468, | |
| "grad_norm": 0.038059208729720205, | |
| "learning_rate": 1.4499460705198e-06, | |
| "loss": 0.3585029602050781, | |
| "memory(GiB)": 77.28, | |
| "step": 2600, | |
| "token_acc": 0.8617424242424242, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.8335666573337066, | |
| "grad_norm": 0.036305573904208764, | |
| "learning_rate": 1.4231310515258745e-06, | |
| "loss": 0.35045819282531737, | |
| "memory(GiB)": 77.28, | |
| "step": 2605, | |
| "token_acc": 0.8978984563883207, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.8351665933362665, | |
| "grad_norm": 0.03724795292187118, | |
| "learning_rate": 1.396547301197504e-06, | |
| "loss": 0.3469654083251953, | |
| "memory(GiB)": 77.28, | |
| "step": 2610, | |
| "token_acc": 0.8848700967906266, | |
| "train_speed(iter/s)": 0.014438 | |
| }, | |
| { | |
| "epoch": 0.8367665293388264, | |
| "grad_norm": 0.03937123467027512, | |
| "learning_rate": 1.3701955363450447e-06, | |
| "loss": 0.3473918676376343, | |
| "memory(GiB)": 77.28, | |
| "step": 2615, | |
| "token_acc": 0.8838246702870443, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.8383664653413864, | |
| "grad_norm": 0.03667494649233471, | |
| "learning_rate": 1.3440764675235384e-06, | |
| "loss": 0.3473004579544067, | |
| "memory(GiB)": 77.28, | |
| "step": 2620, | |
| "token_acc": 0.8983539094650206, | |
| "train_speed(iter/s)": 0.014441 | |
| }, | |
| { | |
| "epoch": 0.8399664013439463, | |
| "grad_norm": 0.03740155571021143, | |
| "learning_rate": 1.3181907990135624e-06, | |
| "loss": 0.3439753532409668, | |
| "memory(GiB)": 77.28, | |
| "step": 2625, | |
| "token_acc": 0.8991910392034848, | |
| "train_speed(iter/s)": 0.014441 | |
| }, | |
| { | |
| "epoch": 0.8415663373465061, | |
| "grad_norm": 0.037121105337531816, | |
| "learning_rate": 1.2925392288022299e-06, | |
| "loss": 0.35173735618591306, | |
| "memory(GiB)": 77.28, | |
| "step": 2630, | |
| "token_acc": 0.9013660104459622, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.843166273349066, | |
| "grad_norm": 0.036589412214925045, | |
| "learning_rate": 1.267122448564374e-06, | |
| "loss": 0.35824949741363527, | |
| "memory(GiB)": 77.28, | |
| "step": 2635, | |
| "token_acc": 0.8826762498678786, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.8447662093516259, | |
| "grad_norm": 0.037390795588795094, | |
| "learning_rate": 1.2419411436439021e-06, | |
| "loss": 0.3420265197753906, | |
| "memory(GiB)": 77.28, | |
| "step": 2640, | |
| "token_acc": 0.8637934539540557, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.8463661453541859, | |
| "grad_norm": 0.0392903978609431, | |
| "learning_rate": 1.2169959930353049e-06, | |
| "loss": 0.35427193641662597, | |
| "memory(GiB)": 77.28, | |
| "step": 2645, | |
| "token_acc": 0.9137991573033708, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.8479660813567458, | |
| "grad_norm": 0.03621632863378309, | |
| "learning_rate": 1.1922876693653584e-06, | |
| "loss": 0.35888056755065917, | |
| "memory(GiB)": 77.28, | |
| "step": 2650, | |
| "token_acc": 0.911003861003861, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.8495660173593056, | |
| "grad_norm": 0.03660745676792027, | |
| "learning_rate": 1.1678168388749788e-06, | |
| "loss": 0.35086932182312014, | |
| "memory(GiB)": 77.28, | |
| "step": 2655, | |
| "token_acc": 0.9206992112555958, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.8511659533618655, | |
| "grad_norm": 0.040156354355006064, | |
| "learning_rate": 1.1435841614012666e-06, | |
| "loss": 0.35667102336883544, | |
| "memory(GiB)": 77.28, | |
| "step": 2660, | |
| "token_acc": 0.8772329246935201, | |
| "train_speed(iter/s)": 0.014445 | |
| }, | |
| { | |
| "epoch": 0.8527658893644254, | |
| "grad_norm": 0.03671656629027542, | |
| "learning_rate": 1.1195902903597023e-06, | |
| "loss": 0.34930713176727296, | |
| "memory(GiB)": 77.28, | |
| "step": 2665, | |
| "token_acc": 0.9153739612188365, | |
| "train_speed(iter/s)": 0.014445 | |
| }, | |
| { | |
| "epoch": 0.8543658253669854, | |
| "grad_norm": 0.0353334980673887, | |
| "learning_rate": 1.0958358727265438e-06, | |
| "loss": 0.3469362497329712, | |
| "memory(GiB)": 77.28, | |
| "step": 2670, | |
| "token_acc": 0.8836606950140298, | |
| "train_speed(iter/s)": 0.014445 | |
| }, | |
| { | |
| "epoch": 0.8559657613695452, | |
| "grad_norm": 0.03791549498121718, | |
| "learning_rate": 1.0723215490213635e-06, | |
| "loss": 0.34251036643981936, | |
| "memory(GiB)": 77.28, | |
| "step": 2675, | |
| "token_acc": 0.8721257625527921, | |
| "train_speed(iter/s)": 0.014444 | |
| }, | |
| { | |
| "epoch": 0.8575656973721051, | |
| "grad_norm": 0.039436468828163096, | |
| "learning_rate": 1.0490479532897946e-06, | |
| "loss": 0.36394264698028567, | |
| "memory(GiB)": 77.28, | |
| "step": 2680, | |
| "token_acc": 0.8936742934051144, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.859165633374665, | |
| "grad_norm": 0.03587054686772771, | |
| "learning_rate": 1.0260157130864178e-06, | |
| "loss": 0.3494544267654419, | |
| "memory(GiB)": 77.28, | |
| "step": 2685, | |
| "token_acc": 0.8780027453671929, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.8607655693772249, | |
| "grad_norm": 0.036927180363296286, | |
| "learning_rate": 1.0032254494578519e-06, | |
| "loss": 0.35199804306030275, | |
| "memory(GiB)": 77.28, | |
| "step": 2690, | |
| "token_acc": 0.8905178979436406, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.8623655053797848, | |
| "grad_norm": 0.03966797036856003, | |
| "learning_rate": 9.806777769260034e-07, | |
| "loss": 0.35879766941070557, | |
| "memory(GiB)": 77.28, | |
| "step": 2695, | |
| "token_acc": 0.9054112554112554, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.8639654413823447, | |
| "grad_norm": 0.03806048478363406, | |
| "learning_rate": 9.583733034714982e-07, | |
| "loss": 0.34694294929504393, | |
| "memory(GiB)": 77.28, | |
| "step": 2700, | |
| "token_acc": 0.9187337129620693, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.8655653773849046, | |
| "grad_norm": 0.03857250568994282, | |
| "learning_rate": 9.363126305172831e-07, | |
| "loss": 0.35350399017333983, | |
| "memory(GiB)": 77.28, | |
| "step": 2705, | |
| "token_acc": 0.9250559284116331, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.8671653133874645, | |
| "grad_norm": 0.037358698407483806, | |
| "learning_rate": 9.144963529124163e-07, | |
| "loss": 0.3406071186065674, | |
| "memory(GiB)": 77.28, | |
| "step": 2710, | |
| "token_acc": 0.8880566801619433, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.8687652493900244, | |
| "grad_norm": 0.03796555457876589, | |
| "learning_rate": 8.929250589160166e-07, | |
| "loss": 0.3480019807815552, | |
| "memory(GiB)": 77.28, | |
| "step": 2715, | |
| "token_acc": 0.8878713878713879, | |
| "train_speed(iter/s)": 0.014444 | |
| }, | |
| { | |
| "epoch": 0.8703651853925843, | |
| "grad_norm": 0.03578087810314897, | |
| "learning_rate": 8.715993301814174e-07, | |
| "loss": 0.34974730014801025, | |
| "memory(GiB)": 77.28, | |
| "step": 2720, | |
| "token_acc": 0.893631910426872, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.8719651213951441, | |
| "grad_norm": 0.03683673172866316, | |
| "learning_rate": 8.505197417404687e-07, | |
| "loss": 0.34303812980651854, | |
| "memory(GiB)": 77.28, | |
| "step": 2725, | |
| "token_acc": 0.9124767225325885, | |
| "train_speed(iter/s)": 0.014444 | |
| }, | |
| { | |
| "epoch": 0.8735650573977041, | |
| "grad_norm": 0.0365725452957113, | |
| "learning_rate": 8.296868619880372e-07, | |
| "loss": 0.3499909400939941, | |
| "memory(GiB)": 77.28, | |
| "step": 2730, | |
| "token_acc": 0.8861124459394522, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.875164993400264, | |
| "grad_norm": 0.03572406694103383, | |
| "learning_rate": 8.091012526666797e-07, | |
| "loss": 0.3504805564880371, | |
| "memory(GiB)": 77.28, | |
| "step": 2735, | |
| "token_acc": 0.8892282630828752, | |
| "train_speed(iter/s)": 0.014444 | |
| }, | |
| { | |
| "epoch": 0.8767649294028239, | |
| "grad_norm": 0.03779741947722869, | |
| "learning_rate": 7.887634688515e-07, | |
| "loss": 0.3552916765213013, | |
| "memory(GiB)": 77.28, | |
| "step": 2740, | |
| "token_acc": 0.9217644084934277, | |
| "train_speed(iter/s)": 0.014444 | |
| }, | |
| { | |
| "epoch": 0.8783648654053838, | |
| "grad_norm": 0.03734376079780654, | |
| "learning_rate": 7.686740589351704e-07, | |
| "loss": 0.3564465522766113, | |
| "memory(GiB)": 77.28, | |
| "step": 2745, | |
| "token_acc": 0.8365307753796962, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.8799648014079436, | |
| "grad_norm": 0.03886072012349239, | |
| "learning_rate": 7.488335646131628e-07, | |
| "loss": 0.35783588886260986, | |
| "memory(GiB)": 77.28, | |
| "step": 2750, | |
| "token_acc": 0.8932851985559567, | |
| "train_speed(iter/s)": 0.014444 | |
| }, | |
| { | |
| "epoch": 0.8799648014079436, | |
| "eval_loss": 0.5971372127532959, | |
| "eval_runtime": 171.8021, | |
| "eval_samples_per_second": 116.925, | |
| "eval_steps_per_second": 0.588, | |
| "eval_token_acc": 0.8960392306274841, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.8815647374105036, | |
| "grad_norm": 0.03809267294716575, | |
| "learning_rate": 7.292425208691212e-07, | |
| "loss": 0.34661192893981935, | |
| "memory(GiB)": 77.28, | |
| "step": 2755, | |
| "token_acc": 0.9020258590887091, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.8831646734130635, | |
| "grad_norm": 0.03923242547695106, | |
| "learning_rate": 7.099014559604556e-07, | |
| "loss": 0.3626936674118042, | |
| "memory(GiB)": 77.28, | |
| "step": 2760, | |
| "token_acc": 0.9132881442639724, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.8847646094156234, | |
| "grad_norm": 0.038038269263299306, | |
| "learning_rate": 6.908108914040823e-07, | |
| "loss": 0.3482142210006714, | |
| "memory(GiB)": 77.28, | |
| "step": 2765, | |
| "token_acc": 0.926984508226252, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.8863645454181833, | |
| "grad_norm": 0.03824935772013396, | |
| "learning_rate": 6.71971341962373e-07, | |
| "loss": 0.35893754959106444, | |
| "memory(GiB)": 77.28, | |
| "step": 2770, | |
| "token_acc": 0.8936886395511922, | |
| "train_speed(iter/s)": 0.014431 | |
| }, | |
| { | |
| "epoch": 0.8879644814207431, | |
| "grad_norm": 0.04010489518356249, | |
| "learning_rate": 6.53383315629268e-07, | |
| "loss": 0.34843852519989016, | |
| "memory(GiB)": 77.28, | |
| "step": 2775, | |
| "token_acc": 0.8804709495776811, | |
| "train_speed(iter/s)": 0.01443 | |
| }, | |
| { | |
| "epoch": 0.889564417423303, | |
| "grad_norm": 0.038785315140372825, | |
| "learning_rate": 6.350473136165836e-07, | |
| "loss": 0.34716622829437255, | |
| "memory(GiB)": 77.28, | |
| "step": 2780, | |
| "token_acc": 0.9097255275265747, | |
| "train_speed(iter/s)": 0.014432 | |
| }, | |
| { | |
| "epoch": 0.891164353425863, | |
| "grad_norm": 0.03648869486252188, | |
| "learning_rate": 6.169638303404912e-07, | |
| "loss": 0.34730355739593505, | |
| "memory(GiB)": 77.28, | |
| "step": 2785, | |
| "token_acc": 0.9088560885608856, | |
| "train_speed(iter/s)": 0.014433 | |
| }, | |
| { | |
| "epoch": 0.8927642894284229, | |
| "grad_norm": 0.037303942869965495, | |
| "learning_rate": 5.991333534081878e-07, | |
| "loss": 0.35375151634216306, | |
| "memory(GiB)": 77.28, | |
| "step": 2790, | |
| "token_acc": 0.9058347775852109, | |
| "train_speed(iter/s)": 0.014434 | |
| }, | |
| { | |
| "epoch": 0.8943642254309827, | |
| "grad_norm": 0.03697384190504123, | |
| "learning_rate": 5.815563636047539e-07, | |
| "loss": 0.347182297706604, | |
| "memory(GiB)": 77.28, | |
| "step": 2795, | |
| "token_acc": 0.8924109931292942, | |
| "train_speed(iter/s)": 0.014436 | |
| }, | |
| { | |
| "epoch": 0.8959641614335426, | |
| "grad_norm": 0.03652945378250148, | |
| "learning_rate": 5.64233334880181e-07, | |
| "loss": 0.34785597324371337, | |
| "memory(GiB)": 77.28, | |
| "step": 2800, | |
| "token_acc": 0.9158926728586171, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.8975640974361025, | |
| "grad_norm": 0.03760402764710459, | |
| "learning_rate": 5.471647343365982e-07, | |
| "loss": 0.3536502838134766, | |
| "memory(GiB)": 77.28, | |
| "step": 2805, | |
| "token_acc": 0.9084852734922861, | |
| "train_speed(iter/s)": 0.014439 | |
| }, | |
| { | |
| "epoch": 0.8991640334386625, | |
| "grad_norm": 0.03705771284444855, | |
| "learning_rate": 5.303510222156716e-07, | |
| "loss": 0.3537883758544922, | |
| "memory(GiB)": 77.28, | |
| "step": 2810, | |
| "token_acc": 0.8768209478148626, | |
| "train_speed(iter/s)": 0.01444 | |
| }, | |
| { | |
| "epoch": 0.9007639694412224, | |
| "grad_norm": 0.03923039459407896, | |
| "learning_rate": 5.137926518862013e-07, | |
| "loss": 0.3503025770187378, | |
| "memory(GiB)": 77.28, | |
| "step": 2815, | |
| "token_acc": 0.8973375931842386, | |
| "train_speed(iter/s)": 0.014441 | |
| }, | |
| { | |
| "epoch": 0.9023639054437822, | |
| "grad_norm": 0.03440569943973169, | |
| "learning_rate": 4.974900698318885e-07, | |
| "loss": 0.3502909421920776, | |
| "memory(GiB)": 77.28, | |
| "step": 2820, | |
| "token_acc": 0.8903985507246377, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.9039638414463421, | |
| "grad_norm": 0.037440830013703, | |
| "learning_rate": 4.814437156393048e-07, | |
| "loss": 0.359883975982666, | |
| "memory(GiB)": 77.28, | |
| "step": 2825, | |
| "token_acc": 0.8621068032187271, | |
| "train_speed(iter/s)": 0.014442 | |
| }, | |
| { | |
| "epoch": 0.905563777448902, | |
| "grad_norm": 0.03604417130894721, | |
| "learning_rate": 4.656540219860317e-07, | |
| "loss": 0.3613792657852173, | |
| "memory(GiB)": 77.28, | |
| "step": 2830, | |
| "token_acc": 0.896741523557904, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.907163713451462, | |
| "grad_norm": 0.03851080526779007, | |
| "learning_rate": 4.501214146289956e-07, | |
| "loss": 0.3496058464050293, | |
| "memory(GiB)": 77.28, | |
| "step": 2835, | |
| "token_acc": 0.9011064062286573, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.9087636494540219, | |
| "grad_norm": 0.03746777254251882, | |
| "learning_rate": 4.3484631239299356e-07, | |
| "loss": 0.3529067516326904, | |
| "memory(GiB)": 77.28, | |
| "step": 2840, | |
| "token_acc": 0.8689181453921008, | |
| "train_speed(iter/s)": 0.014443 | |
| }, | |
| { | |
| "epoch": 0.9103635854565817, | |
| "grad_norm": 0.03726783035013483, | |
| "learning_rate": 4.198291271593924e-07, | |
| "loss": 0.3502077579498291, | |
| "memory(GiB)": 77.28, | |
| "step": 2845, | |
| "token_acc": 0.8986060161408658, | |
| "train_speed(iter/s)": 0.014444 | |
| }, | |
| { | |
| "epoch": 0.9119635214591416, | |
| "grad_norm": 0.035823705524663504, | |
| "learning_rate": 4.0507026385502747e-07, | |
| "loss": 0.3497209310531616, | |
| "memory(GiB)": 77.28, | |
| "step": 2850, | |
| "token_acc": 0.9251456745853878, | |
| "train_speed(iter/s)": 0.014445 | |
| }, | |
| { | |
| "epoch": 0.9135634574617015, | |
| "grad_norm": 0.038081501743851526, | |
| "learning_rate": 3.9057012044127817e-07, | |
| "loss": 0.352987265586853, | |
| "memory(GiB)": 77.28, | |
| "step": 2855, | |
| "token_acc": 0.8892445582586428, | |
| "train_speed(iter/s)": 0.014446 | |
| }, | |
| { | |
| "epoch": 0.9151633934642615, | |
| "grad_norm": 0.0385949290213603, | |
| "learning_rate": 3.7632908790334656e-07, | |
| "loss": 0.3471065044403076, | |
| "memory(GiB)": 77.28, | |
| "step": 2860, | |
| "token_acc": 0.9146107456140351, | |
| "train_speed(iter/s)": 0.014446 | |
| }, | |
| { | |
| "epoch": 0.9167633294668214, | |
| "grad_norm": 0.03861723600804993, | |
| "learning_rate": 3.6234755023970447e-07, | |
| "loss": 0.3470769882202148, | |
| "memory(GiB)": 77.28, | |
| "step": 2865, | |
| "token_acc": 0.8663258983890955, | |
| "train_speed(iter/s)": 0.014448 | |
| }, | |
| { | |
| "epoch": 0.9183632654693812, | |
| "grad_norm": 0.037810929727173835, | |
| "learning_rate": 3.4862588445174985e-07, | |
| "loss": 0.3519733190536499, | |
| "memory(GiB)": 77.28, | |
| "step": 2870, | |
| "token_acc": 0.9010814249363868, | |
| "train_speed(iter/s)": 0.014449 | |
| }, | |
| { | |
| "epoch": 0.9199632014719411, | |
| "grad_norm": 0.0379260232969743, | |
| "learning_rate": 3.3516446053363015e-07, | |
| "loss": 0.34721758365631106, | |
| "memory(GiB)": 77.28, | |
| "step": 2875, | |
| "token_acc": 0.9072595971113645, | |
| "train_speed(iter/s)": 0.014449 | |
| }, | |
| { | |
| "epoch": 0.921563137474501, | |
| "grad_norm": 0.036881383803487856, | |
| "learning_rate": 3.219636414622751e-07, | |
| "loss": 0.35213327407836914, | |
| "memory(GiB)": 77.28, | |
| "step": 2880, | |
| "token_acc": 0.9062799288548365, | |
| "train_speed(iter/s)": 0.01445 | |
| }, | |
| { | |
| "epoch": 0.923163073477061, | |
| "grad_norm": 0.03626677080161208, | |
| "learning_rate": 3.090237831876053e-07, | |
| "loss": 0.3516512393951416, | |
| "memory(GiB)": 77.28, | |
| "step": 2885, | |
| "token_acc": 0.8761041902604757, | |
| "train_speed(iter/s)": 0.014451 | |
| }, | |
| { | |
| "epoch": 0.9247630094796209, | |
| "grad_norm": 0.03714975307806561, | |
| "learning_rate": 2.9634523462293005e-07, | |
| "loss": 0.3485568046569824, | |
| "memory(GiB)": 77.28, | |
| "step": 2890, | |
| "token_acc": 0.9238785106112594, | |
| "train_speed(iter/s)": 0.014451 | |
| }, | |
| { | |
| "epoch": 0.9263629454821807, | |
| "grad_norm": 0.036754057783206624, | |
| "learning_rate": 2.839283376355506e-07, | |
| "loss": 0.3485892295837402, | |
| "memory(GiB)": 77.28, | |
| "step": 2895, | |
| "token_acc": 0.9183364839319471, | |
| "train_speed(iter/s)": 0.01445 | |
| }, | |
| { | |
| "epoch": 0.9279628814847406, | |
| "grad_norm": 0.03647869908710096, | |
| "learning_rate": 2.717734270375272e-07, | |
| "loss": 0.3410207748413086, | |
| "memory(GiB)": 77.28, | |
| "step": 2900, | |
| "token_acc": 0.9108079748163693, | |
| "train_speed(iter/s)": 0.014451 | |
| }, | |
| { | |
| "epoch": 0.9295628174873005, | |
| "grad_norm": 0.03711266544187936, | |
| "learning_rate": 2.5988083057666534e-07, | |
| "loss": 0.35901172161102296, | |
| "memory(GiB)": 77.28, | |
| "step": 2905, | |
| "token_acc": 0.9014373716632443, | |
| "train_speed(iter/s)": 0.014451 | |
| }, | |
| { | |
| "epoch": 0.9311627534898604, | |
| "grad_norm": 0.0391959243873001, | |
| "learning_rate": 2.4825086892766745e-07, | |
| "loss": 0.3521601438522339, | |
| "memory(GiB)": 77.28, | |
| "step": 2910, | |
| "token_acc": 0.9066280456636565, | |
| "train_speed(iter/s)": 0.014452 | |
| }, | |
| { | |
| "epoch": 0.9327626894924202, | |
| "grad_norm": 0.03754600878736611, | |
| "learning_rate": 2.3688385568349515e-07, | |
| "loss": 0.34390983581542967, | |
| "memory(GiB)": 77.28, | |
| "step": 2915, | |
| "token_acc": 0.8572481572481573, | |
| "train_speed(iter/s)": 0.014453 | |
| }, | |
| { | |
| "epoch": 0.9343626254949802, | |
| "grad_norm": 0.040067928972265965, | |
| "learning_rate": 2.2578009734690264e-07, | |
| "loss": 0.3604452133178711, | |
| "memory(GiB)": 77.28, | |
| "step": 2920, | |
| "token_acc": 0.9112820512820513, | |
| "train_speed(iter/s)": 0.014453 | |
| }, | |
| { | |
| "epoch": 0.9359625614975401, | |
| "grad_norm": 0.03683689442632747, | |
| "learning_rate": 2.1493989332218468e-07, | |
| "loss": 0.34636476039886477, | |
| "memory(GiB)": 77.28, | |
| "step": 2925, | |
| "token_acc": 0.8987912682662818, | |
| "train_speed(iter/s)": 0.014453 | |
| }, | |
| { | |
| "epoch": 0.9375624975001, | |
| "grad_norm": 0.03737336362440631, | |
| "learning_rate": 2.043635359070928e-07, | |
| "loss": 0.35263738632202146, | |
| "memory(GiB)": 77.28, | |
| "step": 2930, | |
| "token_acc": 0.9111613632692618, | |
| "train_speed(iter/s)": 0.014456 | |
| }, | |
| { | |
| "epoch": 0.9391624335026599, | |
| "grad_norm": 0.037836926968173146, | |
| "learning_rate": 1.9405131028495838e-07, | |
| "loss": 0.35706591606140137, | |
| "memory(GiB)": 77.28, | |
| "step": 2935, | |
| "token_acc": 0.8956814357823892, | |
| "train_speed(iter/s)": 0.014455 | |
| }, | |
| { | |
| "epoch": 0.9407623695052197, | |
| "grad_norm": 0.03836305322378439, | |
| "learning_rate": 1.8400349451700438e-07, | |
| "loss": 0.3512787103652954, | |
| "memory(GiB)": 77.28, | |
| "step": 2940, | |
| "token_acc": 0.9075797047512716, | |
| "train_speed(iter/s)": 0.014457 | |
| }, | |
| { | |
| "epoch": 0.9423623055077797, | |
| "grad_norm": 0.0366255147217552, | |
| "learning_rate": 1.742203595348435e-07, | |
| "loss": 0.34981393814086914, | |
| "memory(GiB)": 77.28, | |
| "step": 2945, | |
| "token_acc": 0.8997175141242938, | |
| "train_speed(iter/s)": 0.014458 | |
| }, | |
| { | |
| "epoch": 0.9439622415103396, | |
| "grad_norm": 0.039903409914483774, | |
| "learning_rate": 1.6470216913317628e-07, | |
| "loss": 0.3578468322753906, | |
| "memory(GiB)": 77.28, | |
| "step": 2950, | |
| "token_acc": 0.8852280955829109, | |
| "train_speed(iter/s)": 0.014458 | |
| }, | |
| { | |
| "epoch": 0.9455621775128995, | |
| "grad_norm": 0.03632939603743224, | |
| "learning_rate": 1.5544917996267562e-07, | |
| "loss": 0.34919579029083253, | |
| "memory(GiB)": 77.28, | |
| "step": 2955, | |
| "token_acc": 0.8785700775487044, | |
| "train_speed(iter/s)": 0.014459 | |
| }, | |
| { | |
| "epoch": 0.9471621135154594, | |
| "grad_norm": 0.03871438310718043, | |
| "learning_rate": 1.464616415230702e-07, | |
| "loss": 0.35771970748901366, | |
| "memory(GiB)": 77.28, | |
| "step": 2960, | |
| "token_acc": 0.893168029543656, | |
| "train_speed(iter/s)": 0.014458 | |
| }, | |
| { | |
| "epoch": 0.9487620495180192, | |
| "grad_norm": 0.036901244083775424, | |
| "learning_rate": 1.3773979615640976e-07, | |
| "loss": 0.350262188911438, | |
| "memory(GiB)": 77.28, | |
| "step": 2965, | |
| "token_acc": 0.9129044634863793, | |
| "train_speed(iter/s)": 0.014459 | |
| }, | |
| { | |
| "epoch": 0.9503619855205792, | |
| "grad_norm": 0.03732230567834177, | |
| "learning_rate": 1.292838790405393e-07, | |
| "loss": 0.3521857500076294, | |
| "memory(GiB)": 77.28, | |
| "step": 2970, | |
| "token_acc": 0.9018378063010501, | |
| "train_speed(iter/s)": 0.014459 | |
| }, | |
| { | |
| "epoch": 0.9519619215231391, | |
| "grad_norm": 0.038418652841169985, | |
| "learning_rate": 1.2109411818274851e-07, | |
| "loss": 0.3512159585952759, | |
| "memory(GiB)": 77.28, | |
| "step": 2975, | |
| "token_acc": 0.9232655416125776, | |
| "train_speed(iter/s)": 0.01446 | |
| }, | |
| { | |
| "epoch": 0.953561857525699, | |
| "grad_norm": 0.03784470443540757, | |
| "learning_rate": 1.1317073441363458e-07, | |
| "loss": 0.35275132656097413, | |
| "memory(GiB)": 77.28, | |
| "step": 2980, | |
| "token_acc": 0.9260171180677688, | |
| "train_speed(iter/s)": 0.01446 | |
| }, | |
| { | |
| "epoch": 0.9551617935282589, | |
| "grad_norm": 0.037282968935844873, | |
| "learning_rate": 1.055139413811379e-07, | |
| "loss": 0.3569183826446533, | |
| "memory(GiB)": 77.28, | |
| "step": 2985, | |
| "token_acc": 0.885663082437276, | |
| "train_speed(iter/s)": 0.014461 | |
| }, | |
| { | |
| "epoch": 0.9567617295308187, | |
| "grad_norm": 0.03683921378138757, | |
| "learning_rate": 9.812394554478355e-08, | |
| "loss": 0.34755406379699705, | |
| "memory(GiB)": 77.28, | |
| "step": 2990, | |
| "token_acc": 0.8813957127210139, | |
| "train_speed(iter/s)": 0.014461 | |
| }, | |
| { | |
| "epoch": 0.9583616655333786, | |
| "grad_norm": 0.03816641432653712, | |
| "learning_rate": 9.10009461701189e-08, | |
| "loss": 0.35767698287963867, | |
| "memory(GiB)": 77.28, | |
| "step": 2995, | |
| "token_acc": 0.8030809205642168, | |
| "train_speed(iter/s)": 0.014462 | |
| }, | |
| { | |
| "epoch": 0.9599616015359386, | |
| "grad_norm": 0.03992625623958567, | |
| "learning_rate": 8.41451353233369e-08, | |
| "loss": 0.3515816926956177, | |
| "memory(GiB)": 77.28, | |
| "step": 3000, | |
| "token_acc": 0.8982125124131083, | |
| "train_speed(iter/s)": 0.014461 | |
| }, | |
| { | |
| "epoch": 0.9599616015359386, | |
| "eval_loss": 0.5968807339668274, | |
| "eval_runtime": 161.8894, | |
| "eval_samples_per_second": 124.085, | |
| "eval_steps_per_second": 0.624, | |
| "eval_token_acc": 0.8961120208061873, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.9615615375384985, | |
| "grad_norm": 0.03506254411144567, | |
| "learning_rate": 7.755669786609688e-08, | |
| "loss": 0.3550234317779541, | |
| "memory(GiB)": 77.28, | |
| "step": 3005, | |
| "token_acc": 0.9054439315775183, | |
| "train_speed(iter/s)": 0.014448 | |
| }, | |
| { | |
| "epoch": 0.9631614735410584, | |
| "grad_norm": 0.037502896081413176, | |
| "learning_rate": 7.123581145053849e-08, | |
| "loss": 0.35604000091552734, | |
| "memory(GiB)": 77.28, | |
| "step": 3010, | |
| "token_acc": 0.9059127526979784, | |
| "train_speed(iter/s)": 0.014448 | |
| }, | |
| { | |
| "epoch": 0.9647614095436182, | |
| "grad_norm": 0.0382845236708893, | |
| "learning_rate": 6.51826465144978e-08, | |
| "loss": 0.35213139057159426, | |
| "memory(GiB)": 77.28, | |
| "step": 3015, | |
| "token_acc": 0.8929005381010241, | |
| "train_speed(iter/s)": 0.014448 | |
| }, | |
| { | |
| "epoch": 0.9663613455461781, | |
| "grad_norm": 0.03601878704018656, | |
| "learning_rate": 5.93973662769054e-08, | |
| "loss": 0.3391100883483887, | |
| "memory(GiB)": 77.28, | |
| "step": 3020, | |
| "token_acc": 0.9075471698113208, | |
| "train_speed(iter/s)": 0.014448 | |
| }, | |
| { | |
| "epoch": 0.9679612815487381, | |
| "grad_norm": 0.03691591762096, | |
| "learning_rate": 5.388012673338661e-08, | |
| "loss": 0.3560220956802368, | |
| "memory(GiB)": 77.28, | |
| "step": 3025, | |
| "token_acc": 0.8877074270984372, | |
| "train_speed(iter/s)": 0.014448 | |
| }, | |
| { | |
| "epoch": 0.969561217551298, | |
| "grad_norm": 0.038006836164876816, | |
| "learning_rate": 4.863107665205702e-08, | |
| "loss": 0.34921257495880126, | |
| "memory(GiB)": 77.28, | |
| "step": 3030, | |
| "token_acc": 0.8738569123184508, | |
| "train_speed(iter/s)": 0.014449 | |
| }, | |
| { | |
| "epoch": 0.9711611535538578, | |
| "grad_norm": 0.03500666951506718, | |
| "learning_rate": 4.365035756950797e-08, | |
| "loss": 0.34278459548950196, | |
| "memory(GiB)": 77.28, | |
| "step": 3035, | |
| "token_acc": 0.8969732246798603, | |
| "train_speed(iter/s)": 0.014449 | |
| }, | |
| { | |
| "epoch": 0.9727610895564177, | |
| "grad_norm": 0.03689296268268185, | |
| "learning_rate": 3.8938103786995144e-08, | |
| "loss": 0.3485910177230835, | |
| "memory(GiB)": 77.28, | |
| "step": 3040, | |
| "token_acc": 0.9163443924282516, | |
| "train_speed(iter/s)": 0.01445 | |
| }, | |
| { | |
| "epoch": 0.9743610255589776, | |
| "grad_norm": 0.03704895203134622, | |
| "learning_rate": 3.449444236681254e-08, | |
| "loss": 0.3477888822555542, | |
| "memory(GiB)": 77.28, | |
| "step": 3045, | |
| "token_acc": 0.9033083219645294, | |
| "train_speed(iter/s)": 0.014451 | |
| }, | |
| { | |
| "epoch": 0.9759609615615376, | |
| "grad_norm": 0.038564010535460366, | |
| "learning_rate": 3.03194931288664e-08, | |
| "loss": 0.36015493869781495, | |
| "memory(GiB)": 77.28, | |
| "step": 3050, | |
| "token_acc": 0.9197261244245072, | |
| "train_speed(iter/s)": 0.014452 | |
| }, | |
| { | |
| "epoch": 0.9775608975640975, | |
| "grad_norm": 0.03839178767845547, | |
| "learning_rate": 2.641336864744992e-08, | |
| "loss": 0.3448947429656982, | |
| "memory(GiB)": 77.28, | |
| "step": 3055, | |
| "token_acc": 0.9067073170731708, | |
| "train_speed(iter/s)": 0.014453 | |
| }, | |
| { | |
| "epoch": 0.9791608335666573, | |
| "grad_norm": 0.037786530189202895, | |
| "learning_rate": 2.2776174248199114e-08, | |
| "loss": 0.3379628896713257, | |
| "memory(GiB)": 77.28, | |
| "step": 3060, | |
| "token_acc": 0.9009945079412202, | |
| "train_speed(iter/s)": 0.014455 | |
| }, | |
| { | |
| "epoch": 0.9807607695692172, | |
| "grad_norm": 0.035912429119548846, | |
| "learning_rate": 1.9408008005260548e-08, | |
| "loss": 0.3500987529754639, | |
| "memory(GiB)": 77.28, | |
| "step": 3065, | |
| "token_acc": 0.8876028806584362, | |
| "train_speed(iter/s)": 0.014456 | |
| }, | |
| { | |
| "epoch": 0.9823607055717771, | |
| "grad_norm": 0.03444074710514445, | |
| "learning_rate": 1.630896073864352e-08, | |
| "loss": 0.3504997730255127, | |
| "memory(GiB)": 77.28, | |
| "step": 3070, | |
| "token_acc": 0.8979777737292768, | |
| "train_speed(iter/s)": 0.014456 | |
| }, | |
| { | |
| "epoch": 0.983960641574337, | |
| "grad_norm": 0.03756464819153609, | |
| "learning_rate": 1.3479116011769766e-08, | |
| "loss": 0.34742605686187744, | |
| "memory(GiB)": 77.28, | |
| "step": 3075, | |
| "token_acc": 0.9106449106449106, | |
| "train_speed(iter/s)": 0.014457 | |
| }, | |
| { | |
| "epoch": 0.985560577576897, | |
| "grad_norm": 0.03754891232855657, | |
| "learning_rate": 1.0918550129223049e-08, | |
| "loss": 0.3474902868270874, | |
| "memory(GiB)": 77.28, | |
| "step": 3080, | |
| "token_acc": 0.9118387909319899, | |
| "train_speed(iter/s)": 0.014457 | |
| }, | |
| { | |
| "epoch": 0.9871605135794568, | |
| "grad_norm": 0.03682524226116992, | |
| "learning_rate": 8.627332134690802e-09, | |
| "loss": 0.353102445602417, | |
| "memory(GiB)": 77.28, | |
| "step": 3085, | |
| "token_acc": 0.8938781202063868, | |
| "train_speed(iter/s)": 0.014457 | |
| }, | |
| { | |
| "epoch": 0.9887604495820167, | |
| "grad_norm": 0.0349572055380618, | |
| "learning_rate": 6.605523809102288e-09, | |
| "loss": 0.35455539226531985, | |
| "memory(GiB)": 77.28, | |
| "step": 3090, | |
| "token_acc": 0.9251228678808904, | |
| "train_speed(iter/s)": 0.014457 | |
| }, | |
| { | |
| "epoch": 0.9903603855845766, | |
| "grad_norm": 0.0367341369681787, | |
| "learning_rate": 4.853179668959928e-09, | |
| "loss": 0.3528116464614868, | |
| "memory(GiB)": 77.28, | |
| "step": 3095, | |
| "token_acc": 0.8497830802603037, | |
| "train_speed(iter/s)": 0.014458 | |
| }, | |
| { | |
| "epoch": 0.9919603215871365, | |
| "grad_norm": 0.03543382063951275, | |
| "learning_rate": 3.3703469648760367e-09, | |
| "loss": 0.34554617404937743, | |
| "memory(GiB)": 77.28, | |
| "step": 3100, | |
| "token_acc": 0.8760165975103734, | |
| "train_speed(iter/s)": 0.014458 | |
| }, | |
| { | |
| "epoch": 0.9935602575896965, | |
| "grad_norm": 0.03672488758432725, | |
| "learning_rate": 2.1570656802905042e-09, | |
| "loss": 0.35210456848144533, | |
| "memory(GiB)": 77.28, | |
| "step": 3105, | |
| "token_acc": 0.875547098001903, | |
| "train_speed(iter/s)": 0.014459 | |
| }, | |
| { | |
| "epoch": 0.9951601935922563, | |
| "grad_norm": 0.03667904917275392, | |
| "learning_rate": 1.213368530399439e-09, | |
| "loss": 0.36057708263397215, | |
| "memory(GiB)": 77.28, | |
| "step": 3110, | |
| "token_acc": 0.8785273780601757, | |
| "train_speed(iter/s)": 0.014459 | |
| }, | |
| { | |
| "epoch": 0.9967601295948162, | |
| "grad_norm": 0.037172261753358984, | |
| "learning_rate": 5.392809612703165e-10, | |
| "loss": 0.347002911567688, | |
| "memory(GiB)": 77.28, | |
| "step": 3115, | |
| "token_acc": 0.8876961189099918, | |
| "train_speed(iter/s)": 0.01446 | |
| }, | |
| { | |
| "epoch": 0.9983600655973761, | |
| "grad_norm": 0.03623294899802742, | |
| "learning_rate": 1.3482114915475132e-10, | |
| "loss": 0.34892323017120364, | |
| "memory(GiB)": 77.28, | |
| "step": 3120, | |
| "token_acc": 0.9150393970537856, | |
| "train_speed(iter/s)": 0.014459 | |
| }, | |
| { | |
| "epoch": 0.999960001599936, | |
| "grad_norm": 0.03979082426503465, | |
| "learning_rate": 0.0, | |
| "loss": 0.3523369073867798, | |
| "memory(GiB)": 77.28, | |
| "step": 3125, | |
| "token_acc": 0.874745605920444, | |
| "train_speed(iter/s)": 0.014459 | |
| }, | |
| { | |
| "epoch": 0.999960001599936, | |
| "eval_loss": 0.5968554615974426, | |
| "eval_runtime": 146.0358, | |
| "eval_samples_per_second": 137.555, | |
| "eval_steps_per_second": 0.692, | |
| "eval_token_acc": 0.8961375957338398, | |
| "step": 3125 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 3125, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 1000, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.4706850358900346e+20, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |