Safetensors
GGUF
English
gemma3_text
base
sml
void
pretrained-from-scratch
void.0 / trainer_state.json
appvoid's picture
Continued pretraining: FineWeb-Edu + rewrite6 byte hybrid + no-prompt-15k
d1dd948 verified
Raw
History Blame Contribute Delete
165 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 5542,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00036088054853843375,
"grad_norm": 3584.0,
"learning_rate": 0.0,
"loss": 20.713645935058594,
"num_input_tokens_seen": 131072,
"step": 1,
"train_runtime": 53.7767,
"train_tokens_per_second": 2437.338
},
{
"epoch": 0.003608805485384338,
"grad_norm": 2040.0,
"learning_rate": 4.0540540540540545e-06,
"loss": 16.10942925347222,
"num_input_tokens_seen": 1310720,
"step": 10,
"train_runtime": 70.8433,
"train_tokens_per_second": 18501.673
},
{
"epoch": 0.007217610970768676,
"grad_norm": 220.0,
"learning_rate": 8.558558558558558e-06,
"loss": 9.052794647216796,
"num_input_tokens_seen": 2621440,
"step": 20,
"train_runtime": 89.7838,
"train_tokens_per_second": 29197.249
},
{
"epoch": 0.010826416456153013,
"grad_norm": 20.75,
"learning_rate": 1.3063063063063064e-05,
"loss": 5.4977569580078125,
"num_input_tokens_seen": 3932160,
"step": 30,
"train_runtime": 108.725,
"train_tokens_per_second": 36166.091
},
{
"epoch": 0.014435221941537351,
"grad_norm": 13.375,
"learning_rate": 1.756756756756757e-05,
"loss": 4.952135848999023,
"num_input_tokens_seen": 5242880,
"step": 40,
"train_runtime": 127.6323,
"train_tokens_per_second": 41078.011
},
{
"epoch": 0.01804402742692169,
"grad_norm": 19.0,
"learning_rate": 2.2072072072072073e-05,
"loss": 4.788348388671875,
"num_input_tokens_seen": 6553600,
"step": 50,
"train_runtime": 146.5809,
"train_tokens_per_second": 44709.796
},
{
"epoch": 0.021652832912306026,
"grad_norm": 16.125,
"learning_rate": 2.6576576576576577e-05,
"loss": 4.393115997314453,
"num_input_tokens_seen": 7864320,
"step": 60,
"train_runtime": 165.505,
"train_tokens_per_second": 47517.102
},
{
"epoch": 0.025261638397690366,
"grad_norm": 22.875,
"learning_rate": 3.108108108108108e-05,
"loss": 3.7790504455566407,
"num_input_tokens_seen": 9175040,
"step": 70,
"train_runtime": 184.4419,
"train_tokens_per_second": 49744.868
},
{
"epoch": 0.028870443883074703,
"grad_norm": 9.3125,
"learning_rate": 3.558558558558558e-05,
"loss": 3.2834922790527346,
"num_input_tokens_seen": 10485760,
"step": 80,
"train_runtime": 203.3708,
"train_tokens_per_second": 51559.816
},
{
"epoch": 0.03247924936845904,
"grad_norm": 4.5,
"learning_rate": 4.0090090090090096e-05,
"loss": 3.2390235900878905,
"num_input_tokens_seen": 11796480,
"step": 90,
"train_runtime": 222.3126,
"train_tokens_per_second": 53062.568
},
{
"epoch": 0.03608805485384338,
"grad_norm": 3.515625,
"learning_rate": 4.4594594594594596e-05,
"loss": 3.119455337524414,
"num_input_tokens_seen": 13107200,
"step": 100,
"train_runtime": 241.2122,
"train_tokens_per_second": 54338.874
},
{
"epoch": 0.039696860339227716,
"grad_norm": 17.375,
"learning_rate": 4.90990990990991e-05,
"loss": 3.0860061645507812,
"num_input_tokens_seen": 14417920,
"step": 110,
"train_runtime": 262.9315,
"train_tokens_per_second": 54835.264
},
{
"epoch": 0.04330566582461205,
"grad_norm": 123.0,
"learning_rate": 4.999973231172336e-05,
"loss": 3.074770927429199,
"num_input_tokens_seen": 15728640,
"step": 120,
"train_runtime": 281.8581,
"train_tokens_per_second": 55803.404
},
{
"epoch": 0.04691447130999639,
"grad_norm": 9.4375,
"learning_rate": 4.999864483792435e-05,
"loss": 3.045380401611328,
"num_input_tokens_seen": 17039360,
"step": 130,
"train_runtime": 300.7857,
"train_tokens_per_second": 56649.496
},
{
"epoch": 0.05052327679538073,
"grad_norm": 5.46875,
"learning_rate": 4.9996720884445644e-05,
"loss": 3.0239139556884767,
"num_input_tokens_seen": 18350080,
"step": 140,
"train_runtime": 319.7041,
"train_tokens_per_second": 57397.078
},
{
"epoch": 0.05413208228076507,
"grad_norm": 2.34375,
"learning_rate": 4.999396051566465e-05,
"loss": 3.0160009384155275,
"num_input_tokens_seen": 19660800,
"step": 150,
"train_runtime": 338.6262,
"train_tokens_per_second": 58060.485
},
{
"epoch": 0.057740887766149405,
"grad_norm": 7.71875,
"learning_rate": 4.999036382394608e-05,
"loss": 2.998691368103027,
"num_input_tokens_seen": 20971520,
"step": 160,
"train_runtime": 357.5421,
"train_tokens_per_second": 58654.682
},
{
"epoch": 0.06134969325153374,
"grad_norm": 6.6875,
"learning_rate": 4.998593092963883e-05,
"loss": 2.978720474243164,
"num_input_tokens_seen": 22282240,
"step": 170,
"train_runtime": 376.4809,
"train_tokens_per_second": 59185.573
},
{
"epoch": 0.06495849873691809,
"grad_norm": 2.40625,
"learning_rate": 4.9980661981071995e-05,
"loss": 2.927627944946289,
"num_input_tokens_seen": 23592960,
"step": 180,
"train_runtime": 395.4258,
"train_tokens_per_second": 59664.691
},
{
"epoch": 0.06856730422230242,
"grad_norm": 3.640625,
"learning_rate": 4.997455715454986e-05,
"loss": 2.8903242111206056,
"num_input_tokens_seen": 24903680,
"step": 190,
"train_runtime": 414.3547,
"train_tokens_per_second": 60102.321
},
{
"epoch": 0.07217610970768676,
"grad_norm": 3.515625,
"learning_rate": 4.9967616654346026e-05,
"loss": 2.8748184204101563,
"num_input_tokens_seen": 26214400,
"step": 200,
"train_runtime": 433.2497,
"train_tokens_per_second": 60506.45
},
{
"epoch": 0.0757849151930711,
"grad_norm": 3.9375,
"learning_rate": 4.995984071269658e-05,
"loss": 2.8495594024658204,
"num_input_tokens_seen": 27525120,
"step": 210,
"train_runtime": 454.5473,
"train_tokens_per_second": 60555.019
},
{
"epoch": 0.07939372067845543,
"grad_norm": 2.953125,
"learning_rate": 4.995122958979232e-05,
"loss": 2.8382701873779297,
"num_input_tokens_seen": 28835840,
"step": 220,
"train_runtime": 473.4338,
"train_tokens_per_second": 60907.867
},
{
"epoch": 0.08300252616383977,
"grad_norm": 4.46875,
"learning_rate": 4.994178357377003e-05,
"loss": 2.7890663146972656,
"num_input_tokens_seen": 30146560,
"step": 230,
"train_runtime": 492.3498,
"train_tokens_per_second": 61229.967
},
{
"epoch": 0.0866113316492241,
"grad_norm": 2.640625,
"learning_rate": 4.993150298070286e-05,
"loss": 2.761903762817383,
"num_input_tokens_seen": 31457280,
"step": 240,
"train_runtime": 511.2816,
"train_tokens_per_second": 61526.33
},
{
"epoch": 0.09022013713460844,
"grad_norm": 4.03125,
"learning_rate": 4.9920388154589745e-05,
"loss": 2.697579574584961,
"num_input_tokens_seen": 32768000,
"step": 250,
"train_runtime": 530.223,
"train_tokens_per_second": 61800.416
},
{
"epoch": 0.09382894261999278,
"grad_norm": 5.78125,
"learning_rate": 4.99084394673439e-05,
"loss": 2.681498146057129,
"num_input_tokens_seen": 34078720,
"step": 260,
"train_runtime": 549.1723,
"train_tokens_per_second": 62054.701
},
{
"epoch": 0.09743774810537711,
"grad_norm": 3.984375,
"learning_rate": 4.989565731878036e-05,
"loss": 2.61673526763916,
"num_input_tokens_seen": 35389440,
"step": 270,
"train_runtime": 568.1055,
"train_tokens_per_second": 62293.782
},
{
"epoch": 0.10104655359076146,
"grad_norm": 2.421875,
"learning_rate": 4.988204213660261e-05,
"loss": 2.589625358581543,
"num_input_tokens_seen": 36700160,
"step": 280,
"train_runtime": 587.0148,
"train_tokens_per_second": 62519.994
},
{
"epoch": 0.1046553590761458,
"grad_norm": 2.921875,
"learning_rate": 4.986759437638828e-05,
"loss": 2.60888729095459,
"num_input_tokens_seen": 38010880,
"step": 290,
"train_runtime": 605.9421,
"train_tokens_per_second": 62730.223
},
{
"epoch": 0.10826416456153014,
"grad_norm": 3.453125,
"learning_rate": 4.985231452157387e-05,
"loss": 2.6144739151000977,
"num_input_tokens_seen": 39321600,
"step": 300,
"train_runtime": 624.8504,
"train_tokens_per_second": 62929.624
},
{
"epoch": 0.11187297004691447,
"grad_norm": 3.125,
"learning_rate": 4.9836203083438624e-05,
"loss": 2.538804817199707,
"num_input_tokens_seen": 40632320,
"step": 310,
"train_runtime": 646.2695,
"train_tokens_per_second": 62872.104
},
{
"epoch": 0.11548177553229881,
"grad_norm": 5.09375,
"learning_rate": 4.98192606010874e-05,
"loss": 2.564370346069336,
"num_input_tokens_seen": 41943040,
"step": 320,
"train_runtime": 665.1402,
"train_tokens_per_second": 63058.949
},
{
"epoch": 0.11909058101768315,
"grad_norm": 3.28125,
"learning_rate": 4.980148764143261e-05,
"loss": 2.5560630798339843,
"num_input_tokens_seen": 43253760,
"step": 330,
"train_runtime": 684.0334,
"train_tokens_per_second": 63233.407
},
{
"epoch": 0.12269938650306748,
"grad_norm": 2.484375,
"learning_rate": 4.978288479917528e-05,
"loss": 2.5639411926269533,
"num_input_tokens_seen": 44564480,
"step": 340,
"train_runtime": 702.9146,
"train_tokens_per_second": 63399.565
},
{
"epoch": 0.12630819198845183,
"grad_norm": 2.578125,
"learning_rate": 4.9763452696785126e-05,
"loss": 2.513383483886719,
"num_input_tokens_seen": 45875200,
"step": 350,
"train_runtime": 721.7893,
"train_tokens_per_second": 63557.608
},
{
"epoch": 0.12991699747383617,
"grad_norm": 3.703125,
"learning_rate": 4.974319198447974e-05,
"loss": 2.518290328979492,
"num_input_tokens_seen": 47185920,
"step": 360,
"train_runtime": 740.6903,
"train_tokens_per_second": 63705.334
},
{
"epoch": 0.1335258029592205,
"grad_norm": 2.65625,
"learning_rate": 4.972210334020285e-05,
"loss": 2.542829132080078,
"num_input_tokens_seen": 48496640,
"step": 370,
"train_runtime": 759.5697,
"train_tokens_per_second": 63847.52
},
{
"epoch": 0.13713460844460484,
"grad_norm": 5.90625,
"learning_rate": 4.97001874696016e-05,
"loss": 2.5011875152587892,
"num_input_tokens_seen": 49807360,
"step": 380,
"train_runtime": 778.4416,
"train_tokens_per_second": 63983.429
},
{
"epoch": 0.14074341392998918,
"grad_norm": 2.90625,
"learning_rate": 4.967744510600295e-05,
"loss": 2.4976362228393554,
"num_input_tokens_seen": 51118080,
"step": 390,
"train_runtime": 797.2713,
"train_tokens_per_second": 64116.289
},
{
"epoch": 0.14435221941537352,
"grad_norm": 3.25,
"learning_rate": 4.9653877010389164e-05,
"loss": 2.507686805725098,
"num_input_tokens_seen": 52428800,
"step": 400,
"train_runtime": 816.1018,
"train_tokens_per_second": 64242.967
},
{
"epoch": 0.14796102490075785,
"grad_norm": 2.203125,
"learning_rate": 4.962948397137229e-05,
"loss": 2.474226951599121,
"num_input_tokens_seen": 53739520,
"step": 410,
"train_runtime": 836.4537,
"train_tokens_per_second": 64246.857
},
{
"epoch": 0.1515698303861422,
"grad_norm": 3.390625,
"learning_rate": 4.960426680516786e-05,
"loss": 2.504658508300781,
"num_input_tokens_seen": 55050240,
"step": 420,
"train_runtime": 855.3633,
"train_tokens_per_second": 64358.895
},
{
"epoch": 0.15517863587152653,
"grad_norm": 3.375,
"learning_rate": 4.9578226355567474e-05,
"loss": 2.453939437866211,
"num_input_tokens_seen": 56360960,
"step": 430,
"train_runtime": 874.2501,
"train_tokens_per_second": 64467.776
},
{
"epoch": 0.15878744135691086,
"grad_norm": 3.4375,
"learning_rate": 4.955136349391065e-05,
"loss": 2.46431941986084,
"num_input_tokens_seen": 57671680,
"step": 440,
"train_runtime": 893.1411,
"train_tokens_per_second": 64571.744
},
{
"epoch": 0.1623962468422952,
"grad_norm": 5.78125,
"learning_rate": 4.9523679119055635e-05,
"loss": 2.451584243774414,
"num_input_tokens_seen": 58982400,
"step": 450,
"train_runtime": 912.0215,
"train_tokens_per_second": 64672.161
},
{
"epoch": 0.16600505232767954,
"grad_norm": 4.25,
"learning_rate": 4.949517415734932e-05,
"loss": 2.4436901092529295,
"num_input_tokens_seen": 60293120,
"step": 460,
"train_runtime": 930.9065,
"train_tokens_per_second": 64768.183
},
{
"epoch": 0.16961385781306387,
"grad_norm": 3.5,
"learning_rate": 4.9465849562596245e-05,
"loss": 2.4572980880737303,
"num_input_tokens_seen": 61603840,
"step": 470,
"train_runtime": 949.7891,
"train_tokens_per_second": 64860.544
},
{
"epoch": 0.1732226632984482,
"grad_norm": 3.234375,
"learning_rate": 4.943570631602672e-05,
"loss": 2.4464738845825194,
"num_input_tokens_seen": 62914560,
"step": 480,
"train_runtime": 968.6781,
"train_tokens_per_second": 64948.885
},
{
"epoch": 0.17683146878383255,
"grad_norm": 3.265625,
"learning_rate": 4.9404745426263945e-05,
"loss": 2.413909912109375,
"num_input_tokens_seen": 64225280,
"step": 490,
"train_runtime": 987.5714,
"train_tokens_per_second": 65033.559
},
{
"epoch": 0.18044027426921688,
"grad_norm": 4.4375,
"learning_rate": 4.937296792929027e-05,
"loss": 2.425960350036621,
"num_input_tokens_seen": 65536000,
"step": 500,
"train_runtime": 1006.4538,
"train_tokens_per_second": 65115.753
},
{
"epoch": 0.18404907975460122,
"grad_norm": 2.6875,
"learning_rate": 4.934037488841257e-05,
"loss": 2.4214879989624025,
"num_input_tokens_seen": 66846720,
"step": 510,
"train_runtime": 1030.6607,
"train_tokens_per_second": 64858.126
},
{
"epoch": 0.18765788523998556,
"grad_norm": 3.53125,
"learning_rate": 4.9306967394226613e-05,
"loss": 2.4362627029418946,
"num_input_tokens_seen": 68157440,
"step": 520,
"train_runtime": 1049.5437,
"train_tokens_per_second": 64940.069
},
{
"epoch": 0.1912666907253699,
"grad_norm": 5.15625,
"learning_rate": 4.927274656458059e-05,
"loss": 2.4367109298706056,
"num_input_tokens_seen": 69468160,
"step": 530,
"train_runtime": 1068.4149,
"train_tokens_per_second": 65019.837
},
{
"epoch": 0.19487549621075423,
"grad_norm": 3.671875,
"learning_rate": 4.923771354453771e-05,
"loss": 2.375163459777832,
"num_input_tokens_seen": 70778880,
"step": 540,
"train_runtime": 1087.2978,
"train_tokens_per_second": 65096.13
},
{
"epoch": 0.19848430169613857,
"grad_norm": 4.3125,
"learning_rate": 4.920186950633791e-05,
"loss": 2.4392827987670898,
"num_input_tokens_seen": 72089600,
"step": 550,
"train_runtime": 1106.1535,
"train_tokens_per_second": 65171.423
},
{
"epoch": 0.20209310718152293,
"grad_norm": 3.34375,
"learning_rate": 4.9165215649358574e-05,
"loss": 2.420306396484375,
"num_input_tokens_seen": 73400320,
"step": 560,
"train_runtime": 1125.0201,
"train_tokens_per_second": 65243.561
},
{
"epoch": 0.20570191266690727,
"grad_norm": 5.0,
"learning_rate": 4.912775320007445e-05,
"loss": 2.3969913482666017,
"num_input_tokens_seen": 74711040,
"step": 570,
"train_runtime": 1143.88,
"train_tokens_per_second": 65313.706
},
{
"epoch": 0.2093107181522916,
"grad_norm": 4.34375,
"learning_rate": 4.90894834120166e-05,
"loss": 2.3971323013305663,
"num_input_tokens_seen": 76021760,
"step": 580,
"train_runtime": 1162.7459,
"train_tokens_per_second": 65381.231
},
{
"epoch": 0.21291952363767594,
"grad_norm": 3.984375,
"learning_rate": 4.905040756573042e-05,
"loss": 2.4156164169311523,
"num_input_tokens_seen": 77332480,
"step": 590,
"train_runtime": 1181.6028,
"train_tokens_per_second": 65447.101
},
{
"epoch": 0.21652832912306028,
"grad_norm": 4.125,
"learning_rate": 4.901052696873286e-05,
"loss": 2.38603515625,
"num_input_tokens_seen": 78643200,
"step": 600,
"train_runtime": 1200.4661,
"train_tokens_per_second": 65510.556
},
{
"epoch": 0.2201371346084446,
"grad_norm": 5.125,
"learning_rate": 4.8969842955468596e-05,
"loss": 2.3919803619384767,
"num_input_tokens_seen": 79953920,
"step": 610,
"train_runtime": 1222.526,
"train_tokens_per_second": 65400.59
},
{
"epoch": 0.22374594009382895,
"grad_norm": 2.65625,
"learning_rate": 4.892835688726546e-05,
"loss": 2.4279273986816405,
"num_input_tokens_seen": 81264640,
"step": 620,
"train_runtime": 1241.4138,
"train_tokens_per_second": 65461.362
},
{
"epoch": 0.22735474557921329,
"grad_norm": 3.984375,
"learning_rate": 4.88860701522888e-05,
"loss": 2.3708824157714843,
"num_input_tokens_seen": 82575360,
"step": 630,
"train_runtime": 1260.2633,
"train_tokens_per_second": 65522.307
},
{
"epoch": 0.23096355106459762,
"grad_norm": 2.71875,
"learning_rate": 4.884298416549512e-05,
"loss": 2.399201583862305,
"num_input_tokens_seen": 83886080,
"step": 640,
"train_runtime": 1279.1242,
"train_tokens_per_second": 65580.87
},
{
"epoch": 0.23457235654998196,
"grad_norm": 2.921875,
"learning_rate": 4.879910036858464e-05,
"loss": 2.3736968994140626,
"num_input_tokens_seen": 85196800,
"step": 650,
"train_runtime": 1297.9757,
"train_tokens_per_second": 65638.211
},
{
"epoch": 0.2381811620353663,
"grad_norm": 3.25,
"learning_rate": 4.875442022995315e-05,
"loss": 2.3272987365722657,
"num_input_tokens_seen": 86507520,
"step": 660,
"train_runtime": 1316.835,
"train_tokens_per_second": 65693.518
},
{
"epoch": 0.24178996752075063,
"grad_norm": 3.25,
"learning_rate": 4.8708945244642814e-05,
"loss": 2.366088104248047,
"num_input_tokens_seen": 87818240,
"step": 670,
"train_runtime": 1335.7017,
"train_tokens_per_second": 65746.897
},
{
"epoch": 0.24539877300613497,
"grad_norm": 4.4375,
"learning_rate": 4.8662676934292145e-05,
"loss": 2.3694658279418945,
"num_input_tokens_seen": 89128960,
"step": 680,
"train_runtime": 1354.5738,
"train_tokens_per_second": 65798.526
},
{
"epoch": 0.2490075784915193,
"grad_norm": 4.875,
"learning_rate": 4.861561684708513e-05,
"loss": 2.370319938659668,
"num_input_tokens_seen": 90439680,
"step": 690,
"train_runtime": 1373.4498,
"train_tokens_per_second": 65848.55
},
{
"epoch": 0.25261638397690367,
"grad_norm": 4.09375,
"learning_rate": 4.85677665576994e-05,
"loss": 2.353267860412598,
"num_input_tokens_seen": 91750400,
"step": 700,
"train_runtime": 1392.3268,
"train_tokens_per_second": 65897.171
},
{
"epoch": 0.256225189462288,
"grad_norm": 2.921875,
"learning_rate": 4.851912766725354e-05,
"loss": 2.3250946044921874,
"num_input_tokens_seen": 93061120,
"step": 710,
"train_runtime": 1413.3943,
"train_tokens_per_second": 65842.29
},
{
"epoch": 0.25983399494767234,
"grad_norm": 3.265625,
"learning_rate": 4.8469701803253484e-05,
"loss": 2.3694339752197267,
"num_input_tokens_seen": 94371840,
"step": 720,
"train_runtime": 1432.2376,
"train_tokens_per_second": 65891.188
},
{
"epoch": 0.2634428004330567,
"grad_norm": 5.28125,
"learning_rate": 4.8419490619538145e-05,
"loss": 2.356003189086914,
"num_input_tokens_seen": 95682560,
"step": 730,
"train_runtime": 1451.105,
"train_tokens_per_second": 65937.723
},
{
"epoch": 0.267051605918441,
"grad_norm": 3.046875,
"learning_rate": 4.8368495796223977e-05,
"loss": 2.354664993286133,
"num_input_tokens_seen": 96993280,
"step": 740,
"train_runtime": 1469.9628,
"train_tokens_per_second": 65983.495
},
{
"epoch": 0.27066041140382535,
"grad_norm": 3.75,
"learning_rate": 4.8316719039648816e-05,
"loss": 2.372145652770996,
"num_input_tokens_seen": 98304000,
"step": 750,
"train_runtime": 1488.8219,
"train_tokens_per_second": 66028.046
},
{
"epoch": 0.2742692168892097,
"grad_norm": 3.40625,
"learning_rate": 4.826416208231477e-05,
"loss": 2.388836669921875,
"num_input_tokens_seen": 99614720,
"step": 760,
"train_runtime": 1507.6902,
"train_tokens_per_second": 66071.082
},
{
"epoch": 0.277878022374594,
"grad_norm": 2.96875,
"learning_rate": 4.821082668283023e-05,
"loss": 2.347779083251953,
"num_input_tokens_seen": 100925440,
"step": 770,
"train_runtime": 1526.5377,
"train_tokens_per_second": 66113.951
},
{
"epoch": 0.28148682785997836,
"grad_norm": 3.4375,
"learning_rate": 4.815671462585106e-05,
"loss": 2.340774154663086,
"num_input_tokens_seen": 102236160,
"step": 780,
"train_runtime": 1545.3818,
"train_tokens_per_second": 66155.925
},
{
"epoch": 0.2850956333453627,
"grad_norm": 3.46875,
"learning_rate": 4.810182772202085e-05,
"loss": 2.335291862487793,
"num_input_tokens_seen": 103546880,
"step": 790,
"train_runtime": 1564.2273,
"train_tokens_per_second": 66196.825
},
{
"epoch": 0.28870443883074703,
"grad_norm": 3.609375,
"learning_rate": 4.8046167807910336e-05,
"loss": 2.34542293548584,
"num_input_tokens_seen": 104857600,
"step": 800,
"train_runtime": 1583.1024,
"train_tokens_per_second": 66235.515
},
{
"epoch": 0.29231324431613137,
"grad_norm": 3.140625,
"learning_rate": 4.798973674595597e-05,
"loss": 2.357075881958008,
"num_input_tokens_seen": 106168320,
"step": 810,
"train_runtime": 1604.6829,
"train_tokens_per_second": 66161.559
},
{
"epoch": 0.2959220498015157,
"grad_norm": 3.59375,
"learning_rate": 4.793253642439757e-05,
"loss": 2.3224910736083983,
"num_input_tokens_seen": 107479040,
"step": 820,
"train_runtime": 1623.514,
"train_tokens_per_second": 66201.488
},
{
"epoch": 0.29953085528690004,
"grad_norm": 3.25,
"learning_rate": 4.7874568757215156e-05,
"loss": 2.3438846588134767,
"num_input_tokens_seen": 108789760,
"step": 830,
"train_runtime": 1642.3671,
"train_tokens_per_second": 66239.614
},
{
"epoch": 0.3031396607722844,
"grad_norm": 3.21875,
"learning_rate": 4.781583568406488e-05,
"loss": 2.357133674621582,
"num_input_tokens_seen": 110100480,
"step": 840,
"train_runtime": 1661.2058,
"train_tokens_per_second": 66277.448
},
{
"epoch": 0.3067484662576687,
"grad_norm": 3.46875,
"learning_rate": 4.775633917021417e-05,
"loss": 2.3187433242797852,
"num_input_tokens_seen": 111411200,
"step": 850,
"train_runtime": 1680.0526,
"train_tokens_per_second": 66314.114
},
{
"epoch": 0.31035727174305305,
"grad_norm": 2.5625,
"learning_rate": 4.769608120647595e-05,
"loss": 2.3682619094848634,
"num_input_tokens_seen": 112721920,
"step": 860,
"train_runtime": 1698.8993,
"train_tokens_per_second": 66349.972
},
{
"epoch": 0.3139660772284374,
"grad_norm": 3.8125,
"learning_rate": 4.763506380914199e-05,
"loss": 2.319541168212891,
"num_input_tokens_seen": 114032640,
"step": 870,
"train_runtime": 1717.748,
"train_tokens_per_second": 66384.963
},
{
"epoch": 0.3175748827138217,
"grad_norm": 4.46875,
"learning_rate": 4.7573289019915477e-05,
"loss": 2.335500717163086,
"num_input_tokens_seen": 115343360,
"step": 880,
"train_runtime": 1736.5953,
"train_tokens_per_second": 66419.253
},
{
"epoch": 0.32118368819920606,
"grad_norm": 3.0,
"learning_rate": 4.75107589058427e-05,
"loss": 2.282669448852539,
"num_input_tokens_seen": 116654080,
"step": 890,
"train_runtime": 1755.439,
"train_tokens_per_second": 66452.938
},
{
"epoch": 0.3247924936845904,
"grad_norm": 4.09375,
"learning_rate": 4.744747555924387e-05,
"loss": 2.335264778137207,
"num_input_tokens_seen": 117964800,
"step": 900,
"train_runtime": 1774.2872,
"train_tokens_per_second": 66485.743
},
{
"epoch": 0.32840129916997474,
"grad_norm": 3.078125,
"learning_rate": 4.7383441097643115e-05,
"loss": 2.3090591430664062,
"num_input_tokens_seen": 119275520,
"step": 910,
"train_runtime": 1795.3767,
"train_tokens_per_second": 66434.815
},
{
"epoch": 0.3320101046553591,
"grad_norm": 3.75,
"learning_rate": 4.7318657663697606e-05,
"loss": 2.3304624557495117,
"num_input_tokens_seen": 120586240,
"step": 920,
"train_runtime": 1814.2347,
"train_tokens_per_second": 66466.727
},
{
"epoch": 0.3356189101407434,
"grad_norm": 3.484375,
"learning_rate": 4.725312742512591e-05,
"loss": 2.3250059127807616,
"num_input_tokens_seen": 121896960,
"step": 930,
"train_runtime": 1833.0853,
"train_tokens_per_second": 66498.246
},
{
"epoch": 0.33922771562612775,
"grad_norm": 2.828125,
"learning_rate": 4.7186852574635374e-05,
"loss": 2.333821105957031,
"num_input_tokens_seen": 123207680,
"step": 940,
"train_runtime": 1851.9408,
"train_tokens_per_second": 66528.95
},
{
"epoch": 0.3428365211115121,
"grad_norm": 3.3125,
"learning_rate": 4.711983532984887e-05,
"loss": 2.338519477844238,
"num_input_tokens_seen": 124518400,
"step": 950,
"train_runtime": 1870.7786,
"train_tokens_per_second": 66559.666
},
{
"epoch": 0.3464453265968964,
"grad_norm": 5.09375,
"learning_rate": 4.705207793323047e-05,
"loss": 2.3416236877441405,
"num_input_tokens_seen": 125829120,
"step": 960,
"train_runtime": 1889.6299,
"train_tokens_per_second": 66589.295
},
{
"epoch": 0.35005413208228076,
"grad_norm": 2.796875,
"learning_rate": 4.6983582652010495e-05,
"loss": 2.3152448654174806,
"num_input_tokens_seen": 127139840,
"step": 970,
"train_runtime": 1908.4704,
"train_tokens_per_second": 66618.712
},
{
"epoch": 0.3536629375676651,
"grad_norm": 2.625,
"learning_rate": 4.6914351778109624e-05,
"loss": 2.3523880004882813,
"num_input_tokens_seen": 128450560,
"step": 980,
"train_runtime": 1927.2914,
"train_tokens_per_second": 66648.23
},
{
"epoch": 0.35727174305304943,
"grad_norm": 3.0625,
"learning_rate": 4.6844387628062184e-05,
"loss": 2.3372316360473633,
"num_input_tokens_seen": 129761280,
"step": 990,
"train_runtime": 1946.1498,
"train_tokens_per_second": 66675.894
},
{
"epoch": 0.36088054853843377,
"grad_norm": 3.84375,
"learning_rate": 4.6773692542938674e-05,
"loss": 2.354751777648926,
"num_input_tokens_seen": 131072000,
"step": 1000,
"train_runtime": 1964.9866,
"train_tokens_per_second": 66703.762
},
{
"epoch": 0.3644893540238181,
"grad_norm": 2.578125,
"learning_rate": 4.670226888826742e-05,
"loss": 2.3818334579467773,
"num_input_tokens_seen": 132382720,
"step": 1010,
"train_runtime": 1987.7787,
"train_tokens_per_second": 66598.32
},
{
"epoch": 0.36809815950920244,
"grad_norm": 2.171875,
"learning_rate": 4.663011905395538e-05,
"loss": 2.3537199020385744,
"num_input_tokens_seen": 133693440,
"step": 1020,
"train_runtime": 2006.614,
"train_tokens_per_second": 66626.388
},
{
"epoch": 0.3717069649945868,
"grad_norm": 2.25,
"learning_rate": 4.655724545420826e-05,
"loss": 2.310554313659668,
"num_input_tokens_seen": 135004160,
"step": 1030,
"train_runtime": 2025.4588,
"train_tokens_per_second": 66653.621
},
{
"epoch": 0.3753157704799711,
"grad_norm": 4.21875,
"learning_rate": 4.648365052744962e-05,
"loss": 2.2933753967285155,
"num_input_tokens_seen": 136314880,
"step": 1040,
"train_runtime": 2044.3059,
"train_tokens_per_second": 66680.276
},
{
"epoch": 0.37892457596535545,
"grad_norm": 3.0625,
"learning_rate": 4.640933673623939e-05,
"loss": 2.312954902648926,
"num_input_tokens_seen": 137625600,
"step": 1050,
"train_runtime": 2063.1496,
"train_tokens_per_second": 66706.553
},
{
"epoch": 0.3825333814507398,
"grad_norm": 4.28125,
"learning_rate": 4.633430656719143e-05,
"loss": 2.3173431396484374,
"num_input_tokens_seen": 138936320,
"step": 1060,
"train_runtime": 2081.9779,
"train_tokens_per_second": 66732.85
},
{
"epoch": 0.3861421869361241,
"grad_norm": 2.984375,
"learning_rate": 4.625856253089028e-05,
"loss": 2.2680578231811523,
"num_input_tokens_seen": 140247040,
"step": 1070,
"train_runtime": 2100.8155,
"train_tokens_per_second": 66758.379
},
{
"epoch": 0.38975099242150846,
"grad_norm": 3.1875,
"learning_rate": 4.618210716180722e-05,
"loss": 2.310435104370117,
"num_input_tokens_seen": 141557760,
"step": 1080,
"train_runtime": 2119.6597,
"train_tokens_per_second": 66783.249
},
{
"epoch": 0.3933597979068928,
"grad_norm": 3.21875,
"learning_rate": 4.610494301821543e-05,
"loss": 2.3136465072631838,
"num_input_tokens_seen": 142868480,
"step": 1090,
"train_runtime": 2138.482,
"train_tokens_per_second": 66808.362
},
{
"epoch": 0.39696860339227713,
"grad_norm": 3.265625,
"learning_rate": 4.60270726821044e-05,
"loss": 2.3062191009521484,
"num_input_tokens_seen": 144179200,
"step": 1100,
"train_runtime": 2157.298,
"train_tokens_per_second": 66833.233
},
{
"epoch": 0.40057740887766147,
"grad_norm": 3.46875,
"learning_rate": 4.594849875909351e-05,
"loss": 2.311140251159668,
"num_input_tokens_seen": 145489920,
"step": 1110,
"train_runtime": 2178.7661,
"train_tokens_per_second": 66776.292
},
{
"epoch": 0.40418621436304586,
"grad_norm": 2.96875,
"learning_rate": 4.586922387834489e-05,
"loss": 2.275248336791992,
"num_input_tokens_seen": 146800640,
"step": 1120,
"train_runtime": 2197.586,
"train_tokens_per_second": 66800.864
},
{
"epoch": 0.4077950198484302,
"grad_norm": 2.59375,
"learning_rate": 4.5789250692475396e-05,
"loss": 2.3349634170532227,
"num_input_tokens_seen": 148111360,
"step": 1130,
"train_runtime": 2216.4069,
"train_tokens_per_second": 66824.986
},
{
"epoch": 0.41140382533381453,
"grad_norm": 3.046875,
"learning_rate": 4.5708581877467884e-05,
"loss": 2.297293853759766,
"num_input_tokens_seen": 149422080,
"step": 1140,
"train_runtime": 2235.2207,
"train_tokens_per_second": 66848.914
},
{
"epoch": 0.41501263081919887,
"grad_norm": 3.515625,
"learning_rate": 4.5627220132581646e-05,
"loss": 2.3298309326171873,
"num_input_tokens_seen": 150732800,
"step": 1150,
"train_runtime": 2254.0417,
"train_tokens_per_second": 66872.231
},
{
"epoch": 0.4186214363045832,
"grad_norm": 2.515625,
"learning_rate": 4.554516818026212e-05,
"loss": 2.3104930877685548,
"num_input_tokens_seen": 152043520,
"step": 1160,
"train_runtime": 2272.8631,
"train_tokens_per_second": 66895.152
},
{
"epoch": 0.42223024178996754,
"grad_norm": 2.765625,
"learning_rate": 4.546242876604976e-05,
"loss": 2.2972536087036133,
"num_input_tokens_seen": 153354240,
"step": 1170,
"train_runtime": 2291.6783,
"train_tokens_per_second": 66917.875
},
{
"epoch": 0.4258390472753519,
"grad_norm": 2.78125,
"learning_rate": 4.5379004658488175e-05,
"loss": 2.274612617492676,
"num_input_tokens_seen": 154664960,
"step": 1180,
"train_runtime": 2310.5193,
"train_tokens_per_second": 66939.481
},
{
"epoch": 0.4294478527607362,
"grad_norm": 2.125,
"learning_rate": 4.5294898649031515e-05,
"loss": 2.28421630859375,
"num_input_tokens_seen": 155975680,
"step": 1190,
"train_runtime": 2329.3618,
"train_tokens_per_second": 66960.694
},
{
"epoch": 0.43305665824612055,
"grad_norm": 3.171875,
"learning_rate": 4.521011355195106e-05,
"loss": 2.290935516357422,
"num_input_tokens_seen": 157286400,
"step": 1200,
"train_runtime": 2348.186,
"train_tokens_per_second": 66982.087
},
{
"epoch": 0.4366654637315049,
"grad_norm": 2.78125,
"learning_rate": 4.5124652204241016e-05,
"loss": 2.308019828796387,
"num_input_tokens_seen": 158597120,
"step": 1210,
"train_runtime": 2369.5346,
"train_tokens_per_second": 66931.759
},
{
"epoch": 0.4402742692168892,
"grad_norm": 2.5,
"learning_rate": 4.503851746552362e-05,
"loss": 2.3127092361450194,
"num_input_tokens_seen": 159907840,
"step": 1220,
"train_runtime": 2388.3658,
"train_tokens_per_second": 66952.827
},
{
"epoch": 0.44388307470227356,
"grad_norm": 3.0625,
"learning_rate": 4.4951712217953454e-05,
"loss": 2.3049333572387694,
"num_input_tokens_seen": 161218560,
"step": 1230,
"train_runtime": 2407.1991,
"train_tokens_per_second": 66973.506
},
{
"epoch": 0.4474918801876579,
"grad_norm": 3.484375,
"learning_rate": 4.486423936612101e-05,
"loss": 2.2997787475585936,
"num_input_tokens_seen": 162529280,
"step": 1240,
"train_runtime": 2426.0318,
"train_tokens_per_second": 66993.878
},
{
"epoch": 0.45110068567304223,
"grad_norm": 3.875,
"learning_rate": 4.477610183695543e-05,
"loss": 2.3207189559936525,
"num_input_tokens_seen": 163840000,
"step": 1250,
"train_runtime": 2444.8663,
"train_tokens_per_second": 67013.89
},
{
"epoch": 0.45470949115842657,
"grad_norm": 2.71875,
"learning_rate": 4.4687302579626706e-05,
"loss": 2.2699203491210938,
"num_input_tokens_seen": 165150720,
"step": 1260,
"train_runtime": 2463.704,
"train_tokens_per_second": 67033.508
},
{
"epoch": 0.4583182966438109,
"grad_norm": 3.703125,
"learning_rate": 4.459784456544685e-05,
"loss": 2.281772994995117,
"num_input_tokens_seen": 166461440,
"step": 1270,
"train_runtime": 2482.5216,
"train_tokens_per_second": 67053.37
},
{
"epoch": 0.46192710212919524,
"grad_norm": 2.65625,
"learning_rate": 4.4507730787770575e-05,
"loss": 2.280086898803711,
"num_input_tokens_seen": 167772160,
"step": 1280,
"train_runtime": 2501.3419,
"train_tokens_per_second": 67072.862
},
{
"epoch": 0.4655359076145796,
"grad_norm": 2.296875,
"learning_rate": 4.441696426189508e-05,
"loss": 2.304541015625,
"num_input_tokens_seen": 169082880,
"step": 1290,
"train_runtime": 2520.1698,
"train_tokens_per_second": 67091.859
},
{
"epoch": 0.4691447130999639,
"grad_norm": 1.9375,
"learning_rate": 4.432554802495917e-05,
"loss": 2.3161603927612306,
"num_input_tokens_seen": 170393600,
"step": 1300,
"train_runtime": 2538.9965,
"train_tokens_per_second": 67110.609
},
{
"epoch": 0.47275351858534825,
"grad_norm": 2.4375,
"learning_rate": 4.423348513584166e-05,
"loss": 2.3051275253295898,
"num_input_tokens_seen": 171704320,
"step": 1310,
"train_runtime": 2560.6455,
"train_tokens_per_second": 67055.093
},
{
"epoch": 0.4763623240707326,
"grad_norm": 3.046875,
"learning_rate": 4.414077867505895e-05,
"loss": 2.2651365280151365,
"num_input_tokens_seen": 173015040,
"step": 1320,
"train_runtime": 2579.4505,
"train_tokens_per_second": 67074.378
},
{
"epoch": 0.4799711295561169,
"grad_norm": 2.671875,
"learning_rate": 4.4047431744662035e-05,
"loss": 2.270708465576172,
"num_input_tokens_seen": 174325760,
"step": 1330,
"train_runtime": 2598.2436,
"train_tokens_per_second": 67093.694
},
{
"epoch": 0.48357993504150126,
"grad_norm": 2.296875,
"learning_rate": 4.395344746813263e-05,
"loss": 2.3111730575561524,
"num_input_tokens_seen": 175636480,
"step": 1340,
"train_runtime": 2617.0378,
"train_tokens_per_second": 67112.704
},
{
"epoch": 0.4871887405268856,
"grad_norm": 2.96875,
"learning_rate": 4.3858828990278725e-05,
"loss": 2.2733327865600588,
"num_input_tokens_seen": 176947200,
"step": 1350,
"train_runtime": 2635.8228,
"train_tokens_per_second": 67131.675
},
{
"epoch": 0.49079754601226994,
"grad_norm": 3.390625,
"learning_rate": 4.376357947712929e-05,
"loss": 2.228657531738281,
"num_input_tokens_seen": 178257920,
"step": 1360,
"train_runtime": 2654.6177,
"train_tokens_per_second": 67150.129
},
{
"epoch": 0.4944063514976543,
"grad_norm": 2.828125,
"learning_rate": 4.366770211582837e-05,
"loss": 2.281584358215332,
"num_input_tokens_seen": 179568640,
"step": 1370,
"train_runtime": 2673.4148,
"train_tokens_per_second": 67168.267
},
{
"epoch": 0.4980151569830386,
"grad_norm": 2.8125,
"learning_rate": 4.357120011452846e-05,
"loss": 2.324570083618164,
"num_input_tokens_seen": 180879360,
"step": 1380,
"train_runtime": 2692.2055,
"train_tokens_per_second": 67186.312
},
{
"epoch": 0.501623962468423,
"grad_norm": 2.578125,
"learning_rate": 4.347407670228312e-05,
"loss": 2.3087745666503907,
"num_input_tokens_seen": 182190080,
"step": 1390,
"train_runtime": 2710.9858,
"train_tokens_per_second": 67204.366
},
{
"epoch": 0.5052327679538073,
"grad_norm": 2.578125,
"learning_rate": 4.337633512893893e-05,
"loss": 2.241712760925293,
"num_input_tokens_seen": 183500800,
"step": 1400,
"train_runtime": 2729.7708,
"train_tokens_per_second": 67222.053
},
{
"epoch": 0.5088415734391917,
"grad_norm": 3.546875,
"learning_rate": 4.3277978665026785e-05,
"loss": 2.327380561828613,
"num_input_tokens_seen": 184811520,
"step": 1410,
"train_runtime": 2751.2471,
"train_tokens_per_second": 67173.727
},
{
"epoch": 0.512450378924576,
"grad_norm": 2.796875,
"learning_rate": 4.3179010601652424e-05,
"loss": 2.29742431640625,
"num_input_tokens_seen": 186122240,
"step": 1420,
"train_runtime": 2770.0302,
"train_tokens_per_second": 67191.412
},
{
"epoch": 0.5160591844099603,
"grad_norm": 3.5,
"learning_rate": 4.30794342503863e-05,
"loss": 2.2658599853515624,
"num_input_tokens_seen": 187432960,
"step": 1430,
"train_runtime": 2788.8469,
"train_tokens_per_second": 67208.05
},
{
"epoch": 0.5196679898953447,
"grad_norm": 2.796875,
"learning_rate": 4.2979252943152815e-05,
"loss": 2.249949073791504,
"num_input_tokens_seen": 188743680,
"step": 1440,
"train_runtime": 2807.6459,
"train_tokens_per_second": 67224.887
},
{
"epoch": 0.523276795380729,
"grad_norm": 2.4375,
"learning_rate": 4.287847003211878e-05,
"loss": 2.2962003707885743,
"num_input_tokens_seen": 190054400,
"step": 1450,
"train_runtime": 2826.4466,
"train_tokens_per_second": 67241.462
},
{
"epoch": 0.5268856008661134,
"grad_norm": 2.375,
"learning_rate": 4.27770888895813e-05,
"loss": 2.2966489791870117,
"num_input_tokens_seen": 191365120,
"step": 1460,
"train_runtime": 2845.2424,
"train_tokens_per_second": 67257.931
},
{
"epoch": 0.5304944063514977,
"grad_norm": 1.9453125,
"learning_rate": 4.267511290785485e-05,
"loss": 2.2982467651367187,
"num_input_tokens_seen": 192675840,
"step": 1470,
"train_runtime": 2864.0538,
"train_tokens_per_second": 67273.82
},
{
"epoch": 0.534103211836882,
"grad_norm": 2.640625,
"learning_rate": 4.257254549915789e-05,
"loss": 2.310243606567383,
"num_input_tokens_seen": 193986560,
"step": 1480,
"train_runtime": 2882.8542,
"train_tokens_per_second": 67289.757
},
{
"epoch": 0.5377120173222664,
"grad_norm": 2.453125,
"learning_rate": 4.246939009549856e-05,
"loss": 2.3411497116088866,
"num_input_tokens_seen": 195297280,
"step": 1490,
"train_runtime": 2901.6511,
"train_tokens_per_second": 67305.569
},
{
"epoch": 0.5413208228076507,
"grad_norm": 2.859375,
"learning_rate": 4.2365650148559946e-05,
"loss": 2.2888193130493164,
"num_input_tokens_seen": 196608000,
"step": 1500,
"train_runtime": 2920.4506,
"train_tokens_per_second": 67321.118
},
{
"epoch": 0.544929628293035,
"grad_norm": 2.625,
"learning_rate": 4.2261329129584495e-05,
"loss": 2.278774452209473,
"num_input_tokens_seen": 197918720,
"step": 1510,
"train_runtime": 2944.0498,
"train_tokens_per_second": 67226.689
},
{
"epoch": 0.5485384337784194,
"grad_norm": 2.359375,
"learning_rate": 4.215643052925795e-05,
"loss": 2.2698015213012694,
"num_input_tokens_seen": 199229440,
"step": 1520,
"train_runtime": 2962.8554,
"train_tokens_per_second": 67242.376
},
{
"epoch": 0.5521472392638037,
"grad_norm": 2.65625,
"learning_rate": 4.2050957857592456e-05,
"loss": 2.319766044616699,
"num_input_tokens_seen": 200540160,
"step": 1530,
"train_runtime": 2981.6581,
"train_tokens_per_second": 67257.934
},
{
"epoch": 0.555756044749188,
"grad_norm": 3.484375,
"learning_rate": 4.194491464380919e-05,
"loss": 2.2656042098999025,
"num_input_tokens_seen": 201850880,
"step": 1540,
"train_runtime": 3000.4623,
"train_tokens_per_second": 67273.26
},
{
"epoch": 0.5593648502345724,
"grad_norm": 2.75,
"learning_rate": 4.1838304436220246e-05,
"loss": 2.31202392578125,
"num_input_tokens_seen": 203161600,
"step": 1550,
"train_runtime": 3019.2523,
"train_tokens_per_second": 67288.712
},
{
"epoch": 0.5629736557199567,
"grad_norm": 2.953125,
"learning_rate": 4.1731130802109863e-05,
"loss": 2.211695098876953,
"num_input_tokens_seen": 204472320,
"step": 1560,
"train_runtime": 3038.0539,
"train_tokens_per_second": 67303.718
},
{
"epoch": 0.5665824612053411,
"grad_norm": 2.5625,
"learning_rate": 4.162339732761514e-05,
"loss": 2.27321720123291,
"num_input_tokens_seen": 205783040,
"step": 1570,
"train_runtime": 3056.8504,
"train_tokens_per_second": 67318.65
},
{
"epoch": 0.5701912666907254,
"grad_norm": 2.71875,
"learning_rate": 4.151510761760597e-05,
"loss": 2.234796142578125,
"num_input_tokens_seen": 207093760,
"step": 1580,
"train_runtime": 3075.6457,
"train_tokens_per_second": 67333.424
},
{
"epoch": 0.5738000721761097,
"grad_norm": 3.15625,
"learning_rate": 4.140626529556444e-05,
"loss": 2.2829927444458007,
"num_input_tokens_seen": 208404480,
"step": 1590,
"train_runtime": 3094.4579,
"train_tokens_per_second": 67347.654
},
{
"epoch": 0.5774088776614941,
"grad_norm": 2.59375,
"learning_rate": 4.12968740034636e-05,
"loss": 2.2796735763549805,
"num_input_tokens_seen": 209715200,
"step": 1600,
"train_runtime": 3113.2505,
"train_tokens_per_second": 67362.135
},
{
"epoch": 0.5810176831468784,
"grad_norm": 2.578125,
"learning_rate": 4.118693740164558e-05,
"loss": 2.2237993240356446,
"num_input_tokens_seen": 211025920,
"step": 1610,
"train_runtime": 3135.5028,
"train_tokens_per_second": 67302.099
},
{
"epoch": 0.5846264886322627,
"grad_norm": 1.953125,
"learning_rate": 4.107645916869913e-05,
"loss": 2.297933578491211,
"num_input_tokens_seen": 212336640,
"step": 1620,
"train_runtime": 3154.2925,
"train_tokens_per_second": 67316.725
},
{
"epoch": 0.5882352941176471,
"grad_norm": 2.625,
"learning_rate": 4.09654430013365e-05,
"loss": 2.2486343383789062,
"num_input_tokens_seen": 213647360,
"step": 1630,
"train_runtime": 3173.0663,
"train_tokens_per_second": 67331.515
},
{
"epoch": 0.5918440996030314,
"grad_norm": 2.9375,
"learning_rate": 4.085389261426979e-05,
"loss": 2.2843048095703127,
"num_input_tokens_seen": 214958080,
"step": 1640,
"train_runtime": 3191.834,
"train_tokens_per_second": 67346.258
},
{
"epoch": 0.5954529050884158,
"grad_norm": 3.15625,
"learning_rate": 4.07418117400866e-05,
"loss": 2.2387674331665037,
"num_input_tokens_seen": 216268800,
"step": 1650,
"train_runtime": 3210.6231,
"train_tokens_per_second": 67360.383
},
{
"epoch": 0.5990617105738001,
"grad_norm": 2.125,
"learning_rate": 4.062920412912517e-05,
"loss": 2.281134033203125,
"num_input_tokens_seen": 217579520,
"step": 1660,
"train_runtime": 3229.3938,
"train_tokens_per_second": 67374.726
},
{
"epoch": 0.6026705160591844,
"grad_norm": 2.359375,
"learning_rate": 4.05160735493489e-05,
"loss": 2.233013725280762,
"num_input_tokens_seen": 218890240,
"step": 1670,
"train_runtime": 3248.1617,
"train_tokens_per_second": 67388.961
},
{
"epoch": 0.6062793215445688,
"grad_norm": 3.328125,
"learning_rate": 4.040242378622021e-05,
"loss": 2.2088239669799803,
"num_input_tokens_seen": 220200960,
"step": 1680,
"train_runtime": 3266.937,
"train_tokens_per_second": 67402.879
},
{
"epoch": 0.6098881270299531,
"grad_norm": 2.390625,
"learning_rate": 4.0288258642573956e-05,
"loss": 2.2553569793701174,
"num_input_tokens_seen": 221511680,
"step": 1690,
"train_runtime": 3285.7066,
"train_tokens_per_second": 67416.756
},
{
"epoch": 0.6134969325153374,
"grad_norm": 2.46875,
"learning_rate": 4.017358193849011e-05,
"loss": 2.280741500854492,
"num_input_tokens_seen": 222822400,
"step": 1700,
"train_runtime": 3304.4697,
"train_tokens_per_second": 67430.608
},
{
"epoch": 0.6171057380007218,
"grad_norm": 2.421875,
"learning_rate": 4.005839751116599e-05,
"loss": 2.289920425415039,
"num_input_tokens_seen": 224133120,
"step": 1710,
"train_runtime": 3325.6911,
"train_tokens_per_second": 67394.45
},
{
"epoch": 0.6207145434861061,
"grad_norm": 2.609375,
"learning_rate": 3.994270921478783e-05,
"loss": 2.268573760986328,
"num_input_tokens_seen": 225443840,
"step": 1720,
"train_runtime": 3344.471,
"train_tokens_per_second": 67407.922
},
{
"epoch": 0.6243233489714904,
"grad_norm": 2.75,
"learning_rate": 3.982652092040182e-05,
"loss": 2.285994529724121,
"num_input_tokens_seen": 226754560,
"step": 1730,
"train_runtime": 3363.2536,
"train_tokens_per_second": 67421.191
},
{
"epoch": 0.6279321544568748,
"grad_norm": 2.09375,
"learning_rate": 3.97098365157846e-05,
"loss": 2.289227294921875,
"num_input_tokens_seen": 228065280,
"step": 1740,
"train_runtime": 3382.0456,
"train_tokens_per_second": 67434.123
},
{
"epoch": 0.6315409599422591,
"grad_norm": 2.703125,
"learning_rate": 3.959265990531317e-05,
"loss": 2.2562992095947267,
"num_input_tokens_seen": 229376000,
"step": 1750,
"train_runtime": 3400.853,
"train_tokens_per_second": 67446.609
},
{
"epoch": 0.6351497654276435,
"grad_norm": 2.265625,
"learning_rate": 3.947499500983417e-05,
"loss": 2.248988151550293,
"num_input_tokens_seen": 230686720,
"step": 1760,
"train_runtime": 3419.6339,
"train_tokens_per_second": 67459.479
},
{
"epoch": 0.6387585709130278,
"grad_norm": 2.890625,
"learning_rate": 3.9356845766532805e-05,
"loss": 2.262241744995117,
"num_input_tokens_seen": 231997440,
"step": 1770,
"train_runtime": 3438.4228,
"train_tokens_per_second": 67472.051
},
{
"epoch": 0.6423673763984121,
"grad_norm": 2.796875,
"learning_rate": 3.923821612880102e-05,
"loss": 2.247925567626953,
"num_input_tokens_seen": 233308160,
"step": 1780,
"train_runtime": 3457.2112,
"train_tokens_per_second": 67484.498
},
{
"epoch": 0.6459761818837965,
"grad_norm": 2.328125,
"learning_rate": 3.911911006610525e-05,
"loss": 2.256356048583984,
"num_input_tokens_seen": 234618880,
"step": 1790,
"train_runtime": 3475.9969,
"train_tokens_per_second": 67496.862
},
{
"epoch": 0.6495849873691808,
"grad_norm": 2.59375,
"learning_rate": 3.899953156385355e-05,
"loss": 2.3100183486938475,
"num_input_tokens_seen": 235929600,
"step": 1800,
"train_runtime": 3494.7778,
"train_tokens_per_second": 67509.185
},
{
"epoch": 0.6531937928545651,
"grad_norm": 2.640625,
"learning_rate": 3.8879484623262335e-05,
"loss": 2.2395404815673827,
"num_input_tokens_seen": 237240320,
"step": 1810,
"train_runtime": 3517.2255,
"train_tokens_per_second": 67450.983
},
{
"epoch": 0.6568025983399495,
"grad_norm": 2.40625,
"learning_rate": 3.8758973261222385e-05,
"loss": 2.284636878967285,
"num_input_tokens_seen": 238551040,
"step": 1820,
"train_runtime": 3536.0096,
"train_tokens_per_second": 67463.346
},
{
"epoch": 0.6604114038253338,
"grad_norm": 2.1875,
"learning_rate": 3.863800151016451e-05,
"loss": 2.2737716674804687,
"num_input_tokens_seen": 239861760,
"step": 1830,
"train_runtime": 3554.7927,
"train_tokens_per_second": 67475.598
},
{
"epoch": 0.6640202093107181,
"grad_norm": 2.671875,
"learning_rate": 3.851657341792458e-05,
"loss": 2.3030860900878904,
"num_input_tokens_seen": 241172480,
"step": 1840,
"train_runtime": 3573.5693,
"train_tokens_per_second": 67487.842
},
{
"epoch": 0.6676290147961025,
"grad_norm": 2.875,
"learning_rate": 3.839469304760813e-05,
"loss": 2.274905204772949,
"num_input_tokens_seen": 242483200,
"step": 1850,
"train_runtime": 3592.357,
"train_tokens_per_second": 67499.751
},
{
"epoch": 0.6712378202814868,
"grad_norm": 3.28125,
"learning_rate": 3.8272364477454344e-05,
"loss": 2.2486251831054687,
"num_input_tokens_seen": 243793920,
"step": 1860,
"train_runtime": 3611.1487,
"train_tokens_per_second": 67511.46
},
{
"epoch": 0.6748466257668712,
"grad_norm": 2.53125,
"learning_rate": 3.814959180069962e-05,
"loss": 2.3203054428100587,
"num_input_tokens_seen": 245104640,
"step": 1870,
"train_runtime": 3629.9298,
"train_tokens_per_second": 67523.246
},
{
"epoch": 0.6784554312522555,
"grad_norm": 2.03125,
"learning_rate": 3.802637912544063e-05,
"loss": 2.275309371948242,
"num_input_tokens_seen": 246415360,
"step": 1880,
"train_runtime": 3648.7165,
"train_tokens_per_second": 67534.805
},
{
"epoch": 0.6820642367376398,
"grad_norm": 2.71875,
"learning_rate": 3.7902730574496804e-05,
"loss": 2.259540557861328,
"num_input_tokens_seen": 247726080,
"step": 1890,
"train_runtime": 3667.5018,
"train_tokens_per_second": 67546.274
},
{
"epoch": 0.6856730422230242,
"grad_norm": 2.984375,
"learning_rate": 3.777865028527245e-05,
"loss": 2.2632009506225588,
"num_input_tokens_seen": 249036800,
"step": 1900,
"train_runtime": 3686.2853,
"train_tokens_per_second": 67557.658
},
{
"epoch": 0.6892818477084085,
"grad_norm": 2.671875,
"learning_rate": 3.765414240961824e-05,
"loss": 2.2605398178100584,
"num_input_tokens_seen": 250347520,
"step": 1910,
"train_runtime": 3708.6088,
"train_tokens_per_second": 67504.428
},
{
"epoch": 0.6928906531937928,
"grad_norm": 2.3125,
"learning_rate": 3.7529211113692316e-05,
"loss": 2.2630123138427733,
"num_input_tokens_seen": 251658240,
"step": 1920,
"train_runtime": 3727.3827,
"train_tokens_per_second": 67516.072
},
{
"epoch": 0.6964994586791772,
"grad_norm": 2.765625,
"learning_rate": 3.7403860577820906e-05,
"loss": 2.2614559173583983,
"num_input_tokens_seen": 252968960,
"step": 1930,
"train_runtime": 3746.1659,
"train_tokens_per_second": 67527.432
},
{
"epoch": 0.7001082641645615,
"grad_norm": 2.4375,
"learning_rate": 3.727809499635841e-05,
"loss": 2.271468162536621,
"num_input_tokens_seen": 254279680,
"step": 1940,
"train_runtime": 3764.9463,
"train_tokens_per_second": 67538.726
},
{
"epoch": 0.7037170696499458,
"grad_norm": 2.28125,
"learning_rate": 3.715191857754707e-05,
"loss": 2.259329414367676,
"num_input_tokens_seen": 255590400,
"step": 1950,
"train_runtime": 3783.7308,
"train_tokens_per_second": 67549.837
},
{
"epoch": 0.7073258751353302,
"grad_norm": 2.28125,
"learning_rate": 3.702533554337618e-05,
"loss": 2.255583381652832,
"num_input_tokens_seen": 256901120,
"step": 1960,
"train_runtime": 3802.5028,
"train_tokens_per_second": 67561.059
},
{
"epoch": 0.7109346806207145,
"grad_norm": 2.109375,
"learning_rate": 3.6898350129440745e-05,
"loss": 2.227895164489746,
"num_input_tokens_seen": 258211840,
"step": 1970,
"train_runtime": 3821.2826,
"train_tokens_per_second": 67572.034
},
{
"epoch": 0.7145434861060989,
"grad_norm": 2.6875,
"learning_rate": 3.6770966584799845e-05,
"loss": 2.2536853790283202,
"num_input_tokens_seen": 259522560,
"step": 1980,
"train_runtime": 3840.0617,
"train_tokens_per_second": 67582.914
},
{
"epoch": 0.7181522915914832,
"grad_norm": 2.078125,
"learning_rate": 3.664318917183438e-05,
"loss": 2.2597951889038086,
"num_input_tokens_seen": 260833280,
"step": 1990,
"train_runtime": 3858.8425,
"train_tokens_per_second": 67593.658
},
{
"epoch": 0.7217610970768675,
"grad_norm": 2.84375,
"learning_rate": 3.651502216610451e-05,
"loss": 2.2733741760253907,
"num_input_tokens_seen": 262144000,
"step": 2000,
"train_runtime": 3877.6418,
"train_tokens_per_second": 67603.976
},
{
"epoch": 0.7253699025622519,
"grad_norm": 3.203125,
"learning_rate": 3.638646985620652e-05,
"loss": 2.277943801879883,
"num_input_tokens_seen": 263454720,
"step": 2010,
"train_runtime": 3901.0148,
"train_tokens_per_second": 67534.919
},
{
"epoch": 0.7289787080476362,
"grad_norm": 2.3125,
"learning_rate": 3.625753654362939e-05,
"loss": 2.316669464111328,
"num_input_tokens_seen": 264765440,
"step": 2020,
"train_runtime": 3919.7696,
"train_tokens_per_second": 67546.174
},
{
"epoch": 0.7325875135330205,
"grad_norm": 2.171875,
"learning_rate": 3.612822654261083e-05,
"loss": 2.228474807739258,
"num_input_tokens_seen": 266076160,
"step": 2030,
"train_runtime": 3938.527,
"train_tokens_per_second": 67557.278
},
{
"epoch": 0.7361963190184049,
"grad_norm": 2.625,
"learning_rate": 3.5998544179992887e-05,
"loss": 2.28963623046875,
"num_input_tokens_seen": 267386880,
"step": 2040,
"train_runtime": 3957.2799,
"train_tokens_per_second": 67568.352
},
{
"epoch": 0.7398051245037892,
"grad_norm": 2.15625,
"learning_rate": 3.586849379507725e-05,
"loss": 2.310571479797363,
"num_input_tokens_seen": 268697600,
"step": 2050,
"train_runtime": 3976.0438,
"train_tokens_per_second": 67579.134
},
{
"epoch": 0.7434139299891735,
"grad_norm": 2.078125,
"learning_rate": 3.573807973947996e-05,
"loss": 2.256072235107422,
"num_input_tokens_seen": 270008320,
"step": 2060,
"train_runtime": 3994.787,
"train_tokens_per_second": 67590.167
},
{
"epoch": 0.7470227354745579,
"grad_norm": 2.390625,
"learning_rate": 3.5607306376985874e-05,
"loss": 2.2760551452636717,
"num_input_tokens_seen": 271319040,
"step": 2070,
"train_runtime": 4013.5355,
"train_tokens_per_second": 67601.007
},
{
"epoch": 0.7506315409599422,
"grad_norm": 2.015625,
"learning_rate": 3.547617808340259e-05,
"loss": 2.2873741149902345,
"num_input_tokens_seen": 272629760,
"step": 2080,
"train_runtime": 4032.283,
"train_tokens_per_second": 67611.762
},
{
"epoch": 0.7542403464453266,
"grad_norm": 2.140625,
"learning_rate": 3.534469924641408e-05,
"loss": 2.279720687866211,
"num_input_tokens_seen": 273940480,
"step": 2090,
"train_runtime": 4051.0412,
"train_tokens_per_second": 67622.239
},
{
"epoch": 0.7578491519307109,
"grad_norm": 2.0,
"learning_rate": 3.521287426543384e-05,
"loss": 2.284140396118164,
"num_input_tokens_seen": 275251200,
"step": 2100,
"train_runtime": 4069.7944,
"train_tokens_per_second": 67632.704
},
{
"epoch": 0.7614579574160952,
"grad_norm": 2.3125,
"learning_rate": 3.508070755145767e-05,
"loss": 2.2155914306640625,
"num_input_tokens_seen": 276561920,
"step": 2110,
"train_runtime": 4092.2481,
"train_tokens_per_second": 67581.904
},
{
"epoch": 0.7650667629014796,
"grad_norm": 1.9375,
"learning_rate": 3.494820352691615e-05,
"loss": 2.2498100280761717,
"num_input_tokens_seen": 277872640,
"step": 2120,
"train_runtime": 4111.0288,
"train_tokens_per_second": 67591.995
},
{
"epoch": 0.7686755683868639,
"grad_norm": 2.53125,
"learning_rate": 3.481536662552655e-05,
"loss": 2.250745391845703,
"num_input_tokens_seen": 279183360,
"step": 2130,
"train_runtime": 4129.81,
"train_tokens_per_second": 67601.986
},
{
"epoch": 0.7722843738722482,
"grad_norm": 2.140625,
"learning_rate": 3.4682201292144565e-05,
"loss": 2.253221321105957,
"num_input_tokens_seen": 280494080,
"step": 2140,
"train_runtime": 4148.5896,
"train_tokens_per_second": 67611.913
},
{
"epoch": 0.7758931793576326,
"grad_norm": 2.234375,
"learning_rate": 3.454871198261556e-05,
"loss": 2.2065752029418944,
"num_input_tokens_seen": 281804800,
"step": 2150,
"train_runtime": 4167.3782,
"train_tokens_per_second": 67621.604
},
{
"epoch": 0.7795019848430169,
"grad_norm": 2.359375,
"learning_rate": 3.441490316362544e-05,
"loss": 2.259677696228027,
"num_input_tokens_seen": 283115520,
"step": 2160,
"train_runtime": 4186.1418,
"train_tokens_per_second": 67631.613
},
{
"epoch": 0.7831107903284013,
"grad_norm": 2.125,
"learning_rate": 3.428077931255123e-05,
"loss": 2.291699981689453,
"num_input_tokens_seen": 284426240,
"step": 2170,
"train_runtime": 4204.908,
"train_tokens_per_second": 67641.489
},
{
"epoch": 0.7867195958137856,
"grad_norm": 3.0625,
"learning_rate": 3.4146344917311246e-05,
"loss": 2.212661552429199,
"num_input_tokens_seen": 285736960,
"step": 2180,
"train_runtime": 4223.6825,
"train_tokens_per_second": 67651.146
},
{
"epoch": 0.7903284012991699,
"grad_norm": 2.4375,
"learning_rate": 3.401160447621492e-05,
"loss": 2.2563989639282225,
"num_input_tokens_seen": 287047680,
"step": 2190,
"train_runtime": 4242.4789,
"train_tokens_per_second": 67660.367
},
{
"epoch": 0.7939372067845543,
"grad_norm": 2.703125,
"learning_rate": 3.387656249781228e-05,
"loss": 2.292235565185547,
"num_input_tokens_seen": 288358400,
"step": 2200,
"train_runtime": 4261.2417,
"train_tokens_per_second": 67670.041
},
{
"epoch": 0.7975460122699386,
"grad_norm": 2.296875,
"learning_rate": 3.374122350074312e-05,
"loss": 2.186331367492676,
"num_input_tokens_seen": 289669120,
"step": 2210,
"train_runtime": 4283.2186,
"train_tokens_per_second": 67628.843
},
{
"epoch": 0.8011548177553229,
"grad_norm": 2.234375,
"learning_rate": 3.360559201358573e-05,
"loss": 2.268985557556152,
"num_input_tokens_seen": 290979840,
"step": 2220,
"train_runtime": 4301.9788,
"train_tokens_per_second": 67638.604
},
{
"epoch": 0.8047636232407073,
"grad_norm": 2.546875,
"learning_rate": 3.3469672574705444e-05,
"loss": 2.2512365341186524,
"num_input_tokens_seen": 292290560,
"step": 2230,
"train_runtime": 4320.7387,
"train_tokens_per_second": 67648.284
},
{
"epoch": 0.8083724287260917,
"grad_norm": 2.203125,
"learning_rate": 3.333346973210276e-05,
"loss": 2.2132787704467773,
"num_input_tokens_seen": 293601280,
"step": 2240,
"train_runtime": 4339.4961,
"train_tokens_per_second": 67657.919
},
{
"epoch": 0.811981234211476,
"grad_norm": 2.578125,
"learning_rate": 3.31969880432611e-05,
"loss": 2.219511032104492,
"num_input_tokens_seen": 294912000,
"step": 2250,
"train_runtime": 4358.2565,
"train_tokens_per_second": 67667.426
},
{
"epoch": 0.8155900396968604,
"grad_norm": 2.140625,
"learning_rate": 3.306023207499439e-05,
"loss": 2.2744468688964843,
"num_input_tokens_seen": 296222720,
"step": 2260,
"train_runtime": 4377.0289,
"train_tokens_per_second": 67676.665
},
{
"epoch": 0.8191988451822447,
"grad_norm": 2.3125,
"learning_rate": 3.292320640329426e-05,
"loss": 2.2337514877319338,
"num_input_tokens_seen": 297533440,
"step": 2270,
"train_runtime": 4395.8065,
"train_tokens_per_second": 67685.746
},
{
"epoch": 0.8228076506676291,
"grad_norm": 2.3125,
"learning_rate": 3.27859156131768e-05,
"loss": 2.217744064331055,
"num_input_tokens_seen": 298844160,
"step": 2280,
"train_runtime": 4414.5824,
"train_tokens_per_second": 67694.775
},
{
"epoch": 0.8264164561530134,
"grad_norm": 2.4375,
"learning_rate": 3.2648364298529294e-05,
"loss": 2.2992366790771483,
"num_input_tokens_seen": 300154880,
"step": 2290,
"train_runtime": 4433.3466,
"train_tokens_per_second": 67703.906
},
{
"epoch": 0.8300252616383977,
"grad_norm": 2.28125,
"learning_rate": 3.2510557061956424e-05,
"loss": 2.265240287780762,
"num_input_tokens_seen": 301465600,
"step": 2300,
"train_runtime": 4452.1281,
"train_tokens_per_second": 67712.697
},
{
"epoch": 0.8336340671237821,
"grad_norm": 2.390625,
"learning_rate": 3.2372498514626255e-05,
"loss": 2.257766532897949,
"num_input_tokens_seen": 302776320,
"step": 2310,
"train_runtime": 4474.0527,
"train_tokens_per_second": 67673.838
},
{
"epoch": 0.8372428726091664,
"grad_norm": 2.125,
"learning_rate": 3.223419327611599e-05,
"loss": 2.2734552383422852,
"num_input_tokens_seen": 304087040,
"step": 2320,
"train_runtime": 4492.8568,
"train_tokens_per_second": 67682.335
},
{
"epoch": 0.8408516780945507,
"grad_norm": 2.015625,
"learning_rate": 3.209564597425734e-05,
"loss": 2.240528106689453,
"num_input_tokens_seen": 305397760,
"step": 2330,
"train_runtime": 4511.6404,
"train_tokens_per_second": 67691.069
},
{
"epoch": 0.8444604835799351,
"grad_norm": 2.25,
"learning_rate": 3.1956861244981714e-05,
"loss": 2.2675090789794923,
"num_input_tokens_seen": 306708480,
"step": 2340,
"train_runtime": 4530.4269,
"train_tokens_per_second": 67699.686
},
{
"epoch": 0.8480692890653194,
"grad_norm": 2.421875,
"learning_rate": 3.181784373216507e-05,
"loss": 2.2498952865600588,
"num_input_tokens_seen": 308019200,
"step": 2350,
"train_runtime": 4549.215,
"train_tokens_per_second": 67708.208
},
{
"epoch": 0.8516780945507038,
"grad_norm": 2.078125,
"learning_rate": 3.1678598087472564e-05,
"loss": 2.2409832000732424,
"num_input_tokens_seen": 309329920,
"step": 2360,
"train_runtime": 4567.9867,
"train_tokens_per_second": 67716.904
},
{
"epoch": 0.8552869000360881,
"grad_norm": 1.8671875,
"learning_rate": 3.153912897020283e-05,
"loss": 2.2946495056152343,
"num_input_tokens_seen": 310640640,
"step": 2370,
"train_runtime": 4586.7663,
"train_tokens_per_second": 67725.413
},
{
"epoch": 0.8588957055214724,
"grad_norm": 2.3125,
"learning_rate": 3.139944104713214e-05,
"loss": 2.2439815521240236,
"num_input_tokens_seen": 311951360,
"step": 2380,
"train_runtime": 4605.5614,
"train_tokens_per_second": 67733.623
},
{
"epoch": 0.8625045110068568,
"grad_norm": 2.234375,
"learning_rate": 3.1259538992358226e-05,
"loss": 2.274890327453613,
"num_input_tokens_seen": 313262080,
"step": 2390,
"train_runtime": 4624.3548,
"train_tokens_per_second": 67741.791
},
{
"epoch": 0.8661133164922411,
"grad_norm": 2.125,
"learning_rate": 3.11194274871439e-05,
"loss": 2.311928367614746,
"num_input_tokens_seen": 314572800,
"step": 2400,
"train_runtime": 4643.1261,
"train_tokens_per_second": 67750.217
},
{
"epoch": 0.8697221219776254,
"grad_norm": 2.109375,
"learning_rate": 3.097911121976035e-05,
"loss": 2.2456386566162108,
"num_input_tokens_seen": 315883520,
"step": 2410,
"train_runtime": 4665.7859,
"train_tokens_per_second": 67702.103
},
{
"epoch": 0.8733309274630098,
"grad_norm": 1.953125,
"learning_rate": 3.083859488533036e-05,
"loss": 2.2625568389892576,
"num_input_tokens_seen": 317194240,
"step": 2420,
"train_runtime": 4684.5371,
"train_tokens_per_second": 67710.904
},
{
"epoch": 0.8769397329483941,
"grad_norm": 2.015625,
"learning_rate": 3.069788318567113e-05,
"loss": 2.242539978027344,
"num_input_tokens_seen": 318504960,
"step": 2430,
"train_runtime": 4703.3144,
"train_tokens_per_second": 67719.257
},
{
"epoch": 0.8805485384337784,
"grad_norm": 1.9140625,
"learning_rate": 3.055698082913697e-05,
"loss": 2.241316795349121,
"num_input_tokens_seen": 319815680,
"step": 2440,
"train_runtime": 4722.0855,
"train_tokens_per_second": 67727.634
},
{
"epoch": 0.8841573439191628,
"grad_norm": 2.125,
"learning_rate": 3.0415892530461776e-05,
"loss": 2.2707977294921875,
"num_input_tokens_seen": 321126400,
"step": 2450,
"train_runtime": 4740.8653,
"train_tokens_per_second": 67735.82
},
{
"epoch": 0.8877661494045471,
"grad_norm": 2.25,
"learning_rate": 3.0274623010601267e-05,
"loss": 2.2340885162353517,
"num_input_tokens_seen": 322437120,
"step": 2460,
"train_runtime": 4759.626,
"train_tokens_per_second": 67744.213
},
{
"epoch": 0.8913749548899315,
"grad_norm": 2.109375,
"learning_rate": 3.0133176996574963e-05,
"loss": 2.1937400817871096,
"num_input_tokens_seen": 323747840,
"step": 2470,
"train_runtime": 4779.0775,
"train_tokens_per_second": 67742.747
},
{
"epoch": 0.8949837603753158,
"grad_norm": 1.9921875,
"learning_rate": 2.999155922130809e-05,
"loss": 2.2225208282470703,
"num_input_tokens_seen": 325058560,
"step": 2480,
"train_runtime": 4797.8483,
"train_tokens_per_second": 67750.904
},
{
"epoch": 0.8985925658607001,
"grad_norm": 1.9140625,
"learning_rate": 2.9849774423473176e-05,
"loss": 2.2455957412719725,
"num_input_tokens_seen": 326369280,
"step": 2490,
"train_runtime": 4816.6232,
"train_tokens_per_second": 67758.939
},
{
"epoch": 0.9022013713460845,
"grad_norm": 2.046875,
"learning_rate": 2.970782734733146e-05,
"loss": 2.258774757385254,
"num_input_tokens_seen": 327680000,
"step": 2500,
"train_runtime": 4835.399,
"train_tokens_per_second": 67766.899
},
{
"epoch": 0.9058101768314688,
"grad_norm": 2.1875,
"learning_rate": 2.956572274257422e-05,
"loss": 2.2699337005615234,
"num_input_tokens_seen": 328990720,
"step": 2510,
"train_runtime": 4858.431,
"train_tokens_per_second": 67715.425
},
{
"epoch": 0.9094189823168531,
"grad_norm": 2.5,
"learning_rate": 2.9423465364163772e-05,
"loss": 2.2766401290893556,
"num_input_tokens_seen": 330301440,
"step": 2520,
"train_runtime": 4877.191,
"train_tokens_per_second": 67723.703
},
{
"epoch": 0.9130277878022375,
"grad_norm": 2.03125,
"learning_rate": 2.928105997217438e-05,
"loss": 2.2700592041015626,
"num_input_tokens_seen": 331612160,
"step": 2530,
"train_runtime": 4895.9497,
"train_tokens_per_second": 67731.937
},
{
"epoch": 0.9166365932876218,
"grad_norm": 2.359375,
"learning_rate": 2.913851133163302e-05,
"loss": 2.2220373153686523,
"num_input_tokens_seen": 332922880,
"step": 2540,
"train_runtime": 4914.7219,
"train_tokens_per_second": 67739.923
},
{
"epoch": 0.9202453987730062,
"grad_norm": 1.96875,
"learning_rate": 2.8995824212359895e-05,
"loss": 2.2467634201049806,
"num_input_tokens_seen": 334233600,
"step": 2550,
"train_runtime": 4933.5018,
"train_tokens_per_second": 67747.741
},
{
"epoch": 0.9238542042583905,
"grad_norm": 2.203125,
"learning_rate": 2.8853003388808836e-05,
"loss": 2.245954704284668,
"num_input_tokens_seen": 335544320,
"step": 2560,
"train_runtime": 4952.2584,
"train_tokens_per_second": 67755.818
},
{
"epoch": 0.9274630097437748,
"grad_norm": 1.96875,
"learning_rate": 2.871005363990757e-05,
"loss": 2.262437438964844,
"num_input_tokens_seen": 336855040,
"step": 2570,
"train_runtime": 4971.0339,
"train_tokens_per_second": 67763.577
},
{
"epoch": 0.9310718152291592,
"grad_norm": 2.328125,
"learning_rate": 2.8566979748897782e-05,
"loss": 2.306426429748535,
"num_input_tokens_seen": 338165760,
"step": 2580,
"train_runtime": 4989.8069,
"train_tokens_per_second": 67771.312
},
{
"epoch": 0.9346806207145435,
"grad_norm": 2.21875,
"learning_rate": 2.8423786503175083e-05,
"loss": 2.2506465911865234,
"num_input_tokens_seen": 339476480,
"step": 2590,
"train_runtime": 5008.578,
"train_tokens_per_second": 67779.015
},
{
"epoch": 0.9382894261999278,
"grad_norm": 2.640625,
"learning_rate": 2.8280478694128804e-05,
"loss": 2.249863052368164,
"num_input_tokens_seen": 340787200,
"step": 2600,
"train_runtime": 5027.3701,
"train_tokens_per_second": 67786.376
},
{
"epoch": 0.9418982316853122,
"grad_norm": 2.1875,
"learning_rate": 2.8137061116981693e-05,
"loss": 2.2413703918457033,
"num_input_tokens_seen": 342097920,
"step": 2610,
"train_runtime": 5049.0415,
"train_tokens_per_second": 67755.022
},
{
"epoch": 0.9455070371706965,
"grad_norm": 2.4375,
"learning_rate": 2.799353857062944e-05,
"loss": 2.236385154724121,
"num_input_tokens_seen": 343408640,
"step": 2620,
"train_runtime": 5067.8245,
"train_tokens_per_second": 67762.535
},
{
"epoch": 0.9491158426560808,
"grad_norm": 2.203125,
"learning_rate": 2.7849915857480103e-05,
"loss": 2.2933725357055663,
"num_input_tokens_seen": 344719360,
"step": 2630,
"train_runtime": 5086.5939,
"train_tokens_per_second": 67770.175
},
{
"epoch": 0.9527246481414652,
"grad_norm": 2.078125,
"learning_rate": 2.770619778329344e-05,
"loss": 2.244718551635742,
"num_input_tokens_seen": 346030080,
"step": 2640,
"train_runtime": 5105.4095,
"train_tokens_per_second": 67777.145
},
{
"epoch": 0.9563334536268495,
"grad_norm": 2.28125,
"learning_rate": 2.756238915702007e-05,
"loss": 2.2527402877807616,
"num_input_tokens_seen": 347340800,
"step": 2650,
"train_runtime": 5124.1871,
"train_tokens_per_second": 67784.566
},
{
"epoch": 0.9599422591122339,
"grad_norm": 1.859375,
"learning_rate": 2.7418494790640576e-05,
"loss": 2.250338554382324,
"num_input_tokens_seen": 348651520,
"step": 2660,
"train_runtime": 5142.973,
"train_tokens_per_second": 67791.824
},
{
"epoch": 0.9635510645976182,
"grad_norm": 2.078125,
"learning_rate": 2.7274519499004497e-05,
"loss": 2.231460380554199,
"num_input_tokens_seen": 349962240,
"step": 2670,
"train_runtime": 5161.7907,
"train_tokens_per_second": 67798.611
},
{
"epoch": 0.9671598700830025,
"grad_norm": 2.5625,
"learning_rate": 2.7130468099669204e-05,
"loss": 2.257509231567383,
"num_input_tokens_seen": 351272960,
"step": 2680,
"train_runtime": 5180.5654,
"train_tokens_per_second": 67805.912
},
{
"epoch": 0.9707686755683869,
"grad_norm": 1.75,
"learning_rate": 2.6986345412738717e-05,
"loss": 2.2456037521362306,
"num_input_tokens_seen": 352583680,
"step": 2690,
"train_runtime": 5199.3394,
"train_tokens_per_second": 67813.168
},
{
"epoch": 0.9743774810537712,
"grad_norm": 2.03125,
"learning_rate": 2.684215626070241e-05,
"loss": 2.220039176940918,
"num_input_tokens_seen": 353894400,
"step": 2700,
"train_runtime": 5218.1178,
"train_tokens_per_second": 67820.317
},
{
"epoch": 0.9779862865391555,
"grad_norm": 2.171875,
"learning_rate": 2.6697905468273638e-05,
"loss": 2.2261730194091798,
"num_input_tokens_seen": 355205120,
"step": 2710,
"train_runtime": 5240.1257,
"train_tokens_per_second": 67785.61
},
{
"epoch": 0.9815950920245399,
"grad_norm": 2.15625,
"learning_rate": 2.6553597862228306e-05,
"loss": 2.2150230407714844,
"num_input_tokens_seen": 356515840,
"step": 2720,
"train_runtime": 5258.914,
"train_tokens_per_second": 67792.673
},
{
"epoch": 0.9852038975099242,
"grad_norm": 2.125,
"learning_rate": 2.6409238271243374e-05,
"loss": 2.26368408203125,
"num_input_tokens_seen": 357826560,
"step": 2730,
"train_runtime": 5277.6776,
"train_tokens_per_second": 67800.003
},
{
"epoch": 0.9888127029953085,
"grad_norm": 1.984375,
"learning_rate": 2.6264831525735245e-05,
"loss": 2.280439758300781,
"num_input_tokens_seen": 359137280,
"step": 2740,
"train_runtime": 5296.4537,
"train_tokens_per_second": 67807.121
},
{
"epoch": 0.9924215084806929,
"grad_norm": 2.0625,
"learning_rate": 2.612038245769818e-05,
"loss": 2.2530561447143556,
"num_input_tokens_seen": 360448000,
"step": 2750,
"train_runtime": 5315.2093,
"train_tokens_per_second": 67814.45
},
{
"epoch": 0.9960303139660772,
"grad_norm": 2.484375,
"learning_rate": 2.5975895900542596e-05,
"loss": 2.2372438430786135,
"num_input_tokens_seen": 361758720,
"step": 2760,
"train_runtime": 5333.9785,
"train_tokens_per_second": 67821.556
},
{
"epoch": 0.9996391194514616,
"grad_norm": 2.296875,
"learning_rate": 2.5831376688933305e-05,
"loss": 2.229551315307617,
"num_input_tokens_seen": 363069440,
"step": 2770,
"train_runtime": 5352.7536,
"train_tokens_per_second": 67828.535
},
{
"epoch": 1.003247924936846,
"grad_norm": 2.078125,
"learning_rate": 2.5686829658627814e-05,
"loss": 2.193307113647461,
"num_input_tokens_seen": 364331008,
"step": 2780,
"train_runtime": 5371.326,
"train_tokens_per_second": 67828.877
},
{
"epoch": 1.0068567304222302,
"grad_norm": 1.9765625,
"learning_rate": 2.5542259646314425e-05,
"loss": 2.221421241760254,
"num_input_tokens_seen": 365641728,
"step": 2790,
"train_runtime": 5390.0707,
"train_tokens_per_second": 67836.166
},
{
"epoch": 1.0104655359076147,
"grad_norm": 1.75,
"learning_rate": 2.539767148945048e-05,
"loss": 2.2600011825561523,
"num_input_tokens_seen": 366952448,
"step": 2800,
"train_runtime": 5408.8177,
"train_tokens_per_second": 67843.375
},
{
"epoch": 1.014074341392999,
"grad_norm": 2.328125,
"learning_rate": 2.5253070026100428e-05,
"loss": 2.1858745574951173,
"num_input_tokens_seen": 368263168,
"step": 2810,
"train_runtime": 5430.762,
"train_tokens_per_second": 67810.588
},
{
"epoch": 1.0176831468783833,
"grad_norm": 2.234375,
"learning_rate": 2.5108460094773984e-05,
"loss": 2.232530975341797,
"num_input_tokens_seen": 369573888,
"step": 2820,
"train_runtime": 5449.5183,
"train_tokens_per_second": 67817.717
},
{
"epoch": 1.0212919523637676,
"grad_norm": 2.359375,
"learning_rate": 2.4963846534264197e-05,
"loss": 2.2220739364624023,
"num_input_tokens_seen": 370884608,
"step": 2830,
"train_runtime": 5468.2804,
"train_tokens_per_second": 67824.724
},
{
"epoch": 1.024900757849152,
"grad_norm": 2.0625,
"learning_rate": 2.4819234183485572e-05,
"loss": 2.225343132019043,
"num_input_tokens_seen": 372195328,
"step": 2840,
"train_runtime": 5487.0445,
"train_tokens_per_second": 67831.658
},
{
"epoch": 1.0285095633345362,
"grad_norm": 1.9375,
"learning_rate": 2.4674627881312103e-05,
"loss": 2.255137252807617,
"num_input_tokens_seen": 373506048,
"step": 2850,
"train_runtime": 5505.7991,
"train_tokens_per_second": 67838.663
},
{
"epoch": 1.0321183688199207,
"grad_norm": 2.09375,
"learning_rate": 2.4530032466415428e-05,
"loss": 2.248682975769043,
"num_input_tokens_seen": 374816768,
"step": 2860,
"train_runtime": 5524.5617,
"train_tokens_per_second": 67845.521
},
{
"epoch": 1.035727174305305,
"grad_norm": 2.34375,
"learning_rate": 2.438545277710285e-05,
"loss": 2.166554832458496,
"num_input_tokens_seen": 376127488,
"step": 2870,
"train_runtime": 5543.3218,
"train_tokens_per_second": 67852.364
},
{
"epoch": 1.0393359797906894,
"grad_norm": 1.9140625,
"learning_rate": 2.4240893651155515e-05,
"loss": 2.2574790954589843,
"num_input_tokens_seen": 377438208,
"step": 2880,
"train_runtime": 5562.0818,
"train_tokens_per_second": 67859.162
},
{
"epoch": 1.0429447852760736,
"grad_norm": 2.015625,
"learning_rate": 2.4096359925666478e-05,
"loss": 2.206853675842285,
"num_input_tokens_seen": 378748928,
"step": 2890,
"train_runtime": 5580.8539,
"train_tokens_per_second": 67865.767
},
{
"epoch": 1.046553590761458,
"grad_norm": 2.5,
"learning_rate": 2.395185643687885e-05,
"loss": 2.2421005249023436,
"num_input_tokens_seen": 380059648,
"step": 2900,
"train_runtime": 5599.6107,
"train_tokens_per_second": 67872.512
},
{
"epoch": 1.0501623962468423,
"grad_norm": 1.875,
"learning_rate": 2.380738802002403e-05,
"loss": 2.2542638778686523,
"num_input_tokens_seen": 381370368,
"step": 2910,
"train_runtime": 5622.0304,
"train_tokens_per_second": 67834.988
},
{
"epoch": 1.0537712017322267,
"grad_norm": 2.59375,
"learning_rate": 2.366295950915985e-05,
"loss": 2.248210144042969,
"num_input_tokens_seen": 382681088,
"step": 2920,
"train_runtime": 5640.7541,
"train_tokens_per_second": 67842.186
},
{
"epoch": 1.057380007217611,
"grad_norm": 2.46875,
"learning_rate": 2.3518575737008867e-05,
"loss": 2.2071243286132813,
"num_input_tokens_seen": 383991808,
"step": 2930,
"train_runtime": 5659.5048,
"train_tokens_per_second": 67849.012
},
{
"epoch": 1.0609888127029954,
"grad_norm": 2.265625,
"learning_rate": 2.3374241534796602e-05,
"loss": 2.2425615310668947,
"num_input_tokens_seen": 385302528,
"step": 2940,
"train_runtime": 5678.2419,
"train_tokens_per_second": 67855.956
},
{
"epoch": 1.0645976181883796,
"grad_norm": 2.140625,
"learning_rate": 2.3229961732089973e-05,
"loss": 2.219411277770996,
"num_input_tokens_seen": 386613248,
"step": 2950,
"train_runtime": 5696.9934,
"train_tokens_per_second": 67862.681
},
{
"epoch": 1.068206423673764,
"grad_norm": 2.140625,
"learning_rate": 2.308574115663556e-05,
"loss": 2.201869583129883,
"num_input_tokens_seen": 387923968,
"step": 2960,
"train_runtime": 5715.7762,
"train_tokens_per_second": 67868.992
},
{
"epoch": 1.0718152291591483,
"grad_norm": 2.0625,
"learning_rate": 2.2941584634198217e-05,
"loss": 2.235122871398926,
"num_input_tokens_seen": 389234688,
"step": 2970,
"train_runtime": 5734.5443,
"train_tokens_per_second": 67875.435
},
{
"epoch": 1.0754240346445327,
"grad_norm": 3.015625,
"learning_rate": 2.279749698839946e-05,
"loss": 2.2270109176635744,
"num_input_tokens_seen": 390545408,
"step": 2980,
"train_runtime": 5753.3138,
"train_tokens_per_second": 67881.819
},
{
"epoch": 1.079032840129917,
"grad_norm": 2.078125,
"learning_rate": 2.2653483040556157e-05,
"loss": 2.229469871520996,
"num_input_tokens_seen": 391856128,
"step": 2990,
"train_runtime": 5772.0918,
"train_tokens_per_second": 67888.062
},
{
"epoch": 1.0826416456153014,
"grad_norm": 1.7890625,
"learning_rate": 2.250954760951916e-05,
"loss": 2.199754333496094,
"num_input_tokens_seen": 393166848,
"step": 3000,
"train_runtime": 5790.8659,
"train_tokens_per_second": 67894.311
},
{
"epoch": 1.0862504511006856,
"grad_norm": 2.140625,
"learning_rate": 2.2365695511512075e-05,
"loss": 2.1993585586547852,
"num_input_tokens_seen": 394477568,
"step": 3010,
"train_runtime": 5814.6634,
"train_tokens_per_second": 67841.858
},
{
"epoch": 1.08985925658607,
"grad_norm": 2.328125,
"learning_rate": 2.2221931559970076e-05,
"loss": 2.249158477783203,
"num_input_tokens_seen": 395788288,
"step": 3020,
"train_runtime": 5833.4374,
"train_tokens_per_second": 67848.21
},
{
"epoch": 1.0934680620714543,
"grad_norm": 1.75,
"learning_rate": 2.2078260565378913e-05,
"loss": 2.2337362289428713,
"num_input_tokens_seen": 397099008,
"step": 3030,
"train_runtime": 5852.2209,
"train_tokens_per_second": 67854.412
},
{
"epoch": 1.0970768675568388,
"grad_norm": 2.234375,
"learning_rate": 2.193468733511386e-05,
"loss": 2.2763225555419924,
"num_input_tokens_seen": 398409728,
"step": 3040,
"train_runtime": 5870.9916,
"train_tokens_per_second": 67860.722
},
{
"epoch": 1.100685673042223,
"grad_norm": 1.890625,
"learning_rate": 2.179121667327893e-05,
"loss": 2.2377885818481444,
"num_input_tokens_seen": 399720448,
"step": 3050,
"train_runtime": 5889.7662,
"train_tokens_per_second": 67866.947
},
{
"epoch": 1.1042944785276074,
"grad_norm": 2.1875,
"learning_rate": 2.164785338054607e-05,
"loss": 2.224856948852539,
"num_input_tokens_seen": 401031168,
"step": 3060,
"train_runtime": 5908.5456,
"train_tokens_per_second": 67873.076
},
{
"epoch": 1.1079032840129917,
"grad_norm": 2.109375,
"learning_rate": 2.1504602253994572e-05,
"loss": 2.2104814529418944,
"num_input_tokens_seen": 402341888,
"step": 3070,
"train_runtime": 5927.3145,
"train_tokens_per_second": 67879.288
},
{
"epoch": 1.111512089498376,
"grad_norm": 2.03125,
"learning_rate": 2.1361468086950505e-05,
"loss": 2.22839298248291,
"num_input_tokens_seen": 403652608,
"step": 3080,
"train_runtime": 5946.1084,
"train_tokens_per_second": 67885.174
},
{
"epoch": 1.1151208949837603,
"grad_norm": 1.765625,
"learning_rate": 2.1218455668826394e-05,
"loss": 2.199458122253418,
"num_input_tokens_seen": 404963328,
"step": 3090,
"train_runtime": 5964.9101,
"train_tokens_per_second": 67890.936
},
{
"epoch": 1.1187297004691448,
"grad_norm": 2.265625,
"learning_rate": 2.10755697849609e-05,
"loss": 2.200012969970703,
"num_input_tokens_seen": 406274048,
"step": 3100,
"train_runtime": 5983.7215,
"train_tokens_per_second": 67896.551
},
{
"epoch": 1.122338505954529,
"grad_norm": 2.28125,
"learning_rate": 2.0932815216458712e-05,
"loss": 2.2353172302246094,
"num_input_tokens_seen": 407584768,
"step": 3110,
"train_runtime": 6006.3211,
"train_tokens_per_second": 67859.304
},
{
"epoch": 1.1259473114399134,
"grad_norm": 1.796875,
"learning_rate": 2.07901967400306e-05,
"loss": 2.2090152740478515,
"num_input_tokens_seen": 408895488,
"step": 3120,
"train_runtime": 6025.1377,
"train_tokens_per_second": 67864.919
},
{
"epoch": 1.1295561169252977,
"grad_norm": 2.03125,
"learning_rate": 2.0647719127833536e-05,
"loss": 2.1954586029052736,
"num_input_tokens_seen": 410206208,
"step": 3130,
"train_runtime": 6043.9279,
"train_tokens_per_second": 67870.798
},
{
"epoch": 1.1331649224106821,
"grad_norm": 2.15625,
"learning_rate": 2.0505387147311057e-05,
"loss": 2.226312828063965,
"num_input_tokens_seen": 411516928,
"step": 3140,
"train_runtime": 6062.7198,
"train_tokens_per_second": 67876.62
},
{
"epoch": 1.1367737278960663,
"grad_norm": 2.453125,
"learning_rate": 2.036320556103368e-05,
"loss": 2.17757568359375,
"num_input_tokens_seen": 412827648,
"step": 3150,
"train_runtime": 6081.5285,
"train_tokens_per_second": 67882.218
},
{
"epoch": 1.1403825333814508,
"grad_norm": 1.890625,
"learning_rate": 2.0221179126539636e-05,
"loss": 2.235516357421875,
"num_input_tokens_seen": 414138368,
"step": 3160,
"train_runtime": 6100.3197,
"train_tokens_per_second": 67887.978
},
{
"epoch": 1.143991338866835,
"grad_norm": 2.125,
"learning_rate": 2.0079312596175563e-05,
"loss": 2.219258499145508,
"num_input_tokens_seen": 415449088,
"step": 3170,
"train_runtime": 6119.0789,
"train_tokens_per_second": 67894.056
},
{
"epoch": 1.1476001443522195,
"grad_norm": 2.109375,
"learning_rate": 1.9937610716937595e-05,
"loss": 2.2164329528808593,
"num_input_tokens_seen": 416759808,
"step": 3180,
"train_runtime": 6137.8386,
"train_tokens_per_second": 67900.092
},
{
"epoch": 1.1512089498376037,
"grad_norm": 2.515625,
"learning_rate": 1.9796078230312438e-05,
"loss": 2.214109420776367,
"num_input_tokens_seen": 418070528,
"step": 3190,
"train_runtime": 6156.6084,
"train_tokens_per_second": 67905.98
},
{
"epoch": 1.1548177553229881,
"grad_norm": 2.03125,
"learning_rate": 1.9654719872118775e-05,
"loss": 2.223517417907715,
"num_input_tokens_seen": 419381248,
"step": 3200,
"train_runtime": 6175.3896,
"train_tokens_per_second": 67911.706
},
{
"epoch": 1.1584265608083724,
"grad_norm": 1.9375,
"learning_rate": 1.951354037234876e-05,
"loss": 2.2522729873657226,
"num_input_tokens_seen": 420691968,
"step": 3210,
"train_runtime": 6198.4055,
"train_tokens_per_second": 67870.998
},
{
"epoch": 1.1620353662937568,
"grad_norm": 2.140625,
"learning_rate": 1.937254445500979e-05,
"loss": 2.194486618041992,
"num_input_tokens_seen": 422002688,
"step": 3220,
"train_runtime": 6217.15,
"train_tokens_per_second": 67877.192
},
{
"epoch": 1.165644171779141,
"grad_norm": 2.15625,
"learning_rate": 1.9231736837966384e-05,
"loss": 2.242540740966797,
"num_input_tokens_seen": 423313408,
"step": 3230,
"train_runtime": 6235.9087,
"train_tokens_per_second": 67883.195
},
{
"epoch": 1.1692529772645255,
"grad_norm": 1.96875,
"learning_rate": 1.909112223278236e-05,
"loss": 2.2135072708129884,
"num_input_tokens_seen": 424624128,
"step": 3240,
"train_runtime": 6254.6817,
"train_tokens_per_second": 67889.006
},
{
"epoch": 1.1728617827499097,
"grad_norm": 2.21875,
"learning_rate": 1.895070534456316e-05,
"loss": 2.252424430847168,
"num_input_tokens_seen": 425934848,
"step": 3250,
"train_runtime": 6273.4441,
"train_tokens_per_second": 67894.898
},
{
"epoch": 1.1764705882352942,
"grad_norm": 2.078125,
"learning_rate": 1.881049087179842e-05,
"loss": 2.216765594482422,
"num_input_tokens_seen": 427245568,
"step": 3260,
"train_runtime": 6292.2219,
"train_tokens_per_second": 67900.588
},
{
"epoch": 1.1800793937206784,
"grad_norm": 1.921875,
"learning_rate": 1.8670483506204745e-05,
"loss": 2.2357194900512694,
"num_input_tokens_seen": 428556288,
"step": 3270,
"train_runtime": 6310.9899,
"train_tokens_per_second": 67906.35
},
{
"epoch": 1.1836881992060628,
"grad_norm": 1.71875,
"learning_rate": 1.8530687932568753e-05,
"loss": 2.248133087158203,
"num_input_tokens_seen": 429867008,
"step": 3280,
"train_runtime": 6329.8002,
"train_tokens_per_second": 67911.624
},
{
"epoch": 1.187297004691447,
"grad_norm": 1.828125,
"learning_rate": 1.8391108828590244e-05,
"loss": 2.214917755126953,
"num_input_tokens_seen": 431177728,
"step": 3290,
"train_runtime": 6348.5929,
"train_tokens_per_second": 67917.054
},
{
"epoch": 1.1909058101768315,
"grad_norm": 1.8828125,
"learning_rate": 1.8251750864725782e-05,
"loss": 2.179270935058594,
"num_input_tokens_seen": 432488448,
"step": 3300,
"train_runtime": 6367.3551,
"train_tokens_per_second": 67922.778
},
{
"epoch": 1.1945146156622157,
"grad_norm": 1.9140625,
"learning_rate": 1.8112618704032325e-05,
"loss": 2.2112674713134766,
"num_input_tokens_seen": 433799168,
"step": 3310,
"train_runtime": 6389.3478,
"train_tokens_per_second": 67894.124
},
{
"epoch": 1.1981234211476002,
"grad_norm": 1.9140625,
"learning_rate": 1.7973717002011226e-05,
"loss": 2.2106258392333986,
"num_input_tokens_seen": 435109888,
"step": 3320,
"train_runtime": 6408.1106,
"train_tokens_per_second": 67899.871
},
{
"epoch": 1.2017322266329844,
"grad_norm": 1.8828125,
"learning_rate": 1.783505040645249e-05,
"loss": 2.197174072265625,
"num_input_tokens_seen": 436420608,
"step": 3330,
"train_runtime": 6426.8536,
"train_tokens_per_second": 67905.796
},
{
"epoch": 1.2053410321183688,
"grad_norm": 2.015625,
"learning_rate": 1.76966235572792e-05,
"loss": 2.216184616088867,
"num_input_tokens_seen": 437731328,
"step": 3340,
"train_runtime": 6445.594,
"train_tokens_per_second": 67911.713
},
{
"epoch": 1.208949837603753,
"grad_norm": 2.046875,
"learning_rate": 1.7558441086392305e-05,
"loss": 2.179450798034668,
"num_input_tokens_seen": 439042048,
"step": 3350,
"train_runtime": 6464.3436,
"train_tokens_per_second": 67917.499
},
{
"epoch": 1.2125586430891375,
"grad_norm": 1.78125,
"learning_rate": 1.742050761751558e-05,
"loss": 2.254531478881836,
"num_input_tokens_seen": 440352768,
"step": 3360,
"train_runtime": 6483.0846,
"train_tokens_per_second": 67923.342
},
{
"epoch": 1.2161674485745217,
"grad_norm": 2.265625,
"learning_rate": 1.7282827766040982e-05,
"loss": 2.186991882324219,
"num_input_tokens_seen": 441663488,
"step": 3370,
"train_runtime": 6501.8258,
"train_tokens_per_second": 67929.148
},
{
"epoch": 1.2197762540599062,
"grad_norm": 1.9140625,
"learning_rate": 1.714540613887415e-05,
"loss": 2.190296173095703,
"num_input_tokens_seen": 442974208,
"step": 3380,
"train_runtime": 6520.563,
"train_tokens_per_second": 67934.963
},
{
"epoch": 1.2233850595452904,
"grad_norm": 1.84375,
"learning_rate": 1.7008247334280292e-05,
"loss": 2.233493614196777,
"num_input_tokens_seen": 444284928,
"step": 3390,
"train_runtime": 6539.3093,
"train_tokens_per_second": 67940.651
},
{
"epoch": 1.2269938650306749,
"grad_norm": 2.03125,
"learning_rate": 1.6871355941730295e-05,
"loss": 2.224575996398926,
"num_input_tokens_seen": 445595648,
"step": 3400,
"train_runtime": 6558.0392,
"train_tokens_per_second": 67946.476
},
{
"epoch": 1.230602670516059,
"grad_norm": 2.0625,
"learning_rate": 1.6734736541747192e-05,
"loss": 2.2136987686157226,
"num_input_tokens_seen": 446906368,
"step": 3410,
"train_runtime": 6580.298,
"train_tokens_per_second": 67915.825
},
{
"epoch": 1.2342114760014435,
"grad_norm": 1.59375,
"learning_rate": 1.6598393705752843e-05,
"loss": 2.2252714157104494,
"num_input_tokens_seen": 448217088,
"step": 3420,
"train_runtime": 6599.0501,
"train_tokens_per_second": 67921.456
},
{
"epoch": 1.2378202814868278,
"grad_norm": 2.421875,
"learning_rate": 1.6462331995915042e-05,
"loss": 2.2220790863037108,
"num_input_tokens_seen": 449527808,
"step": 3430,
"train_runtime": 6617.8017,
"train_tokens_per_second": 67927.06
},
{
"epoch": 1.2414290869722122,
"grad_norm": 1.921875,
"learning_rate": 1.632655596499478e-05,
"loss": 2.19171142578125,
"num_input_tokens_seen": 450838528,
"step": 3440,
"train_runtime": 6636.5497,
"train_tokens_per_second": 67932.668
},
{
"epoch": 1.2450378924575964,
"grad_norm": 1.671875,
"learning_rate": 1.6191070156193973e-05,
"loss": 2.2106775283813476,
"num_input_tokens_seen": 452149248,
"step": 3450,
"train_runtime": 6655.3073,
"train_tokens_per_second": 67938.148
},
{
"epoch": 1.2486466979429809,
"grad_norm": 1.75,
"learning_rate": 1.6055879103003393e-05,
"loss": 2.2294937133789063,
"num_input_tokens_seen": 453459968,
"step": 3460,
"train_runtime": 6674.058,
"train_tokens_per_second": 67943.666
},
{
"epoch": 1.2522555034283651,
"grad_norm": 2.171875,
"learning_rate": 1.5920987329051016e-05,
"loss": 2.257633018493652,
"num_input_tokens_seen": 454770688,
"step": 3470,
"train_runtime": 6692.8111,
"train_tokens_per_second": 67949.13
},
{
"epoch": 1.2558643089137496,
"grad_norm": 1.9140625,
"learning_rate": 1.5786399347950607e-05,
"loss": 2.2481691360473635,
"num_input_tokens_seen": 456081408,
"step": 3480,
"train_runtime": 6711.5556,
"train_tokens_per_second": 67954.649
},
{
"epoch": 1.259473114399134,
"grad_norm": 1.5625,
"learning_rate": 1.5652119663150755e-05,
"loss": 2.25321102142334,
"num_input_tokens_seen": 457392128,
"step": 3490,
"train_runtime": 6730.3387,
"train_tokens_per_second": 67959.749
},
{
"epoch": 1.2630819198845182,
"grad_norm": 1.96875,
"learning_rate": 1.551815276778411e-05,
"loss": 2.201145553588867,
"num_input_tokens_seen": 458702848,
"step": 3500,
"train_runtime": 6749.0904,
"train_tokens_per_second": 67965.137
},
{
"epoch": 1.2666907253699025,
"grad_norm": 1.9296875,
"learning_rate": 1.5384503144517105e-05,
"loss": 2.2279090881347656,
"num_input_tokens_seen": 460013568,
"step": 3510,
"train_runtime": 6772.1939,
"train_tokens_per_second": 67926.816
},
{
"epoch": 1.270299530855287,
"grad_norm": 1.8984375,
"learning_rate": 1.5251175265399909e-05,
"loss": 2.2312782287597654,
"num_input_tokens_seen": 461324288,
"step": 3520,
"train_runtime": 6791.1594,
"train_tokens_per_second": 67930.122
},
{
"epoch": 1.2739083363406714,
"grad_norm": 2.140625,
"learning_rate": 1.5118173591716812e-05,
"loss": 2.2547531127929688,
"num_input_tokens_seen": 462635008,
"step": 3530,
"train_runtime": 6809.949,
"train_tokens_per_second": 67935.165
},
{
"epoch": 1.2775171418260556,
"grad_norm": 1.734375,
"learning_rate": 1.4985502573836957e-05,
"loss": 2.2237892150878906,
"num_input_tokens_seen": 463945728,
"step": 3540,
"train_runtime": 6828.7257,
"train_tokens_per_second": 67940.308
},
{
"epoch": 1.2811259473114398,
"grad_norm": 1.8671875,
"learning_rate": 1.4853166651065396e-05,
"loss": 2.2387939453125,
"num_input_tokens_seen": 465256448,
"step": 3550,
"train_runtime": 6847.4866,
"train_tokens_per_second": 67945.58
},
{
"epoch": 1.2847347527968243,
"grad_norm": 1.671875,
"learning_rate": 1.4721170251494587e-05,
"loss": 2.2387521743774412,
"num_input_tokens_seen": 466567168,
"step": 3560,
"train_runtime": 6866.2656,
"train_tokens_per_second": 67950.644
},
{
"epoch": 1.2883435582822087,
"grad_norm": 2.375,
"learning_rate": 1.4589517791856167e-05,
"loss": 2.2455513000488283,
"num_input_tokens_seen": 467877888,
"step": 3570,
"train_runtime": 6885.0262,
"train_tokens_per_second": 67955.862
},
{
"epoch": 1.291952363767593,
"grad_norm": 1.9453125,
"learning_rate": 1.4458213677373245e-05,
"loss": 2.2595149993896486,
"num_input_tokens_seen": 469188608,
"step": 3580,
"train_runtime": 6903.7905,
"train_tokens_per_second": 67961.014
},
{
"epoch": 1.2955611692529772,
"grad_norm": 2.015625,
"learning_rate": 1.4327262301612886e-05,
"loss": 2.225126838684082,
"num_input_tokens_seen": 470499328,
"step": 3590,
"train_runtime": 6922.5486,
"train_tokens_per_second": 67966.201
},
{
"epoch": 1.2991699747383616,
"grad_norm": 1.90625,
"learning_rate": 1.4196668046339251e-05,
"loss": 2.197856903076172,
"num_input_tokens_seen": 471810048,
"step": 3600,
"train_runtime": 6941.3026,
"train_tokens_per_second": 67971.399
},
{
"epoch": 1.302778780223746,
"grad_norm": 1.7109375,
"learning_rate": 1.4066435281366814e-05,
"loss": 2.2238494873046877,
"num_input_tokens_seen": 473120768,
"step": 3610,
"train_runtime": 6962.6928,
"train_tokens_per_second": 67950.832
},
{
"epoch": 1.3063875857091303,
"grad_norm": 1.71875,
"learning_rate": 1.3936568364414254e-05,
"loss": 2.215565299987793,
"num_input_tokens_seen": 474431488,
"step": 3620,
"train_runtime": 6981.4678,
"train_tokens_per_second": 67955.837
},
{
"epoch": 1.3099963911945145,
"grad_norm": 1.953125,
"learning_rate": 1.380707164095862e-05,
"loss": 2.229986572265625,
"num_input_tokens_seen": 475742208,
"step": 3630,
"train_runtime": 7000.2328,
"train_tokens_per_second": 67960.913
},
{
"epoch": 1.313605196679899,
"grad_norm": 1.8046875,
"learning_rate": 1.3677949444089907e-05,
"loss": 2.273609924316406,
"num_input_tokens_seen": 477052928,
"step": 3640,
"train_runtime": 7019.0256,
"train_tokens_per_second": 67965.691
},
{
"epoch": 1.3172140021652834,
"grad_norm": 1.609375,
"learning_rate": 1.3549206094366045e-05,
"loss": 2.212572479248047,
"num_input_tokens_seen": 478363648,
"step": 3650,
"train_runtime": 7037.7829,
"train_tokens_per_second": 67970.788
},
{
"epoch": 1.3208228076506676,
"grad_norm": 2.0,
"learning_rate": 1.3420845899668425e-05,
"loss": 2.2558984756469727,
"num_input_tokens_seen": 479674368,
"step": 3660,
"train_runtime": 7056.5456,
"train_tokens_per_second": 67975.805
},
{
"epoch": 1.3244316131360518,
"grad_norm": 1.796875,
"learning_rate": 1.3292873155057616e-05,
"loss": 2.2416217803955076,
"num_input_tokens_seen": 480985088,
"step": 3670,
"train_runtime": 7075.3311,
"train_tokens_per_second": 67980.577
},
{
"epoch": 1.3280404186214363,
"grad_norm": 1.578125,
"learning_rate": 1.3165292142629771e-05,
"loss": 2.219058799743652,
"num_input_tokens_seen": 482295808,
"step": 3680,
"train_runtime": 7094.1126,
"train_tokens_per_second": 67985.361
},
{
"epoch": 1.3316492241068207,
"grad_norm": 1.6640625,
"learning_rate": 1.3038107131373267e-05,
"loss": 2.240825080871582,
"num_input_tokens_seen": 483606528,
"step": 3690,
"train_runtime": 7112.88,
"train_tokens_per_second": 67990.256
},
{
"epoch": 1.335258029592205,
"grad_norm": 1.7890625,
"learning_rate": 1.2911322377025903e-05,
"loss": 2.1871011734008787,
"num_input_tokens_seen": 484917248,
"step": 3700,
"train_runtime": 7131.662,
"train_tokens_per_second": 67994.985
},
{
"epoch": 1.3388668350775892,
"grad_norm": 2.078125,
"learning_rate": 1.2784942121932436e-05,
"loss": 2.187872886657715,
"num_input_tokens_seen": 486227968,
"step": 3710,
"train_runtime": 7152.9267,
"train_tokens_per_second": 67976.087
},
{
"epoch": 1.3424756405629736,
"grad_norm": 2.046875,
"learning_rate": 1.2658970594902753e-05,
"loss": 2.25146369934082,
"num_input_tokens_seen": 487538688,
"step": 3720,
"train_runtime": 7171.733,
"train_tokens_per_second": 67980.597
},
{
"epoch": 1.346084446048358,
"grad_norm": 1.921875,
"learning_rate": 1.2533412011070223e-05,
"loss": 2.2136253356933593,
"num_input_tokens_seen": 488849408,
"step": 3730,
"train_runtime": 7190.5443,
"train_tokens_per_second": 67985.036
},
{
"epoch": 1.3496932515337423,
"grad_norm": 2.1875,
"learning_rate": 1.2408270571750725e-05,
"loss": 2.2115272521972655,
"num_input_tokens_seen": 490160128,
"step": 3740,
"train_runtime": 7209.3456,
"train_tokens_per_second": 67989.545
},
{
"epoch": 1.3533020570191265,
"grad_norm": 1.7734375,
"learning_rate": 1.2283550464302118e-05,
"loss": 2.2137119293212892,
"num_input_tokens_seen": 491470848,
"step": 3750,
"train_runtime": 7228.1812,
"train_tokens_per_second": 67993.709
},
{
"epoch": 1.356910862504511,
"grad_norm": 1.640625,
"learning_rate": 1.2159255861984018e-05,
"loss": 2.266486930847168,
"num_input_tokens_seen": 492781568,
"step": 3760,
"train_runtime": 7247.0792,
"train_tokens_per_second": 67997.266
},
{
"epoch": 1.3605196679898954,
"grad_norm": 2.34375,
"learning_rate": 1.2035390923818243e-05,
"loss": 2.1991031646728514,
"num_input_tokens_seen": 494092288,
"step": 3770,
"train_runtime": 7265.8955,
"train_tokens_per_second": 68001.568
},
{
"epoch": 1.3641284734752797,
"grad_norm": 1.9765625,
"learning_rate": 1.1911959794449613e-05,
"loss": 2.2052324295043944,
"num_input_tokens_seen": 495403008,
"step": 3780,
"train_runtime": 7284.703,
"train_tokens_per_second": 68005.931
},
{
"epoch": 1.3677372789606639,
"grad_norm": 1.609375,
"learning_rate": 1.1788966604007276e-05,
"loss": 2.2269506454467773,
"num_input_tokens_seen": 496713728,
"step": 3790,
"train_runtime": 7303.501,
"train_tokens_per_second": 68010.359
},
{
"epoch": 1.3713460844460483,
"grad_norm": 1.7578125,
"learning_rate": 1.1666415467966477e-05,
"loss": 2.2677322387695313,
"num_input_tokens_seen": 498024448,
"step": 3800,
"train_runtime": 7322.3167,
"train_tokens_per_second": 68014.601
},
{
"epoch": 1.3749548899314328,
"grad_norm": 1.8828125,
"learning_rate": 1.1544310487010932e-05,
"loss": 2.25917911529541,
"num_input_tokens_seen": 499335168,
"step": 3810,
"train_runtime": 7343.6783,
"train_tokens_per_second": 67995.24
},
{
"epoch": 1.378563695416817,
"grad_norm": 1.7890625,
"learning_rate": 1.1422655746895508e-05,
"loss": 2.1915868759155273,
"num_input_tokens_seen": 500645888,
"step": 3820,
"train_runtime": 7362.4631,
"train_tokens_per_second": 67999.783
},
{
"epoch": 1.3821725009022015,
"grad_norm": 1.671875,
"learning_rate": 1.1301455318309586e-05,
"loss": 2.1912534713745115,
"num_input_tokens_seen": 501956608,
"step": 3830,
"train_runtime": 7381.2253,
"train_tokens_per_second": 68004.51
},
{
"epoch": 1.3857813063875857,
"grad_norm": 1.78125,
"learning_rate": 1.1180713256740835e-05,
"loss": 2.268548583984375,
"num_input_tokens_seen": 503267328,
"step": 3840,
"train_runtime": 7400.018,
"train_tokens_per_second": 68008.933
},
{
"epoch": 1.3893901118729701,
"grad_norm": 1.796875,
"learning_rate": 1.1060433602339502e-05,
"loss": 2.223955535888672,
"num_input_tokens_seen": 504578048,
"step": 3850,
"train_runtime": 7418.8214,
"train_tokens_per_second": 68013.236
},
{
"epoch": 1.3929989173583543,
"grad_norm": 1.6484375,
"learning_rate": 1.0940620379783195e-05,
"loss": 2.2536026000976563,
"num_input_tokens_seen": 505888768,
"step": 3860,
"train_runtime": 7437.601,
"train_tokens_per_second": 68017.735
},
{
"epoch": 1.3966077228437388,
"grad_norm": 1.9453125,
"learning_rate": 1.082127759814231e-05,
"loss": 2.245090103149414,
"num_input_tokens_seen": 507199488,
"step": 3870,
"train_runtime": 7456.3604,
"train_tokens_per_second": 68022.394
},
{
"epoch": 1.400216528329123,
"grad_norm": 1.875,
"learning_rate": 1.0702409250745751e-05,
"loss": 2.2549039840698244,
"num_input_tokens_seen": 508510208,
"step": 3880,
"train_runtime": 7475.13,
"train_tokens_per_second": 68026.939
},
{
"epoch": 1.4038253338145075,
"grad_norm": 1.8359375,
"learning_rate": 1.0584019315047423e-05,
"loss": 2.2847557067871094,
"num_input_tokens_seen": 509820928,
"step": 3890,
"train_runtime": 7493.8996,
"train_tokens_per_second": 68031.46
},
{
"epoch": 1.4074341392998917,
"grad_norm": 1.890625,
"learning_rate": 1.0466111752493077e-05,
"loss": 2.2113019943237306,
"num_input_tokens_seen": 511131648,
"step": 3900,
"train_runtime": 7512.6698,
"train_tokens_per_second": 68035.953
},
{
"epoch": 1.4110429447852761,
"grad_norm": 1.6953125,
"learning_rate": 1.034869050838779e-05,
"loss": 2.2435705184936525,
"num_input_tokens_seen": 512442368,
"step": 3910,
"train_runtime": 7534.829,
"train_tokens_per_second": 68009.821
},
{
"epoch": 1.4146517502706604,
"grad_norm": 1.65625,
"learning_rate": 1.0231759511763902e-05,
"loss": 2.2892152786254885,
"num_input_tokens_seen": 513753088,
"step": 3920,
"train_runtime": 7553.6258,
"train_tokens_per_second": 68014.104
},
{
"epoch": 1.4182605557560448,
"grad_norm": 2.171875,
"learning_rate": 1.0115322675249642e-05,
"loss": 2.216525077819824,
"num_input_tokens_seen": 515063808,
"step": 3930,
"train_runtime": 7572.4038,
"train_tokens_per_second": 68018.534
},
{
"epoch": 1.421869361241429,
"grad_norm": 1.828125,
"learning_rate": 9.999383894938086e-06,
"loss": 2.2413888931274415,
"num_input_tokens_seen": 516374528,
"step": 3940,
"train_runtime": 7591.1718,
"train_tokens_per_second": 68023.033
},
{
"epoch": 1.4254781667268135,
"grad_norm": 1.796875,
"learning_rate": 9.883947050256884e-06,
"loss": 2.204883575439453,
"num_input_tokens_seen": 517685248,
"step": 3950,
"train_runtime": 7609.9505,
"train_tokens_per_second": 68027.413
},
{
"epoch": 1.4290869722121977,
"grad_norm": 1.8984375,
"learning_rate": 9.769016003838421e-06,
"loss": 2.215869140625,
"num_input_tokens_seen": 518995968,
"step": 3960,
"train_runtime": 7628.7261,
"train_tokens_per_second": 68031.8
},
{
"epoch": 1.4326957776975822,
"grad_norm": 1.6953125,
"learning_rate": 9.654594601390534e-06,
"loss": 2.277448844909668,
"num_input_tokens_seen": 520306688,
"step": 3970,
"train_runtime": 7647.5178,
"train_tokens_per_second": 68036.021
},
{
"epoch": 1.4363045831829664,
"grad_norm": 1.8046875,
"learning_rate": 9.5406866715679e-06,
"loss": 2.23470516204834,
"num_input_tokens_seen": 521617408,
"step": 3980,
"train_runtime": 7666.2817,
"train_tokens_per_second": 68040.47
},
{
"epoch": 1.4399133886683508,
"grad_norm": 1.7265625,
"learning_rate": 9.427296025843862e-06,
"loss": 2.2300508499145506,
"num_input_tokens_seen": 522928128,
"step": 3990,
"train_runtime": 7685.0659,
"train_tokens_per_second": 68044.716
},
{
"epoch": 1.443522194153735,
"grad_norm": 1.7421875,
"learning_rate": 9.314426458382938e-06,
"loss": 2.254155731201172,
"num_input_tokens_seen": 524238848,
"step": 4000,
"train_runtime": 7703.8585,
"train_tokens_per_second": 68048.867
},
{
"epoch": 1.4471309996391195,
"grad_norm": 1.9453125,
"learning_rate": 9.20208174591383e-06,
"loss": 2.233040618896484,
"num_input_tokens_seen": 525549568,
"step": 4010,
"train_runtime": 7727.4509,
"train_tokens_per_second": 68010.729
},
{
"epoch": 1.4507398051245037,
"grad_norm": 1.9453125,
"learning_rate": 9.090265647603083e-06,
"loss": 2.220596122741699,
"num_input_tokens_seen": 526860288,
"step": 4020,
"train_runtime": 7746.2345,
"train_tokens_per_second": 68015.019
},
{
"epoch": 1.4543486106098882,
"grad_norm": 1.796875,
"learning_rate": 8.97898190492926e-06,
"loss": 2.231102180480957,
"num_input_tokens_seen": 528171008,
"step": 4030,
"train_runtime": 7765.0306,
"train_tokens_per_second": 68019.18
},
{
"epoch": 1.4579574160952724,
"grad_norm": 1.5390625,
"learning_rate": 8.868234241557788e-06,
"loss": 2.213207244873047,
"num_input_tokens_seen": 529481728,
"step": 4040,
"train_runtime": 7783.8347,
"train_tokens_per_second": 68023.249
},
{
"epoch": 1.4615662215806569,
"grad_norm": 1.7734375,
"learning_rate": 8.758026363216345e-06,
"loss": 2.2278326034545897,
"num_input_tokens_seen": 530792448,
"step": 4050,
"train_runtime": 7802.6402,
"train_tokens_per_second": 68027.287
},
{
"epoch": 1.465175027066041,
"grad_norm": 2.109375,
"learning_rate": 8.648361957570859e-06,
"loss": 2.2364572525024413,
"num_input_tokens_seen": 532103168,
"step": 4060,
"train_runtime": 7821.428,
"train_tokens_per_second": 68031.46
},
{
"epoch": 1.4687838325514255,
"grad_norm": 1.5859375,
"learning_rate": 8.539244694102107e-06,
"loss": 2.2006353378295898,
"num_input_tokens_seen": 533413888,
"step": 4070,
"train_runtime": 7840.2057,
"train_tokens_per_second": 68035.7
},
{
"epoch": 1.4723926380368098,
"grad_norm": 1.71875,
"learning_rate": 8.430678223982969e-06,
"loss": 2.2076269149780274,
"num_input_tokens_seen": 534724608,
"step": 4080,
"train_runtime": 7858.9877,
"train_tokens_per_second": 68039.883
},
{
"epoch": 1.4760014435221942,
"grad_norm": 1.671875,
"learning_rate": 8.322666179956188e-06,
"loss": 2.2272457122802733,
"num_input_tokens_seen": 536035328,
"step": 4090,
"train_runtime": 7877.7613,
"train_tokens_per_second": 68044.119
},
{
"epoch": 1.4796102490075784,
"grad_norm": 1.7578125,
"learning_rate": 8.21521217621288e-06,
"loss": 2.2090341567993166,
"num_input_tokens_seen": 537346048,
"step": 4100,
"train_runtime": 7896.5448,
"train_tokens_per_second": 68048.25
},
{
"epoch": 1.4832190544929629,
"grad_norm": 1.6640625,
"learning_rate": 8.10831980827158e-06,
"loss": 2.2423015594482423,
"num_input_tokens_seen": 538656768,
"step": 4110,
"train_runtime": 7917.941,
"train_tokens_per_second": 68029.904
},
{
"epoch": 1.486827859978347,
"grad_norm": 1.6953125,
"learning_rate": 8.001992652857912e-06,
"loss": 2.2490259170532227,
"num_input_tokens_seen": 539967488,
"step": 4120,
"train_runtime": 7936.7037,
"train_tokens_per_second": 68034.225
},
{
"epoch": 1.4904366654637315,
"grad_norm": 1.7421875,
"learning_rate": 7.896234267784927e-06,
"loss": 2.231982421875,
"num_input_tokens_seen": 541278208,
"step": 4130,
"train_runtime": 7955.4671,
"train_tokens_per_second": 68038.52
},
{
"epoch": 1.4940454709491158,
"grad_norm": 1.84375,
"learning_rate": 7.791048191834065e-06,
"loss": 2.2456960678100586,
"num_input_tokens_seen": 542588928,
"step": 4140,
"train_runtime": 7974.2373,
"train_tokens_per_second": 68042.736
},
{
"epoch": 1.4976542764345002,
"grad_norm": 1.5546875,
"learning_rate": 7.686437944636699e-06,
"loss": 2.2039539337158205,
"num_input_tokens_seen": 543899648,
"step": 4150,
"train_runtime": 7993.0139,
"train_tokens_per_second": 68046.878
},
{
"epoch": 1.5012630819198844,
"grad_norm": 1.546875,
"learning_rate": 7.582407026556423e-06,
"loss": 2.240394401550293,
"num_input_tokens_seen": 545210368,
"step": 4160,
"train_runtime": 8011.786,
"train_tokens_per_second": 68051.04
},
{
"epoch": 1.504871887405269,
"grad_norm": 1.71875,
"learning_rate": 7.478958918571899e-06,
"loss": 2.2381542205810545,
"num_input_tokens_seen": 546521088,
"step": 4170,
"train_runtime": 8030.5448,
"train_tokens_per_second": 68055.294
},
{
"epoch": 1.5084806928906533,
"grad_norm": 1.7578125,
"learning_rate": 7.376097082160344e-06,
"loss": 2.263725471496582,
"num_input_tokens_seen": 547831808,
"step": 4180,
"train_runtime": 8049.3053,
"train_tokens_per_second": 68059.514
},
{
"epoch": 1.5120894983760376,
"grad_norm": 1.640625,
"learning_rate": 7.273824959181805e-06,
"loss": 2.261068916320801,
"num_input_tokens_seen": 549142528,
"step": 4190,
"train_runtime": 8068.0708,
"train_tokens_per_second": 68063.672
},
{
"epoch": 1.5156983038614218,
"grad_norm": 1.6328125,
"learning_rate": 7.172145971763858e-06,
"loss": 2.2464086532592775,
"num_input_tokens_seen": 550453248,
"step": 4200,
"train_runtime": 8086.8528,
"train_tokens_per_second": 68067.673
},
{
"epoch": 1.5193071093468062,
"grad_norm": 1.7421875,
"learning_rate": 7.071063522187218e-06,
"loss": 2.190806198120117,
"num_input_tokens_seen": 551763968,
"step": 4210,
"train_runtime": 8108.814,
"train_tokens_per_second": 68044.965
},
{
"epoch": 1.5229159148321907,
"grad_norm": 1.59375,
"learning_rate": 6.970580992771828e-06,
"loss": 2.264400291442871,
"num_input_tokens_seen": 553074688,
"step": 4220,
"train_runtime": 8127.6062,
"train_tokens_per_second": 68048.903
},
{
"epoch": 1.526524720317575,
"grad_norm": 1.609375,
"learning_rate": 6.870701745763708e-06,
"loss": 2.209558868408203,
"num_input_tokens_seen": 554385408,
"step": 4230,
"train_runtime": 8146.3988,
"train_tokens_per_second": 68052.82
},
{
"epoch": 1.5301335258029591,
"grad_norm": 1.8203125,
"learning_rate": 6.771429123222433e-06,
"loss": 2.247188377380371,
"num_input_tokens_seen": 555696128,
"step": 4240,
"train_runtime": 8165.1848,
"train_tokens_per_second": 68056.773
},
{
"epoch": 1.5337423312883436,
"grad_norm": 2.046875,
"learning_rate": 6.672766446909326e-06,
"loss": 2.1808168411254885,
"num_input_tokens_seen": 557006848,
"step": 4250,
"train_runtime": 8183.9739,
"train_tokens_per_second": 68060.683
},
{
"epoch": 1.537351136773728,
"grad_norm": 1.5078125,
"learning_rate": 6.574717018176299e-06,
"loss": 2.2411041259765625,
"num_input_tokens_seen": 558317568,
"step": 4260,
"train_runtime": 8202.7537,
"train_tokens_per_second": 68064.651
},
{
"epoch": 1.5409599422591123,
"grad_norm": 1.8671875,
"learning_rate": 6.477284117855381e-06,
"loss": 2.2084012985229493,
"num_input_tokens_seen": 559628288,
"step": 4270,
"train_runtime": 8221.5449,
"train_tokens_per_second": 68068.507
},
{
"epoch": 1.5445687477444965,
"grad_norm": 1.671875,
"learning_rate": 6.380471006148953e-06,
"loss": 2.2226863861083985,
"num_input_tokens_seen": 560939008,
"step": 4280,
"train_runtime": 8240.3269,
"train_tokens_per_second": 68072.422
},
{
"epoch": 1.548177553229881,
"grad_norm": 1.6015625,
"learning_rate": 6.284280922520644e-06,
"loss": 2.2183189392089844,
"num_input_tokens_seen": 562249728,
"step": 4290,
"train_runtime": 8259.111,
"train_tokens_per_second": 68076.301
},
{
"epoch": 1.5517863587152654,
"grad_norm": 1.796875,
"learning_rate": 6.188717085586923e-06,
"loss": 2.2236093521118163,
"num_input_tokens_seen": 563560448,
"step": 4300,
"train_runtime": 8277.9212,
"train_tokens_per_second": 68079.948
},
{
"epoch": 1.5553951642006496,
"grad_norm": 1.5234375,
"learning_rate": 6.0937826930094425e-06,
"loss": 2.2661991119384766,
"num_input_tokens_seen": 564871168,
"step": 4310,
"train_runtime": 8301.5548,
"train_tokens_per_second": 68044.021
},
{
"epoch": 1.5590039696860338,
"grad_norm": 1.7265625,
"learning_rate": 5.999480921388001e-06,
"loss": 2.2453027725219727,
"num_input_tokens_seen": 566181888,
"step": 4320,
"train_runtime": 8320.3497,
"train_tokens_per_second": 68047.847
},
{
"epoch": 1.5626127751714183,
"grad_norm": 1.8125,
"learning_rate": 5.90581492615428e-06,
"loss": 2.22461051940918,
"num_input_tokens_seen": 567492608,
"step": 4330,
"train_runtime": 8339.1504,
"train_tokens_per_second": 68051.609
},
{
"epoch": 1.5662215806568027,
"grad_norm": 1.671875,
"learning_rate": 5.812787841466233e-06,
"loss": 2.2348844528198244,
"num_input_tokens_seen": 568803328,
"step": 4340,
"train_runtime": 8357.927,
"train_tokens_per_second": 68055.551
},
{
"epoch": 1.569830386142187,
"grad_norm": 1.7265625,
"learning_rate": 5.7204027801032404e-06,
"loss": 2.2349353790283204,
"num_input_tokens_seen": 570114048,
"step": 4350,
"train_runtime": 8376.7006,
"train_tokens_per_second": 68059.499
},
{
"epoch": 1.5734391916275712,
"grad_norm": 1.875,
"learning_rate": 5.6286628333619196e-06,
"loss": 2.2075759887695314,
"num_input_tokens_seen": 571424768,
"step": 4360,
"train_runtime": 8395.4768,
"train_tokens_per_second": 68063.409
},
{
"epoch": 1.5770479971129556,
"grad_norm": 1.7890625,
"learning_rate": 5.537571070952727e-06,
"loss": 2.206249809265137,
"num_input_tokens_seen": 572735488,
"step": 4370,
"train_runtime": 8414.2644,
"train_tokens_per_second": 68067.208
},
{
"epoch": 1.58065680259834,
"grad_norm": 1.6875,
"learning_rate": 5.4471305408972215e-06,
"loss": 2.2273490905761717,
"num_input_tokens_seen": 574046208,
"step": 4380,
"train_runtime": 8433.0466,
"train_tokens_per_second": 68071.034
},
{
"epoch": 1.5842656080837243,
"grad_norm": 1.640625,
"learning_rate": 5.357344269426046e-06,
"loss": 2.2429645538330076,
"num_input_tokens_seen": 575356928,
"step": 4390,
"train_runtime": 8451.8411,
"train_tokens_per_second": 68074.745
},
{
"epoch": 1.5878744135691085,
"grad_norm": 1.65625,
"learning_rate": 5.268215260877749e-06,
"loss": 2.268222427368164,
"num_input_tokens_seen": 576667648,
"step": 4400,
"train_runtime": 8470.6315,
"train_tokens_per_second": 68078.472
},
{
"epoch": 1.591483219054493,
"grad_norm": 1.609375,
"learning_rate": 5.179746497598154e-06,
"loss": 2.2321073532104494,
"num_input_tokens_seen": 577978368,
"step": 4410,
"train_runtime": 8492.2709,
"train_tokens_per_second": 68059.342
},
{
"epoch": 1.5950920245398774,
"grad_norm": 1.6328125,
"learning_rate": 5.091940939840639e-06,
"loss": 2.2371564865112306,
"num_input_tokens_seen": 579289088,
"step": 4420,
"train_runtime": 8511.0351,
"train_tokens_per_second": 68063.295
},
{
"epoch": 1.5987008300252616,
"grad_norm": 1.578125,
"learning_rate": 5.004801525667063e-06,
"loss": 2.235270690917969,
"num_input_tokens_seen": 580599808,
"step": 4430,
"train_runtime": 8529.8242,
"train_tokens_per_second": 68067.031
},
{
"epoch": 1.6023096355106459,
"grad_norm": 1.5859375,
"learning_rate": 4.918331170849458e-06,
"loss": 2.210706901550293,
"num_input_tokens_seen": 581910528,
"step": 4440,
"train_runtime": 8548.5848,
"train_tokens_per_second": 68070.978
},
{
"epoch": 1.6059184409960303,
"grad_norm": 1.7265625,
"learning_rate": 4.832532768772427e-06,
"loss": 2.240275573730469,
"num_input_tokens_seen": 583221248,
"step": 4450,
"train_runtime": 8567.3411,
"train_tokens_per_second": 68074.942
},
{
"epoch": 1.6095272464814148,
"grad_norm": 1.5546875,
"learning_rate": 4.747409190336419e-06,
"loss": 2.208348274230957,
"num_input_tokens_seen": 584531968,
"step": 4460,
"train_runtime": 8586.1174,
"train_tokens_per_second": 68078.73
},
{
"epoch": 1.613136051966799,
"grad_norm": 1.578125,
"learning_rate": 4.662963283861552e-06,
"loss": 2.232676315307617,
"num_input_tokens_seen": 585842688,
"step": 4470,
"train_runtime": 8604.862,
"train_tokens_per_second": 68082.752
},
{
"epoch": 1.6167448574521832,
"grad_norm": 1.546875,
"learning_rate": 4.579197874992397e-06,
"loss": 2.217829704284668,
"num_input_tokens_seen": 587153408,
"step": 4480,
"train_runtime": 8623.6217,
"train_tokens_per_second": 68086.638
},
{
"epoch": 1.6203536629375677,
"grad_norm": 1.6953125,
"learning_rate": 4.496115766603381e-06,
"loss": 2.230474853515625,
"num_input_tokens_seen": 588464128,
"step": 4490,
"train_runtime": 8642.3776,
"train_tokens_per_second": 68090.537
},
{
"epoch": 1.623962468422952,
"grad_norm": 1.6640625,
"learning_rate": 4.413719738705022e-06,
"loss": 2.259794998168945,
"num_input_tokens_seen": 589774848,
"step": 4500,
"train_runtime": 8661.1385,
"train_tokens_per_second": 68094.379
},
{
"epoch": 1.6275712739083363,
"grad_norm": 1.4609375,
"learning_rate": 4.332012548350869e-06,
"loss": 2.2199661254882814,
"num_input_tokens_seen": 591085568,
"step": 4510,
"train_runtime": 8683.6098,
"train_tokens_per_second": 68069.107
},
{
"epoch": 1.6311800793937206,
"grad_norm": 1.765625,
"learning_rate": 4.250996929545328e-06,
"loss": 2.2052333831787108,
"num_input_tokens_seen": 592396288,
"step": 4520,
"train_runtime": 8702.383,
"train_tokens_per_second": 68072.882
},
{
"epoch": 1.634788884879105,
"grad_norm": 1.5859375,
"learning_rate": 4.170675593152084e-06,
"loss": 2.22857780456543,
"num_input_tokens_seen": 593707008,
"step": 4530,
"train_runtime": 8721.1218,
"train_tokens_per_second": 68076.908
},
{
"epoch": 1.6383976903644895,
"grad_norm": 1.59375,
"learning_rate": 4.091051226803455e-06,
"loss": 2.2302345275878905,
"num_input_tokens_seen": 595017728,
"step": 4540,
"train_runtime": 8739.8538,
"train_tokens_per_second": 68080.97
},
{
"epoch": 1.6420064958498737,
"grad_norm": 1.6171875,
"learning_rate": 4.012126494810442e-06,
"loss": 2.2529813766479494,
"num_input_tokens_seen": 596328448,
"step": 4550,
"train_runtime": 8758.5938,
"train_tokens_per_second": 68084.953
},
{
"epoch": 1.645615301335258,
"grad_norm": 1.5703125,
"learning_rate": 3.933904038073591e-06,
"loss": 2.236446571350098,
"num_input_tokens_seen": 597639168,
"step": 4560,
"train_runtime": 8777.3287,
"train_tokens_per_second": 68088.958
},
{
"epoch": 1.6492241068206424,
"grad_norm": 1.6953125,
"learning_rate": 3.856386473994586e-06,
"loss": 2.2221988677978515,
"num_input_tokens_seen": 598949888,
"step": 4570,
"train_runtime": 8796.0733,
"train_tokens_per_second": 68092.871
},
{
"epoch": 1.6528329123060268,
"grad_norm": 1.578125,
"learning_rate": 3.7795763963887285e-06,
"loss": 2.2259494781494142,
"num_input_tokens_seen": 600260608,
"step": 4580,
"train_runtime": 8814.8099,
"train_tokens_per_second": 68096.829
},
{
"epoch": 1.656441717791411,
"grad_norm": 1.71875,
"learning_rate": 3.703476375398102e-06,
"loss": 2.192581367492676,
"num_input_tokens_seen": 601571328,
"step": 4590,
"train_runtime": 8833.5575,
"train_tokens_per_second": 68100.686
},
{
"epoch": 1.6600505232767953,
"grad_norm": 1.734375,
"learning_rate": 3.6280889574055705e-06,
"loss": 2.192411422729492,
"num_input_tokens_seen": 602882048,
"step": 4600,
"train_runtime": 8852.2952,
"train_tokens_per_second": 68104.603
},
{
"epoch": 1.6636593287621797,
"grad_norm": 2.1875,
"learning_rate": 3.5534166649496214e-06,
"loss": 2.221910095214844,
"num_input_tokens_seen": 604192768,
"step": 4610,
"train_runtime": 8873.4058,
"train_tokens_per_second": 68090.289
},
{
"epoch": 1.6672681342475641,
"grad_norm": 1.5,
"learning_rate": 3.4794619966398933e-06,
"loss": 2.2242570877075196,
"num_input_tokens_seen": 605503488,
"step": 4620,
"train_runtime": 8892.1416,
"train_tokens_per_second": 68094.224
},
{
"epoch": 1.6708769397329484,
"grad_norm": 2.0,
"learning_rate": 3.4062274270736188e-06,
"loss": 2.250449371337891,
"num_input_tokens_seen": 606814208,
"step": 4630,
"train_runtime": 8910.8743,
"train_tokens_per_second": 68098.167
},
{
"epoch": 1.6744857452183326,
"grad_norm": 1.6015625,
"learning_rate": 3.333715406752802e-06,
"loss": 2.212891387939453,
"num_input_tokens_seen": 608124928,
"step": 4640,
"train_runtime": 8929.6138,
"train_tokens_per_second": 68102.042
},
{
"epoch": 1.678094550703717,
"grad_norm": 1.671875,
"learning_rate": 3.261928362002237e-06,
"loss": 2.264537239074707,
"num_input_tokens_seen": 609435648,
"step": 4650,
"train_runtime": 8948.3657,
"train_tokens_per_second": 68105.805
},
{
"epoch": 1.6817033561891015,
"grad_norm": 1.7734375,
"learning_rate": 3.190868694888277e-06,
"loss": 2.2667461395263673,
"num_input_tokens_seen": 610746368,
"step": 4660,
"train_runtime": 8967.1058,
"train_tokens_per_second": 68109.642
},
{
"epoch": 1.6853121616744857,
"grad_norm": 1.6484375,
"learning_rate": 3.120538783138538e-06,
"loss": 2.1905519485473635,
"num_input_tokens_seen": 612057088,
"step": 4670,
"train_runtime": 8985.8457,
"train_tokens_per_second": 68113.465
},
{
"epoch": 1.68892096715987,
"grad_norm": 1.671875,
"learning_rate": 3.050940980062253e-06,
"loss": 2.1842899322509766,
"num_input_tokens_seen": 613367808,
"step": 4680,
"train_runtime": 9004.585,
"train_tokens_per_second": 68117.276
},
{
"epoch": 1.6925297726452544,
"grad_norm": 1.484375,
"learning_rate": 2.982077614471579e-06,
"loss": 2.238359260559082,
"num_input_tokens_seen": 614678528,
"step": 4690,
"train_runtime": 9023.3179,
"train_tokens_per_second": 68121.121
},
{
"epoch": 1.6961385781306388,
"grad_norm": 1.46875,
"learning_rate": 2.913950990603667e-06,
"loss": 2.265069770812988,
"num_input_tokens_seen": 615989248,
"step": 4700,
"train_runtime": 9042.0664,
"train_tokens_per_second": 68124.831
},
{
"epoch": 1.699747383616023,
"grad_norm": 1.484375,
"learning_rate": 2.8465633880435465e-06,
"loss": 2.24379825592041,
"num_input_tokens_seen": 617299968,
"step": 4710,
"train_runtime": 9062.9577,
"train_tokens_per_second": 68112.418
},
{
"epoch": 1.7033561891014073,
"grad_norm": 1.4921875,
"learning_rate": 2.779917061647841e-06,
"loss": 2.1853158950805662,
"num_input_tokens_seen": 618610688,
"step": 4720,
"train_runtime": 9081.7043,
"train_tokens_per_second": 68116.145
},
{
"epoch": 1.7069649945867917,
"grad_norm": 1.5546875,
"learning_rate": 2.714014241469362e-06,
"loss": 2.2281778335571287,
"num_input_tokens_seen": 619921408,
"step": 4730,
"train_runtime": 9100.4405,
"train_tokens_per_second": 68119.934
},
{
"epoch": 1.7105738000721762,
"grad_norm": 1.734375,
"learning_rate": 2.6488571326824253e-06,
"loss": 2.202262115478516,
"num_input_tokens_seen": 621232128,
"step": 4740,
"train_runtime": 9119.1797,
"train_tokens_per_second": 68123.685
},
{
"epoch": 1.7141826055575604,
"grad_norm": 1.7890625,
"learning_rate": 2.5844479155091194e-06,
"loss": 2.1780315399169923,
"num_input_tokens_seen": 622542848,
"step": 4750,
"train_runtime": 9137.9257,
"train_tokens_per_second": 68127.37
},
{
"epoch": 1.7177914110429446,
"grad_norm": 1.5625,
"learning_rate": 2.5207887451463243e-06,
"loss": 2.200862693786621,
"num_input_tokens_seen": 623853568,
"step": 4760,
"train_runtime": 9156.6728,
"train_tokens_per_second": 68131.032
},
{
"epoch": 1.721400216528329,
"grad_norm": 1.7890625,
"learning_rate": 2.457881751693608e-06,
"loss": 2.237129974365234,
"num_input_tokens_seen": 625164288,
"step": 4770,
"train_runtime": 9175.4262,
"train_tokens_per_second": 68134.632
},
{
"epoch": 1.7250090220137135,
"grad_norm": 1.578125,
"learning_rate": 2.395729040081926e-06,
"loss": 2.252490234375,
"num_input_tokens_seen": 626475008,
"step": 4780,
"train_runtime": 9194.161,
"train_tokens_per_second": 68138.355
},
{
"epoch": 1.7286178274990978,
"grad_norm": 1.5546875,
"learning_rate": 2.3343326900032353e-06,
"loss": 2.231769561767578,
"num_input_tokens_seen": 627785728,
"step": 4790,
"train_runtime": 9212.9018,
"train_tokens_per_second": 68142.019
},
{
"epoch": 1.732226632984482,
"grad_norm": 1.578125,
"learning_rate": 2.273694755840866e-06,
"loss": 2.228584098815918,
"num_input_tokens_seen": 629096448,
"step": 4800,
"train_runtime": 9231.6555,
"train_tokens_per_second": 68145.572
},
{
"epoch": 1.7358354384698664,
"grad_norm": 1.6953125,
"learning_rate": 2.213817266600779e-06,
"loss": 2.1512102127075194,
"num_input_tokens_seen": 630407168,
"step": 4810,
"train_runtime": 9253.1307,
"train_tokens_per_second": 68129.068
},
{
"epoch": 1.7394442439552509,
"grad_norm": 1.6796875,
"learning_rate": 2.1547022258437242e-06,
"loss": 2.2559492111206056,
"num_input_tokens_seen": 631717888,
"step": 4820,
"train_runtime": 9271.8937,
"train_tokens_per_second": 68132.564
},
{
"epoch": 1.743053049440635,
"grad_norm": 1.703125,
"learning_rate": 2.096351611618122e-06,
"loss": 2.210666465759277,
"num_input_tokens_seen": 633028608,
"step": 4830,
"train_runtime": 9290.6467,
"train_tokens_per_second": 68136.119
},
{
"epoch": 1.7466618549260193,
"grad_norm": 1.578125,
"learning_rate": 2.038767376393938e-06,
"loss": 2.2592681884765624,
"num_input_tokens_seen": 634339328,
"step": 4840,
"train_runtime": 9309.4019,
"train_tokens_per_second": 68139.644
},
{
"epoch": 1.7502706604114038,
"grad_norm": 1.453125,
"learning_rate": 1.981951446997324e-06,
"loss": 2.220474624633789,
"num_input_tokens_seen": 635650048,
"step": 4850,
"train_runtime": 9328.1684,
"train_tokens_per_second": 68143.072
},
{
"epoch": 1.7538794658967882,
"grad_norm": 1.7734375,
"learning_rate": 1.9259057245461538e-06,
"loss": 2.2094629287719725,
"num_input_tokens_seen": 636960768,
"step": 4860,
"train_runtime": 9346.9304,
"train_tokens_per_second": 68146.518
},
{
"epoch": 1.7574882713821725,
"grad_norm": 1.4609375,
"learning_rate": 1.8706320843863866e-06,
"loss": 2.202382469177246,
"num_input_tokens_seen": 638271488,
"step": 4870,
"train_runtime": 9365.6906,
"train_tokens_per_second": 68149.966
},
{
"epoch": 1.7610970768675567,
"grad_norm": 1.53125,
"learning_rate": 1.8161323760293725e-06,
"loss": 2.229145050048828,
"num_input_tokens_seen": 639582208,
"step": 4880,
"train_runtime": 9384.4542,
"train_tokens_per_second": 68153.373
},
{
"epoch": 1.7647058823529411,
"grad_norm": 1.5625,
"learning_rate": 1.7624084230898924e-06,
"loss": 2.223577880859375,
"num_input_tokens_seen": 640892928,
"step": 4890,
"train_runtime": 9403.2096,
"train_tokens_per_second": 68156.826
},
{
"epoch": 1.7683146878383256,
"grad_norm": 1.671875,
"learning_rate": 1.7094620232251946e-06,
"loss": 2.228153038024902,
"num_input_tokens_seen": 642203648,
"step": 4900,
"train_runtime": 9421.9676,
"train_tokens_per_second": 68160.248
},
{
"epoch": 1.7719234933237098,
"grad_norm": 1.78125,
"learning_rate": 1.6572949480748113e-06,
"loss": 2.235420036315918,
"num_input_tokens_seen": 643514368,
"step": 4910,
"train_runtime": 9443.3216,
"train_tokens_per_second": 68144.917
},
{
"epoch": 1.7755322988090942,
"grad_norm": 1.609375,
"learning_rate": 1.6059089432013064e-06,
"loss": 2.2352012634277343,
"num_input_tokens_seen": 644825088,
"step": 4920,
"train_runtime": 9462.075,
"train_tokens_per_second": 68148.381
},
{
"epoch": 1.7791411042944785,
"grad_norm": 1.53125,
"learning_rate": 1.5553057280318251e-06,
"loss": 2.2525297164916993,
"num_input_tokens_seen": 646135808,
"step": 4930,
"train_runtime": 9480.8219,
"train_tokens_per_second": 68151.877
},
{
"epoch": 1.782749909779863,
"grad_norm": 1.6171875,
"learning_rate": 1.5054869958006174e-06,
"loss": 2.228093910217285,
"num_input_tokens_seen": 647446528,
"step": 4940,
"train_runtime": 9499.558,
"train_tokens_per_second": 68155.437
},
{
"epoch": 1.7863587152652474,
"grad_norm": 2.15625,
"learning_rate": 1.456454413492317e-06,
"loss": 2.2367706298828125,
"num_input_tokens_seen": 648757248,
"step": 4950,
"train_runtime": 9518.3108,
"train_tokens_per_second": 68158.863
},
{
"epoch": 1.7899675207506316,
"grad_norm": 1.5703125,
"learning_rate": 1.4082096217862162e-06,
"loss": 2.2130949020385744,
"num_input_tokens_seen": 650067968,
"step": 4960,
"train_runtime": 9537.0656,
"train_tokens_per_second": 68162.263
},
{
"epoch": 1.7935763262360158,
"grad_norm": 1.8828125,
"learning_rate": 1.360754235001338e-06,
"loss": 2.201351356506348,
"num_input_tokens_seen": 651378688,
"step": 4970,
"train_runtime": 9555.8186,
"train_tokens_per_second": 68165.661
},
{
"epoch": 1.7971851317214003,
"grad_norm": 1.9609375,
"learning_rate": 1.314089841042429e-06,
"loss": 2.2226787567138673,
"num_input_tokens_seen": 652689408,
"step": 4980,
"train_runtime": 9574.564,
"train_tokens_per_second": 68169.1
},
{
"epoch": 1.8007939372067847,
"grad_norm": 1.5703125,
"learning_rate": 1.268218001346816e-06,
"loss": 2.2285099029541016,
"num_input_tokens_seen": 654000128,
"step": 4990,
"train_runtime": 9593.3228,
"train_tokens_per_second": 68172.43
},
{
"epoch": 1.804402742692169,
"grad_norm": 1.546875,
"learning_rate": 1.223140250832172e-06,
"loss": 2.202241134643555,
"num_input_tokens_seen": 655310848,
"step": 5000,
"train_runtime": 9612.0872,
"train_tokens_per_second": 68175.708
},
{
"epoch": 1.8080115481775532,
"grad_norm": 1.546875,
"learning_rate": 1.1788580978451563e-06,
"loss": 2.2288558959960936,
"num_input_tokens_seen": 656621568,
"step": 5010,
"train_runtime": 9634.3299,
"train_tokens_per_second": 68154.358
},
{
"epoch": 1.8116203536629376,
"grad_norm": 1.5703125,
"learning_rate": 1.1353730241109306e-06,
"loss": 2.193297576904297,
"num_input_tokens_seen": 657932288,
"step": 5020,
"train_runtime": 9653.1015,
"train_tokens_per_second": 68157.606
},
{
"epoch": 1.815229159148322,
"grad_norm": 1.734375,
"learning_rate": 1.0926864846835971e-06,
"loss": 2.177206039428711,
"num_input_tokens_seen": 659243008,
"step": 5030,
"train_runtime": 9671.8746,
"train_tokens_per_second": 68160.831
},
{
"epoch": 1.8188379646337063,
"grad_norm": 1.6171875,
"learning_rate": 1.0507999078974845e-06,
"loss": 2.1820747375488283,
"num_input_tokens_seen": 660553728,
"step": 5040,
"train_runtime": 9690.6417,
"train_tokens_per_second": 68164.085
},
{
"epoch": 1.8224467701190905,
"grad_norm": 2.03125,
"learning_rate": 1.009714695319386e-06,
"loss": 2.227157974243164,
"num_input_tokens_seen": 661864448,
"step": 5050,
"train_runtime": 9709.4146,
"train_tokens_per_second": 68167.286
},
{
"epoch": 1.826055575604475,
"grad_norm": 1.6953125,
"learning_rate": 9.694322217016356e-07,
"loss": 2.228900337219238,
"num_input_tokens_seen": 663175168,
"step": 5060,
"train_runtime": 9728.1932,
"train_tokens_per_second": 68170.436
},
{
"epoch": 1.8296643810898594,
"grad_norm": 1.6640625,
"learning_rate": 9.299538349361259e-07,
"loss": 2.2359861373901366,
"num_input_tokens_seen": 664485888,
"step": 5070,
"train_runtime": 9746.9578,
"train_tokens_per_second": 68173.671
},
{
"epoch": 1.8332731865752436,
"grad_norm": 1.6015625,
"learning_rate": 8.912808560091967e-07,
"loss": 2.2222143173217774,
"num_input_tokens_seen": 665796608,
"step": 5080,
"train_runtime": 9765.7217,
"train_tokens_per_second": 68176.897
},
{
"epoch": 1.8368819920606279,
"grad_norm": 1.6484375,
"learning_rate": 8.534145789574371e-07,
"loss": 2.2080410003662108,
"num_input_tokens_seen": 667107328,
"step": 5090,
"train_runtime": 9784.5016,
"train_tokens_per_second": 68180.001
},
{
"epoch": 1.8404907975460123,
"grad_norm": 1.8203125,
"learning_rate": 8.163562708243727e-07,
"loss": 2.211821746826172,
"num_input_tokens_seen": 668418048,
"step": 5100,
"train_runtime": 9803.3054,
"train_tokens_per_second": 68182.926
},
{
"epoch": 1.8440996030313968,
"grad_norm": 1.734375,
"learning_rate": 7.801071716180942e-07,
"loss": 2.2246419906616213,
"num_input_tokens_seen": 669728768,
"step": 5110,
"train_runtime": 9824.067,
"train_tokens_per_second": 68172.252
},
{
"epoch": 1.847708408516781,
"grad_norm": 1.6171875,
"learning_rate": 7.446684942697429e-07,
"loss": 2.250296974182129,
"num_input_tokens_seen": 671039488,
"step": 5120,
"train_runtime": 9842.8864,
"train_tokens_per_second": 68175.072
},
{
"epoch": 1.8513172140021652,
"grad_norm": 1.453125,
"learning_rate": 7.100414245929387e-07,
"loss": 2.2182559967041016,
"num_input_tokens_seen": 672350208,
"step": 5130,
"train_runtime": 9861.7076,
"train_tokens_per_second": 68177.869
},
{
"epoch": 1.8549260194875496,
"grad_norm": 1.53125,
"learning_rate": 6.762271212440968e-07,
"loss": 2.2014060974121095,
"num_input_tokens_seen": 673660928,
"step": 5140,
"train_runtime": 9880.5279,
"train_tokens_per_second": 68180.662
},
{
"epoch": 1.858534824972934,
"grad_norm": 1.671875,
"learning_rate": 6.432267156836536e-07,
"loss": 2.208943176269531,
"num_input_tokens_seen": 674971648,
"step": 5150,
"train_runtime": 9899.3276,
"train_tokens_per_second": 68183.585
},
{
"epoch": 1.8621436304583183,
"grad_norm": 1.5625,
"learning_rate": 6.11041312138208e-07,
"loss": 2.259289360046387,
"num_input_tokens_seen": 676282368,
"step": 5160,
"train_runtime": 9918.1504,
"train_tokens_per_second": 68186.339
},
{
"epoch": 1.8657524359437025,
"grad_norm": 1.578125,
"learning_rate": 5.79671987563582e-07,
"loss": 2.1752920150756836,
"num_input_tokens_seen": 677593088,
"step": 5170,
"train_runtime": 9936.975,
"train_tokens_per_second": 68189.071
},
{
"epoch": 1.869361241429087,
"grad_norm": 1.6796875,
"learning_rate": 5.491197916087793e-07,
"loss": 2.2144365310668945,
"num_input_tokens_seen": 678903808,
"step": 5180,
"train_runtime": 9955.7814,
"train_tokens_per_second": 68191.916
},
{
"epoch": 1.8729700469144714,
"grad_norm": 1.6015625,
"learning_rate": 5.193857465808583e-07,
"loss": 2.2590240478515624,
"num_input_tokens_seen": 680214528,
"step": 5190,
"train_runtime": 9974.5773,
"train_tokens_per_second": 68194.822
},
{
"epoch": 1.8765788523998557,
"grad_norm": 1.40625,
"learning_rate": 4.904708474107261e-07,
"loss": 2.255119514465332,
"num_input_tokens_seen": 681525248,
"step": 5200,
"train_runtime": 9993.386,
"train_tokens_per_second": 68197.631
},
{
"epoch": 1.88018765788524,
"grad_norm": 1.796875,
"learning_rate": 4.623760616198569e-07,
"loss": 2.1574798583984376,
"num_input_tokens_seen": 682835968,
"step": 5210,
"train_runtime": 10014.7601,
"train_tokens_per_second": 68182.958
},
{
"epoch": 1.8837964633706243,
"grad_norm": 1.703125,
"learning_rate": 4.3510232928790084e-07,
"loss": 2.2060054779052733,
"num_input_tokens_seen": 684146688,
"step": 5220,
"train_runtime": 10033.5706,
"train_tokens_per_second": 68185.765
},
{
"epoch": 1.8874052688560088,
"grad_norm": 1.515625,
"learning_rate": 4.086505630212456e-07,
"loss": 2.207899284362793,
"num_input_tokens_seen": 685457408,
"step": 5230,
"train_runtime": 10052.3542,
"train_tokens_per_second": 68188.744
},
{
"epoch": 1.891014074341393,
"grad_norm": 1.625,
"learning_rate": 3.8302164792246853e-07,
"loss": 2.236598587036133,
"num_input_tokens_seen": 686768128,
"step": 5240,
"train_runtime": 10071.1601,
"train_tokens_per_second": 68191.561
},
{
"epoch": 1.8946228798267772,
"grad_norm": 1.6015625,
"learning_rate": 3.5821644156071865e-07,
"loss": 2.226085090637207,
"num_input_tokens_seen": 688078848,
"step": 5250,
"train_runtime": 10089.9449,
"train_tokens_per_second": 68194.51
},
{
"epoch": 1.8982316853121617,
"grad_norm": 1.515625,
"learning_rate": 3.342357739430396e-07,
"loss": 2.2597679138183593,
"num_input_tokens_seen": 689389568,
"step": 5260,
"train_runtime": 10108.7258,
"train_tokens_per_second": 68197.474
},
{
"epoch": 1.9018404907975461,
"grad_norm": 1.7265625,
"learning_rate": 3.1108044748656694e-07,
"loss": 2.1886007308959963,
"num_input_tokens_seen": 690700288,
"step": 5270,
"train_runtime": 10127.4997,
"train_tokens_per_second": 68200.475
},
{
"epoch": 1.9054492962829304,
"grad_norm": 1.6640625,
"learning_rate": 2.887512369917023e-07,
"loss": 2.2221187591552733,
"num_input_tokens_seen": 692011008,
"step": 5280,
"train_runtime": 10146.266,
"train_tokens_per_second": 68203.515
},
{
"epoch": 1.9090581017683146,
"grad_norm": 1.6953125,
"learning_rate": 2.6724888961618397e-07,
"loss": 2.243001174926758,
"num_input_tokens_seen": 693321728,
"step": 5290,
"train_runtime": 10165.0258,
"train_tokens_per_second": 68206.588
},
{
"epoch": 1.912666907253699,
"grad_norm": 1.59375,
"learning_rate": 2.4657412485007967e-07,
"loss": 2.205171012878418,
"num_input_tokens_seen": 694632448,
"step": 5300,
"train_runtime": 10183.8138,
"train_tokens_per_second": 68209.461
},
{
"epoch": 1.9162757127390835,
"grad_norm": 1.640625,
"learning_rate": 2.2672763449170799e-07,
"loss": 2.2328046798706054,
"num_input_tokens_seen": 695943168,
"step": 5310,
"train_runtime": 10204.819,
"train_tokens_per_second": 68197.502
},
{
"epoch": 1.9198845182244677,
"grad_norm": 1.640625,
"learning_rate": 2.0771008262450707e-07,
"loss": 2.2248144149780273,
"num_input_tokens_seen": 697253888,
"step": 5320,
"train_runtime": 10223.5749,
"train_tokens_per_second": 68200.595
},
{
"epoch": 1.923493323709852,
"grad_norm": 1.734375,
"learning_rate": 1.8952210559479432e-07,
"loss": 2.2253623962402345,
"num_input_tokens_seen": 698564608,
"step": 5330,
"train_runtime": 10242.3298,
"train_tokens_per_second": 68203.682
},
{
"epoch": 1.9271021291952364,
"grad_norm": 1.6640625,
"learning_rate": 1.7216431199049145e-07,
"loss": 2.2415798187255858,
"num_input_tokens_seen": 699875328,
"step": 5340,
"train_runtime": 10261.0809,
"train_tokens_per_second": 68206.784
},
{
"epoch": 1.9307109346806208,
"grad_norm": 1.78125,
"learning_rate": 1.556372826207464e-07,
"loss": 2.24045352935791,
"num_input_tokens_seen": 701186048,
"step": 5350,
"train_runtime": 10279.8347,
"train_tokens_per_second": 68209.856
},
{
"epoch": 1.934319740166005,
"grad_norm": 1.4765625,
"learning_rate": 1.3994157049650737e-07,
"loss": 2.2292993545532225,
"num_input_tokens_seen": 702496768,
"step": 5360,
"train_runtime": 10298.5974,
"train_tokens_per_second": 68212.859
},
{
"epoch": 1.9379285456513893,
"grad_norm": 1.59375,
"learning_rate": 1.2507770081200964e-07,
"loss": 2.2077713012695312,
"num_input_tokens_seen": 703807488,
"step": 5370,
"train_runtime": 10317.363,
"train_tokens_per_second": 68215.831
},
{
"epoch": 1.9415373511367737,
"grad_norm": 1.7265625,
"learning_rate": 1.1104617092720926e-07,
"loss": 2.202245330810547,
"num_input_tokens_seen": 705118208,
"step": 5380,
"train_runtime": 10336.1259,
"train_tokens_per_second": 68218.81
},
{
"epoch": 1.9451461566221582,
"grad_norm": 1.6015625,
"learning_rate": 9.784745035114895e-08,
"loss": 2.1991958618164062,
"num_input_tokens_seen": 706428928,
"step": 5390,
"train_runtime": 10354.8973,
"train_tokens_per_second": 68221.722
},
{
"epoch": 1.9487549621075424,
"grad_norm": 2.484375,
"learning_rate": 8.548198072622637e-08,
"loss": 2.215988349914551,
"num_input_tokens_seen": 707739648,
"step": 5400,
"train_runtime": 10373.6656,
"train_tokens_per_second": 68224.644
},
{
"epoch": 1.9523637675929266,
"grad_norm": 1.5625,
"learning_rate": 7.395017581343366e-08,
"loss": 2.194872283935547,
"num_input_tokens_seen": 709050368,
"step": 5410,
"train_runtime": 10394.6889,
"train_tokens_per_second": 68212.755
},
{
"epoch": 1.955972573078311,
"grad_norm": 1.65625,
"learning_rate": 6.325242147850463e-08,
"loss": 2.2129005432128905,
"num_input_tokens_seen": 710361088,
"step": 5420,
"train_runtime": 10413.4478,
"train_tokens_per_second": 68215.744
},
{
"epoch": 1.9595813785636955,
"grad_norm": 1.5859375,
"learning_rate": 5.3389075679011194e-08,
"loss": 2.2185943603515623,
"num_input_tokens_seen": 711671808,
"step": 5430,
"train_runtime": 10432.2116,
"train_tokens_per_second": 68218.69
},
{
"epoch": 1.9631901840490797,
"grad_norm": 1.5625,
"learning_rate": 4.436046845237574e-08,
"loss": 2.235332489013672,
"num_input_tokens_seen": 712982528,
"step": 5440,
"train_runtime": 10450.986,
"train_tokens_per_second": 68221.556
},
{
"epoch": 1.966798989534464,
"grad_norm": 1.5625,
"learning_rate": 3.616690190482996e-08,
"loss": 2.244569778442383,
"num_input_tokens_seen": 714293248,
"step": 5450,
"train_runtime": 10469.7706,
"train_tokens_per_second": 68224.346
},
{
"epoch": 1.9704077950198484,
"grad_norm": 2.15625,
"learning_rate": 2.88086502013174e-08,
"loss": 2.259345817565918,
"num_input_tokens_seen": 715603968,
"step": 5460,
"train_runtime": 10488.5418,
"train_tokens_per_second": 68227.212
},
{
"epoch": 1.9740166005052329,
"grad_norm": 1.5703125,
"learning_rate": 2.2285959556303525e-08,
"loss": 2.2066539764404296,
"num_input_tokens_seen": 716914688,
"step": 5470,
"train_runtime": 10507.3044,
"train_tokens_per_second": 68230.124
},
{
"epoch": 1.977625405990617,
"grad_norm": 1.4765625,
"learning_rate": 1.6599048225546253e-08,
"loss": 2.25235538482666,
"num_input_tokens_seen": 718225408,
"step": 5480,
"train_runtime": 10526.0756,
"train_tokens_per_second": 68232.971
},
{
"epoch": 1.9812342114760013,
"grad_norm": 1.6796875,
"learning_rate": 1.1748106498793433e-08,
"loss": 2.246954345703125,
"num_input_tokens_seen": 719536128,
"step": 5490,
"train_runtime": 10544.842,
"train_tokens_per_second": 68235.838
},
{
"epoch": 1.9848430169613858,
"grad_norm": 1.453125,
"learning_rate": 7.733296693407388e-09,
"loss": 2.253096008300781,
"num_input_tokens_seen": 720846848,
"step": 5500,
"train_runtime": 10563.6145,
"train_tokens_per_second": 68238.655
},
{
"epoch": 1.9884518224467702,
"grad_norm": 1.453125,
"learning_rate": 4.5547531489442685e-09,
"loss": 2.2080196380615233,
"num_input_tokens_seen": 722157568,
"step": 5510,
"train_runtime": 10586.1595,
"train_tokens_per_second": 68217.144
},
{
"epoch": 1.9920606279321544,
"grad_norm": 1.6796875,
"learning_rate": 2.212582222652082e-09,
"loss": 2.1899511337280275,
"num_input_tokens_seen": 723468288,
"step": 5520,
"train_runtime": 10604.922,
"train_tokens_per_second": 68220.048
},
{
"epoch": 1.9956694334175387,
"grad_norm": 1.640625,
"learning_rate": 7.068622859179864e-10,
"loss": 2.250523567199707,
"num_input_tokens_seen": 724779008,
"step": 5530,
"train_runtime": 10623.69,
"train_tokens_per_second": 68222.907
},
{
"epoch": 1.999278238902923,
"grad_norm": 1.6484375,
"learning_rate": 3.764372163428398e-11,
"loss": 2.2255619049072264,
"num_input_tokens_seen": 726089728,
"step": 5540,
"train_runtime": 10642.4512,
"train_tokens_per_second": 68225.798
},
{
"epoch": 2.0,
"num_input_tokens_seen": 726302720,
"step": 5542,
"total_flos": 4.372023498453811e+17,
"train_loss": 2.3499925993530812,
"train_runtime": 10647.232,
"train_samples_per_second": 16.654,
"train_steps_per_second": 0.521
}
],
"logging_steps": 10,
"max_steps": 5542,
"num_input_tokens_seen": 726302720,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.372023498453811e+17,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}