Instructions to use appvoid/void.0 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use appvoid/void.0 with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf appvoid/void.0 # Run inference directly in the terminal: llama cli -hf appvoid/void.0
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf appvoid/void.0 # Run inference directly in the terminal: llama cli -hf appvoid/void.0
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf appvoid/void.0 # Run inference directly in the terminal: ./llama-cli -hf appvoid/void.0
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf appvoid/void.0 # Run inference directly in the terminal: ./build/bin/llama-cli -hf appvoid/void.0
Use Docker
docker model run hf.co/appvoid/void.0
- LM Studio
- Jan
- Ollama
How to use appvoid/void.0 with Ollama:
ollama run hf.co/appvoid/void.0
- Unsloth Studio
How to use appvoid/void.0 with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for appvoid/void.0 to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for appvoid/void.0 to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for appvoid/void.0 to start chatting
- Docker Model Runner
How to use appvoid/void.0 with Docker Model Runner:
docker model run hf.co/appvoid/void.0
- Lemonade
How to use appvoid/void.0 with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull appvoid/void.0
Run and chat with the model
lemonade run user.void.0-{{QUANT_TAG}}List all available models
lemonade list
- Atomic Chat
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 5542, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.00036088054853843375, | |
| "grad_norm": 3584.0, | |
| "learning_rate": 0.0, | |
| "loss": 20.713645935058594, | |
| "num_input_tokens_seen": 131072, | |
| "step": 1, | |
| "train_runtime": 53.7767, | |
| "train_tokens_per_second": 2437.338 | |
| }, | |
| { | |
| "epoch": 0.003608805485384338, | |
| "grad_norm": 2040.0, | |
| "learning_rate": 4.0540540540540545e-06, | |
| "loss": 16.10942925347222, | |
| "num_input_tokens_seen": 1310720, | |
| "step": 10, | |
| "train_runtime": 70.8433, | |
| "train_tokens_per_second": 18501.673 | |
| }, | |
| { | |
| "epoch": 0.007217610970768676, | |
| "grad_norm": 220.0, | |
| "learning_rate": 8.558558558558558e-06, | |
| "loss": 9.052794647216796, | |
| "num_input_tokens_seen": 2621440, | |
| "step": 20, | |
| "train_runtime": 89.7838, | |
| "train_tokens_per_second": 29197.249 | |
| }, | |
| { | |
| "epoch": 0.010826416456153013, | |
| "grad_norm": 20.75, | |
| "learning_rate": 1.3063063063063064e-05, | |
| "loss": 5.4977569580078125, | |
| "num_input_tokens_seen": 3932160, | |
| "step": 30, | |
| "train_runtime": 108.725, | |
| "train_tokens_per_second": 36166.091 | |
| }, | |
| { | |
| "epoch": 0.014435221941537351, | |
| "grad_norm": 13.375, | |
| "learning_rate": 1.756756756756757e-05, | |
| "loss": 4.952135848999023, | |
| "num_input_tokens_seen": 5242880, | |
| "step": 40, | |
| "train_runtime": 127.6323, | |
| "train_tokens_per_second": 41078.011 | |
| }, | |
| { | |
| "epoch": 0.01804402742692169, | |
| "grad_norm": 19.0, | |
| "learning_rate": 2.2072072072072073e-05, | |
| "loss": 4.788348388671875, | |
| "num_input_tokens_seen": 6553600, | |
| "step": 50, | |
| "train_runtime": 146.5809, | |
| "train_tokens_per_second": 44709.796 | |
| }, | |
| { | |
| "epoch": 0.021652832912306026, | |
| "grad_norm": 16.125, | |
| "learning_rate": 2.6576576576576577e-05, | |
| "loss": 4.393115997314453, | |
| "num_input_tokens_seen": 7864320, | |
| "step": 60, | |
| "train_runtime": 165.505, | |
| "train_tokens_per_second": 47517.102 | |
| }, | |
| { | |
| "epoch": 0.025261638397690366, | |
| "grad_norm": 22.875, | |
| "learning_rate": 3.108108108108108e-05, | |
| "loss": 3.7790504455566407, | |
| "num_input_tokens_seen": 9175040, | |
| "step": 70, | |
| "train_runtime": 184.4419, | |
| "train_tokens_per_second": 49744.868 | |
| }, | |
| { | |
| "epoch": 0.028870443883074703, | |
| "grad_norm": 9.3125, | |
| "learning_rate": 3.558558558558558e-05, | |
| "loss": 3.2834922790527346, | |
| "num_input_tokens_seen": 10485760, | |
| "step": 80, | |
| "train_runtime": 203.3708, | |
| "train_tokens_per_second": 51559.816 | |
| }, | |
| { | |
| "epoch": 0.03247924936845904, | |
| "grad_norm": 4.5, | |
| "learning_rate": 4.0090090090090096e-05, | |
| "loss": 3.2390235900878905, | |
| "num_input_tokens_seen": 11796480, | |
| "step": 90, | |
| "train_runtime": 222.3126, | |
| "train_tokens_per_second": 53062.568 | |
| }, | |
| { | |
| "epoch": 0.03608805485384338, | |
| "grad_norm": 3.515625, | |
| "learning_rate": 4.4594594594594596e-05, | |
| "loss": 3.119455337524414, | |
| "num_input_tokens_seen": 13107200, | |
| "step": 100, | |
| "train_runtime": 241.2122, | |
| "train_tokens_per_second": 54338.874 | |
| }, | |
| { | |
| "epoch": 0.039696860339227716, | |
| "grad_norm": 17.375, | |
| "learning_rate": 4.90990990990991e-05, | |
| "loss": 3.0860061645507812, | |
| "num_input_tokens_seen": 14417920, | |
| "step": 110, | |
| "train_runtime": 262.9315, | |
| "train_tokens_per_second": 54835.264 | |
| }, | |
| { | |
| "epoch": 0.04330566582461205, | |
| "grad_norm": 123.0, | |
| "learning_rate": 4.999973231172336e-05, | |
| "loss": 3.074770927429199, | |
| "num_input_tokens_seen": 15728640, | |
| "step": 120, | |
| "train_runtime": 281.8581, | |
| "train_tokens_per_second": 55803.404 | |
| }, | |
| { | |
| "epoch": 0.04691447130999639, | |
| "grad_norm": 9.4375, | |
| "learning_rate": 4.999864483792435e-05, | |
| "loss": 3.045380401611328, | |
| "num_input_tokens_seen": 17039360, | |
| "step": 130, | |
| "train_runtime": 300.7857, | |
| "train_tokens_per_second": 56649.496 | |
| }, | |
| { | |
| "epoch": 0.05052327679538073, | |
| "grad_norm": 5.46875, | |
| "learning_rate": 4.9996720884445644e-05, | |
| "loss": 3.0239139556884767, | |
| "num_input_tokens_seen": 18350080, | |
| "step": 140, | |
| "train_runtime": 319.7041, | |
| "train_tokens_per_second": 57397.078 | |
| }, | |
| { | |
| "epoch": 0.05413208228076507, | |
| "grad_norm": 2.34375, | |
| "learning_rate": 4.999396051566465e-05, | |
| "loss": 3.0160009384155275, | |
| "num_input_tokens_seen": 19660800, | |
| "step": 150, | |
| "train_runtime": 338.6262, | |
| "train_tokens_per_second": 58060.485 | |
| }, | |
| { | |
| "epoch": 0.057740887766149405, | |
| "grad_norm": 7.71875, | |
| "learning_rate": 4.999036382394608e-05, | |
| "loss": 2.998691368103027, | |
| "num_input_tokens_seen": 20971520, | |
| "step": 160, | |
| "train_runtime": 357.5421, | |
| "train_tokens_per_second": 58654.682 | |
| }, | |
| { | |
| "epoch": 0.06134969325153374, | |
| "grad_norm": 6.6875, | |
| "learning_rate": 4.998593092963883e-05, | |
| "loss": 2.978720474243164, | |
| "num_input_tokens_seen": 22282240, | |
| "step": 170, | |
| "train_runtime": 376.4809, | |
| "train_tokens_per_second": 59185.573 | |
| }, | |
| { | |
| "epoch": 0.06495849873691809, | |
| "grad_norm": 2.40625, | |
| "learning_rate": 4.9980661981071995e-05, | |
| "loss": 2.927627944946289, | |
| "num_input_tokens_seen": 23592960, | |
| "step": 180, | |
| "train_runtime": 395.4258, | |
| "train_tokens_per_second": 59664.691 | |
| }, | |
| { | |
| "epoch": 0.06856730422230242, | |
| "grad_norm": 3.640625, | |
| "learning_rate": 4.997455715454986e-05, | |
| "loss": 2.8903242111206056, | |
| "num_input_tokens_seen": 24903680, | |
| "step": 190, | |
| "train_runtime": 414.3547, | |
| "train_tokens_per_second": 60102.321 | |
| }, | |
| { | |
| "epoch": 0.07217610970768676, | |
| "grad_norm": 3.515625, | |
| "learning_rate": 4.9967616654346026e-05, | |
| "loss": 2.8748184204101563, | |
| "num_input_tokens_seen": 26214400, | |
| "step": 200, | |
| "train_runtime": 433.2497, | |
| "train_tokens_per_second": 60506.45 | |
| }, | |
| { | |
| "epoch": 0.0757849151930711, | |
| "grad_norm": 3.9375, | |
| "learning_rate": 4.995984071269658e-05, | |
| "loss": 2.8495594024658204, | |
| "num_input_tokens_seen": 27525120, | |
| "step": 210, | |
| "train_runtime": 454.5473, | |
| "train_tokens_per_second": 60555.019 | |
| }, | |
| { | |
| "epoch": 0.07939372067845543, | |
| "grad_norm": 2.953125, | |
| "learning_rate": 4.995122958979232e-05, | |
| "loss": 2.8382701873779297, | |
| "num_input_tokens_seen": 28835840, | |
| "step": 220, | |
| "train_runtime": 473.4338, | |
| "train_tokens_per_second": 60907.867 | |
| }, | |
| { | |
| "epoch": 0.08300252616383977, | |
| "grad_norm": 4.46875, | |
| "learning_rate": 4.994178357377003e-05, | |
| "loss": 2.7890663146972656, | |
| "num_input_tokens_seen": 30146560, | |
| "step": 230, | |
| "train_runtime": 492.3498, | |
| "train_tokens_per_second": 61229.967 | |
| }, | |
| { | |
| "epoch": 0.0866113316492241, | |
| "grad_norm": 2.640625, | |
| "learning_rate": 4.993150298070286e-05, | |
| "loss": 2.761903762817383, | |
| "num_input_tokens_seen": 31457280, | |
| "step": 240, | |
| "train_runtime": 511.2816, | |
| "train_tokens_per_second": 61526.33 | |
| }, | |
| { | |
| "epoch": 0.09022013713460844, | |
| "grad_norm": 4.03125, | |
| "learning_rate": 4.9920388154589745e-05, | |
| "loss": 2.697579574584961, | |
| "num_input_tokens_seen": 32768000, | |
| "step": 250, | |
| "train_runtime": 530.223, | |
| "train_tokens_per_second": 61800.416 | |
| }, | |
| { | |
| "epoch": 0.09382894261999278, | |
| "grad_norm": 5.78125, | |
| "learning_rate": 4.99084394673439e-05, | |
| "loss": 2.681498146057129, | |
| "num_input_tokens_seen": 34078720, | |
| "step": 260, | |
| "train_runtime": 549.1723, | |
| "train_tokens_per_second": 62054.701 | |
| }, | |
| { | |
| "epoch": 0.09743774810537711, | |
| "grad_norm": 3.984375, | |
| "learning_rate": 4.989565731878036e-05, | |
| "loss": 2.61673526763916, | |
| "num_input_tokens_seen": 35389440, | |
| "step": 270, | |
| "train_runtime": 568.1055, | |
| "train_tokens_per_second": 62293.782 | |
| }, | |
| { | |
| "epoch": 0.10104655359076146, | |
| "grad_norm": 2.421875, | |
| "learning_rate": 4.988204213660261e-05, | |
| "loss": 2.589625358581543, | |
| "num_input_tokens_seen": 36700160, | |
| "step": 280, | |
| "train_runtime": 587.0148, | |
| "train_tokens_per_second": 62519.994 | |
| }, | |
| { | |
| "epoch": 0.1046553590761458, | |
| "grad_norm": 2.921875, | |
| "learning_rate": 4.986759437638828e-05, | |
| "loss": 2.60888729095459, | |
| "num_input_tokens_seen": 38010880, | |
| "step": 290, | |
| "train_runtime": 605.9421, | |
| "train_tokens_per_second": 62730.223 | |
| }, | |
| { | |
| "epoch": 0.10826416456153014, | |
| "grad_norm": 3.453125, | |
| "learning_rate": 4.985231452157387e-05, | |
| "loss": 2.6144739151000977, | |
| "num_input_tokens_seen": 39321600, | |
| "step": 300, | |
| "train_runtime": 624.8504, | |
| "train_tokens_per_second": 62929.624 | |
| }, | |
| { | |
| "epoch": 0.11187297004691447, | |
| "grad_norm": 3.125, | |
| "learning_rate": 4.9836203083438624e-05, | |
| "loss": 2.538804817199707, | |
| "num_input_tokens_seen": 40632320, | |
| "step": 310, | |
| "train_runtime": 646.2695, | |
| "train_tokens_per_second": 62872.104 | |
| }, | |
| { | |
| "epoch": 0.11548177553229881, | |
| "grad_norm": 5.09375, | |
| "learning_rate": 4.98192606010874e-05, | |
| "loss": 2.564370346069336, | |
| "num_input_tokens_seen": 41943040, | |
| "step": 320, | |
| "train_runtime": 665.1402, | |
| "train_tokens_per_second": 63058.949 | |
| }, | |
| { | |
| "epoch": 0.11909058101768315, | |
| "grad_norm": 3.28125, | |
| "learning_rate": 4.980148764143261e-05, | |
| "loss": 2.5560630798339843, | |
| "num_input_tokens_seen": 43253760, | |
| "step": 330, | |
| "train_runtime": 684.0334, | |
| "train_tokens_per_second": 63233.407 | |
| }, | |
| { | |
| "epoch": 0.12269938650306748, | |
| "grad_norm": 2.484375, | |
| "learning_rate": 4.978288479917528e-05, | |
| "loss": 2.5639411926269533, | |
| "num_input_tokens_seen": 44564480, | |
| "step": 340, | |
| "train_runtime": 702.9146, | |
| "train_tokens_per_second": 63399.565 | |
| }, | |
| { | |
| "epoch": 0.12630819198845183, | |
| "grad_norm": 2.578125, | |
| "learning_rate": 4.9763452696785126e-05, | |
| "loss": 2.513383483886719, | |
| "num_input_tokens_seen": 45875200, | |
| "step": 350, | |
| "train_runtime": 721.7893, | |
| "train_tokens_per_second": 63557.608 | |
| }, | |
| { | |
| "epoch": 0.12991699747383617, | |
| "grad_norm": 3.703125, | |
| "learning_rate": 4.974319198447974e-05, | |
| "loss": 2.518290328979492, | |
| "num_input_tokens_seen": 47185920, | |
| "step": 360, | |
| "train_runtime": 740.6903, | |
| "train_tokens_per_second": 63705.334 | |
| }, | |
| { | |
| "epoch": 0.1335258029592205, | |
| "grad_norm": 2.65625, | |
| "learning_rate": 4.972210334020285e-05, | |
| "loss": 2.542829132080078, | |
| "num_input_tokens_seen": 48496640, | |
| "step": 370, | |
| "train_runtime": 759.5697, | |
| "train_tokens_per_second": 63847.52 | |
| }, | |
| { | |
| "epoch": 0.13713460844460484, | |
| "grad_norm": 5.90625, | |
| "learning_rate": 4.97001874696016e-05, | |
| "loss": 2.5011875152587892, | |
| "num_input_tokens_seen": 49807360, | |
| "step": 380, | |
| "train_runtime": 778.4416, | |
| "train_tokens_per_second": 63983.429 | |
| }, | |
| { | |
| "epoch": 0.14074341392998918, | |
| "grad_norm": 2.90625, | |
| "learning_rate": 4.967744510600295e-05, | |
| "loss": 2.4976362228393554, | |
| "num_input_tokens_seen": 51118080, | |
| "step": 390, | |
| "train_runtime": 797.2713, | |
| "train_tokens_per_second": 64116.289 | |
| }, | |
| { | |
| "epoch": 0.14435221941537352, | |
| "grad_norm": 3.25, | |
| "learning_rate": 4.9653877010389164e-05, | |
| "loss": 2.507686805725098, | |
| "num_input_tokens_seen": 52428800, | |
| "step": 400, | |
| "train_runtime": 816.1018, | |
| "train_tokens_per_second": 64242.967 | |
| }, | |
| { | |
| "epoch": 0.14796102490075785, | |
| "grad_norm": 2.203125, | |
| "learning_rate": 4.962948397137229e-05, | |
| "loss": 2.474226951599121, | |
| "num_input_tokens_seen": 53739520, | |
| "step": 410, | |
| "train_runtime": 836.4537, | |
| "train_tokens_per_second": 64246.857 | |
| }, | |
| { | |
| "epoch": 0.1515698303861422, | |
| "grad_norm": 3.390625, | |
| "learning_rate": 4.960426680516786e-05, | |
| "loss": 2.504658508300781, | |
| "num_input_tokens_seen": 55050240, | |
| "step": 420, | |
| "train_runtime": 855.3633, | |
| "train_tokens_per_second": 64358.895 | |
| }, | |
| { | |
| "epoch": 0.15517863587152653, | |
| "grad_norm": 3.375, | |
| "learning_rate": 4.9578226355567474e-05, | |
| "loss": 2.453939437866211, | |
| "num_input_tokens_seen": 56360960, | |
| "step": 430, | |
| "train_runtime": 874.2501, | |
| "train_tokens_per_second": 64467.776 | |
| }, | |
| { | |
| "epoch": 0.15878744135691086, | |
| "grad_norm": 3.4375, | |
| "learning_rate": 4.955136349391065e-05, | |
| "loss": 2.46431941986084, | |
| "num_input_tokens_seen": 57671680, | |
| "step": 440, | |
| "train_runtime": 893.1411, | |
| "train_tokens_per_second": 64571.744 | |
| }, | |
| { | |
| "epoch": 0.1623962468422952, | |
| "grad_norm": 5.78125, | |
| "learning_rate": 4.9523679119055635e-05, | |
| "loss": 2.451584243774414, | |
| "num_input_tokens_seen": 58982400, | |
| "step": 450, | |
| "train_runtime": 912.0215, | |
| "train_tokens_per_second": 64672.161 | |
| }, | |
| { | |
| "epoch": 0.16600505232767954, | |
| "grad_norm": 4.25, | |
| "learning_rate": 4.949517415734932e-05, | |
| "loss": 2.4436901092529295, | |
| "num_input_tokens_seen": 60293120, | |
| "step": 460, | |
| "train_runtime": 930.9065, | |
| "train_tokens_per_second": 64768.183 | |
| }, | |
| { | |
| "epoch": 0.16961385781306387, | |
| "grad_norm": 3.5, | |
| "learning_rate": 4.9465849562596245e-05, | |
| "loss": 2.4572980880737303, | |
| "num_input_tokens_seen": 61603840, | |
| "step": 470, | |
| "train_runtime": 949.7891, | |
| "train_tokens_per_second": 64860.544 | |
| }, | |
| { | |
| "epoch": 0.1732226632984482, | |
| "grad_norm": 3.234375, | |
| "learning_rate": 4.943570631602672e-05, | |
| "loss": 2.4464738845825194, | |
| "num_input_tokens_seen": 62914560, | |
| "step": 480, | |
| "train_runtime": 968.6781, | |
| "train_tokens_per_second": 64948.885 | |
| }, | |
| { | |
| "epoch": 0.17683146878383255, | |
| "grad_norm": 3.265625, | |
| "learning_rate": 4.9404745426263945e-05, | |
| "loss": 2.413909912109375, | |
| "num_input_tokens_seen": 64225280, | |
| "step": 490, | |
| "train_runtime": 987.5714, | |
| "train_tokens_per_second": 65033.559 | |
| }, | |
| { | |
| "epoch": 0.18044027426921688, | |
| "grad_norm": 4.4375, | |
| "learning_rate": 4.937296792929027e-05, | |
| "loss": 2.425960350036621, | |
| "num_input_tokens_seen": 65536000, | |
| "step": 500, | |
| "train_runtime": 1006.4538, | |
| "train_tokens_per_second": 65115.753 | |
| }, | |
| { | |
| "epoch": 0.18404907975460122, | |
| "grad_norm": 2.6875, | |
| "learning_rate": 4.934037488841257e-05, | |
| "loss": 2.4214879989624025, | |
| "num_input_tokens_seen": 66846720, | |
| "step": 510, | |
| "train_runtime": 1030.6607, | |
| "train_tokens_per_second": 64858.126 | |
| }, | |
| { | |
| "epoch": 0.18765788523998556, | |
| "grad_norm": 3.53125, | |
| "learning_rate": 4.9306967394226613e-05, | |
| "loss": 2.4362627029418946, | |
| "num_input_tokens_seen": 68157440, | |
| "step": 520, | |
| "train_runtime": 1049.5437, | |
| "train_tokens_per_second": 64940.069 | |
| }, | |
| { | |
| "epoch": 0.1912666907253699, | |
| "grad_norm": 5.15625, | |
| "learning_rate": 4.927274656458059e-05, | |
| "loss": 2.4367109298706056, | |
| "num_input_tokens_seen": 69468160, | |
| "step": 530, | |
| "train_runtime": 1068.4149, | |
| "train_tokens_per_second": 65019.837 | |
| }, | |
| { | |
| "epoch": 0.19487549621075423, | |
| "grad_norm": 3.671875, | |
| "learning_rate": 4.923771354453771e-05, | |
| "loss": 2.375163459777832, | |
| "num_input_tokens_seen": 70778880, | |
| "step": 540, | |
| "train_runtime": 1087.2978, | |
| "train_tokens_per_second": 65096.13 | |
| }, | |
| { | |
| "epoch": 0.19848430169613857, | |
| "grad_norm": 4.3125, | |
| "learning_rate": 4.920186950633791e-05, | |
| "loss": 2.4392827987670898, | |
| "num_input_tokens_seen": 72089600, | |
| "step": 550, | |
| "train_runtime": 1106.1535, | |
| "train_tokens_per_second": 65171.423 | |
| }, | |
| { | |
| "epoch": 0.20209310718152293, | |
| "grad_norm": 3.34375, | |
| "learning_rate": 4.9165215649358574e-05, | |
| "loss": 2.420306396484375, | |
| "num_input_tokens_seen": 73400320, | |
| "step": 560, | |
| "train_runtime": 1125.0201, | |
| "train_tokens_per_second": 65243.561 | |
| }, | |
| { | |
| "epoch": 0.20570191266690727, | |
| "grad_norm": 5.0, | |
| "learning_rate": 4.912775320007445e-05, | |
| "loss": 2.3969913482666017, | |
| "num_input_tokens_seen": 74711040, | |
| "step": 570, | |
| "train_runtime": 1143.88, | |
| "train_tokens_per_second": 65313.706 | |
| }, | |
| { | |
| "epoch": 0.2093107181522916, | |
| "grad_norm": 4.34375, | |
| "learning_rate": 4.90894834120166e-05, | |
| "loss": 2.3971323013305663, | |
| "num_input_tokens_seen": 76021760, | |
| "step": 580, | |
| "train_runtime": 1162.7459, | |
| "train_tokens_per_second": 65381.231 | |
| }, | |
| { | |
| "epoch": 0.21291952363767594, | |
| "grad_norm": 3.984375, | |
| "learning_rate": 4.905040756573042e-05, | |
| "loss": 2.4156164169311523, | |
| "num_input_tokens_seen": 77332480, | |
| "step": 590, | |
| "train_runtime": 1181.6028, | |
| "train_tokens_per_second": 65447.101 | |
| }, | |
| { | |
| "epoch": 0.21652832912306028, | |
| "grad_norm": 4.125, | |
| "learning_rate": 4.901052696873286e-05, | |
| "loss": 2.38603515625, | |
| "num_input_tokens_seen": 78643200, | |
| "step": 600, | |
| "train_runtime": 1200.4661, | |
| "train_tokens_per_second": 65510.556 | |
| }, | |
| { | |
| "epoch": 0.2201371346084446, | |
| "grad_norm": 5.125, | |
| "learning_rate": 4.8969842955468596e-05, | |
| "loss": 2.3919803619384767, | |
| "num_input_tokens_seen": 79953920, | |
| "step": 610, | |
| "train_runtime": 1222.526, | |
| "train_tokens_per_second": 65400.59 | |
| }, | |
| { | |
| "epoch": 0.22374594009382895, | |
| "grad_norm": 2.65625, | |
| "learning_rate": 4.892835688726546e-05, | |
| "loss": 2.4279273986816405, | |
| "num_input_tokens_seen": 81264640, | |
| "step": 620, | |
| "train_runtime": 1241.4138, | |
| "train_tokens_per_second": 65461.362 | |
| }, | |
| { | |
| "epoch": 0.22735474557921329, | |
| "grad_norm": 3.984375, | |
| "learning_rate": 4.88860701522888e-05, | |
| "loss": 2.3708824157714843, | |
| "num_input_tokens_seen": 82575360, | |
| "step": 630, | |
| "train_runtime": 1260.2633, | |
| "train_tokens_per_second": 65522.307 | |
| }, | |
| { | |
| "epoch": 0.23096355106459762, | |
| "grad_norm": 2.71875, | |
| "learning_rate": 4.884298416549512e-05, | |
| "loss": 2.399201583862305, | |
| "num_input_tokens_seen": 83886080, | |
| "step": 640, | |
| "train_runtime": 1279.1242, | |
| "train_tokens_per_second": 65580.87 | |
| }, | |
| { | |
| "epoch": 0.23457235654998196, | |
| "grad_norm": 2.921875, | |
| "learning_rate": 4.879910036858464e-05, | |
| "loss": 2.3736968994140626, | |
| "num_input_tokens_seen": 85196800, | |
| "step": 650, | |
| "train_runtime": 1297.9757, | |
| "train_tokens_per_second": 65638.211 | |
| }, | |
| { | |
| "epoch": 0.2381811620353663, | |
| "grad_norm": 3.25, | |
| "learning_rate": 4.875442022995315e-05, | |
| "loss": 2.3272987365722657, | |
| "num_input_tokens_seen": 86507520, | |
| "step": 660, | |
| "train_runtime": 1316.835, | |
| "train_tokens_per_second": 65693.518 | |
| }, | |
| { | |
| "epoch": 0.24178996752075063, | |
| "grad_norm": 3.25, | |
| "learning_rate": 4.8708945244642814e-05, | |
| "loss": 2.366088104248047, | |
| "num_input_tokens_seen": 87818240, | |
| "step": 670, | |
| "train_runtime": 1335.7017, | |
| "train_tokens_per_second": 65746.897 | |
| }, | |
| { | |
| "epoch": 0.24539877300613497, | |
| "grad_norm": 4.4375, | |
| "learning_rate": 4.8662676934292145e-05, | |
| "loss": 2.3694658279418945, | |
| "num_input_tokens_seen": 89128960, | |
| "step": 680, | |
| "train_runtime": 1354.5738, | |
| "train_tokens_per_second": 65798.526 | |
| }, | |
| { | |
| "epoch": 0.2490075784915193, | |
| "grad_norm": 4.875, | |
| "learning_rate": 4.861561684708513e-05, | |
| "loss": 2.370319938659668, | |
| "num_input_tokens_seen": 90439680, | |
| "step": 690, | |
| "train_runtime": 1373.4498, | |
| "train_tokens_per_second": 65848.55 | |
| }, | |
| { | |
| "epoch": 0.25261638397690367, | |
| "grad_norm": 4.09375, | |
| "learning_rate": 4.85677665576994e-05, | |
| "loss": 2.353267860412598, | |
| "num_input_tokens_seen": 91750400, | |
| "step": 700, | |
| "train_runtime": 1392.3268, | |
| "train_tokens_per_second": 65897.171 | |
| }, | |
| { | |
| "epoch": 0.256225189462288, | |
| "grad_norm": 2.921875, | |
| "learning_rate": 4.851912766725354e-05, | |
| "loss": 2.3250946044921874, | |
| "num_input_tokens_seen": 93061120, | |
| "step": 710, | |
| "train_runtime": 1413.3943, | |
| "train_tokens_per_second": 65842.29 | |
| }, | |
| { | |
| "epoch": 0.25983399494767234, | |
| "grad_norm": 3.265625, | |
| "learning_rate": 4.8469701803253484e-05, | |
| "loss": 2.3694339752197267, | |
| "num_input_tokens_seen": 94371840, | |
| "step": 720, | |
| "train_runtime": 1432.2376, | |
| "train_tokens_per_second": 65891.188 | |
| }, | |
| { | |
| "epoch": 0.2634428004330567, | |
| "grad_norm": 5.28125, | |
| "learning_rate": 4.8419490619538145e-05, | |
| "loss": 2.356003189086914, | |
| "num_input_tokens_seen": 95682560, | |
| "step": 730, | |
| "train_runtime": 1451.105, | |
| "train_tokens_per_second": 65937.723 | |
| }, | |
| { | |
| "epoch": 0.267051605918441, | |
| "grad_norm": 3.046875, | |
| "learning_rate": 4.8368495796223977e-05, | |
| "loss": 2.354664993286133, | |
| "num_input_tokens_seen": 96993280, | |
| "step": 740, | |
| "train_runtime": 1469.9628, | |
| "train_tokens_per_second": 65983.495 | |
| }, | |
| { | |
| "epoch": 0.27066041140382535, | |
| "grad_norm": 3.75, | |
| "learning_rate": 4.8316719039648816e-05, | |
| "loss": 2.372145652770996, | |
| "num_input_tokens_seen": 98304000, | |
| "step": 750, | |
| "train_runtime": 1488.8219, | |
| "train_tokens_per_second": 66028.046 | |
| }, | |
| { | |
| "epoch": 0.2742692168892097, | |
| "grad_norm": 3.40625, | |
| "learning_rate": 4.826416208231477e-05, | |
| "loss": 2.388836669921875, | |
| "num_input_tokens_seen": 99614720, | |
| "step": 760, | |
| "train_runtime": 1507.6902, | |
| "train_tokens_per_second": 66071.082 | |
| }, | |
| { | |
| "epoch": 0.277878022374594, | |
| "grad_norm": 2.96875, | |
| "learning_rate": 4.821082668283023e-05, | |
| "loss": 2.347779083251953, | |
| "num_input_tokens_seen": 100925440, | |
| "step": 770, | |
| "train_runtime": 1526.5377, | |
| "train_tokens_per_second": 66113.951 | |
| }, | |
| { | |
| "epoch": 0.28148682785997836, | |
| "grad_norm": 3.4375, | |
| "learning_rate": 4.815671462585106e-05, | |
| "loss": 2.340774154663086, | |
| "num_input_tokens_seen": 102236160, | |
| "step": 780, | |
| "train_runtime": 1545.3818, | |
| "train_tokens_per_second": 66155.925 | |
| }, | |
| { | |
| "epoch": 0.2850956333453627, | |
| "grad_norm": 3.46875, | |
| "learning_rate": 4.810182772202085e-05, | |
| "loss": 2.335291862487793, | |
| "num_input_tokens_seen": 103546880, | |
| "step": 790, | |
| "train_runtime": 1564.2273, | |
| "train_tokens_per_second": 66196.825 | |
| }, | |
| { | |
| "epoch": 0.28870443883074703, | |
| "grad_norm": 3.609375, | |
| "learning_rate": 4.8046167807910336e-05, | |
| "loss": 2.34542293548584, | |
| "num_input_tokens_seen": 104857600, | |
| "step": 800, | |
| "train_runtime": 1583.1024, | |
| "train_tokens_per_second": 66235.515 | |
| }, | |
| { | |
| "epoch": 0.29231324431613137, | |
| "grad_norm": 3.140625, | |
| "learning_rate": 4.798973674595597e-05, | |
| "loss": 2.357075881958008, | |
| "num_input_tokens_seen": 106168320, | |
| "step": 810, | |
| "train_runtime": 1604.6829, | |
| "train_tokens_per_second": 66161.559 | |
| }, | |
| { | |
| "epoch": 0.2959220498015157, | |
| "grad_norm": 3.59375, | |
| "learning_rate": 4.793253642439757e-05, | |
| "loss": 2.3224910736083983, | |
| "num_input_tokens_seen": 107479040, | |
| "step": 820, | |
| "train_runtime": 1623.514, | |
| "train_tokens_per_second": 66201.488 | |
| }, | |
| { | |
| "epoch": 0.29953085528690004, | |
| "grad_norm": 3.25, | |
| "learning_rate": 4.7874568757215156e-05, | |
| "loss": 2.3438846588134767, | |
| "num_input_tokens_seen": 108789760, | |
| "step": 830, | |
| "train_runtime": 1642.3671, | |
| "train_tokens_per_second": 66239.614 | |
| }, | |
| { | |
| "epoch": 0.3031396607722844, | |
| "grad_norm": 3.21875, | |
| "learning_rate": 4.781583568406488e-05, | |
| "loss": 2.357133674621582, | |
| "num_input_tokens_seen": 110100480, | |
| "step": 840, | |
| "train_runtime": 1661.2058, | |
| "train_tokens_per_second": 66277.448 | |
| }, | |
| { | |
| "epoch": 0.3067484662576687, | |
| "grad_norm": 3.46875, | |
| "learning_rate": 4.775633917021417e-05, | |
| "loss": 2.3187433242797852, | |
| "num_input_tokens_seen": 111411200, | |
| "step": 850, | |
| "train_runtime": 1680.0526, | |
| "train_tokens_per_second": 66314.114 | |
| }, | |
| { | |
| "epoch": 0.31035727174305305, | |
| "grad_norm": 2.5625, | |
| "learning_rate": 4.769608120647595e-05, | |
| "loss": 2.3682619094848634, | |
| "num_input_tokens_seen": 112721920, | |
| "step": 860, | |
| "train_runtime": 1698.8993, | |
| "train_tokens_per_second": 66349.972 | |
| }, | |
| { | |
| "epoch": 0.3139660772284374, | |
| "grad_norm": 3.8125, | |
| "learning_rate": 4.763506380914199e-05, | |
| "loss": 2.319541168212891, | |
| "num_input_tokens_seen": 114032640, | |
| "step": 870, | |
| "train_runtime": 1717.748, | |
| "train_tokens_per_second": 66384.963 | |
| }, | |
| { | |
| "epoch": 0.3175748827138217, | |
| "grad_norm": 4.46875, | |
| "learning_rate": 4.7573289019915477e-05, | |
| "loss": 2.335500717163086, | |
| "num_input_tokens_seen": 115343360, | |
| "step": 880, | |
| "train_runtime": 1736.5953, | |
| "train_tokens_per_second": 66419.253 | |
| }, | |
| { | |
| "epoch": 0.32118368819920606, | |
| "grad_norm": 3.0, | |
| "learning_rate": 4.75107589058427e-05, | |
| "loss": 2.282669448852539, | |
| "num_input_tokens_seen": 116654080, | |
| "step": 890, | |
| "train_runtime": 1755.439, | |
| "train_tokens_per_second": 66452.938 | |
| }, | |
| { | |
| "epoch": 0.3247924936845904, | |
| "grad_norm": 4.09375, | |
| "learning_rate": 4.744747555924387e-05, | |
| "loss": 2.335264778137207, | |
| "num_input_tokens_seen": 117964800, | |
| "step": 900, | |
| "train_runtime": 1774.2872, | |
| "train_tokens_per_second": 66485.743 | |
| }, | |
| { | |
| "epoch": 0.32840129916997474, | |
| "grad_norm": 3.078125, | |
| "learning_rate": 4.7383441097643115e-05, | |
| "loss": 2.3090591430664062, | |
| "num_input_tokens_seen": 119275520, | |
| "step": 910, | |
| "train_runtime": 1795.3767, | |
| "train_tokens_per_second": 66434.815 | |
| }, | |
| { | |
| "epoch": 0.3320101046553591, | |
| "grad_norm": 3.75, | |
| "learning_rate": 4.7318657663697606e-05, | |
| "loss": 2.3304624557495117, | |
| "num_input_tokens_seen": 120586240, | |
| "step": 920, | |
| "train_runtime": 1814.2347, | |
| "train_tokens_per_second": 66466.727 | |
| }, | |
| { | |
| "epoch": 0.3356189101407434, | |
| "grad_norm": 3.484375, | |
| "learning_rate": 4.725312742512591e-05, | |
| "loss": 2.3250059127807616, | |
| "num_input_tokens_seen": 121896960, | |
| "step": 930, | |
| "train_runtime": 1833.0853, | |
| "train_tokens_per_second": 66498.246 | |
| }, | |
| { | |
| "epoch": 0.33922771562612775, | |
| "grad_norm": 2.828125, | |
| "learning_rate": 4.7186852574635374e-05, | |
| "loss": 2.333821105957031, | |
| "num_input_tokens_seen": 123207680, | |
| "step": 940, | |
| "train_runtime": 1851.9408, | |
| "train_tokens_per_second": 66528.95 | |
| }, | |
| { | |
| "epoch": 0.3428365211115121, | |
| "grad_norm": 3.3125, | |
| "learning_rate": 4.711983532984887e-05, | |
| "loss": 2.338519477844238, | |
| "num_input_tokens_seen": 124518400, | |
| "step": 950, | |
| "train_runtime": 1870.7786, | |
| "train_tokens_per_second": 66559.666 | |
| }, | |
| { | |
| "epoch": 0.3464453265968964, | |
| "grad_norm": 5.09375, | |
| "learning_rate": 4.705207793323047e-05, | |
| "loss": 2.3416236877441405, | |
| "num_input_tokens_seen": 125829120, | |
| "step": 960, | |
| "train_runtime": 1889.6299, | |
| "train_tokens_per_second": 66589.295 | |
| }, | |
| { | |
| "epoch": 0.35005413208228076, | |
| "grad_norm": 2.796875, | |
| "learning_rate": 4.6983582652010495e-05, | |
| "loss": 2.3152448654174806, | |
| "num_input_tokens_seen": 127139840, | |
| "step": 970, | |
| "train_runtime": 1908.4704, | |
| "train_tokens_per_second": 66618.712 | |
| }, | |
| { | |
| "epoch": 0.3536629375676651, | |
| "grad_norm": 2.625, | |
| "learning_rate": 4.6914351778109624e-05, | |
| "loss": 2.3523880004882813, | |
| "num_input_tokens_seen": 128450560, | |
| "step": 980, | |
| "train_runtime": 1927.2914, | |
| "train_tokens_per_second": 66648.23 | |
| }, | |
| { | |
| "epoch": 0.35727174305304943, | |
| "grad_norm": 3.0625, | |
| "learning_rate": 4.6844387628062184e-05, | |
| "loss": 2.3372316360473633, | |
| "num_input_tokens_seen": 129761280, | |
| "step": 990, | |
| "train_runtime": 1946.1498, | |
| "train_tokens_per_second": 66675.894 | |
| }, | |
| { | |
| "epoch": 0.36088054853843377, | |
| "grad_norm": 3.84375, | |
| "learning_rate": 4.6773692542938674e-05, | |
| "loss": 2.354751777648926, | |
| "num_input_tokens_seen": 131072000, | |
| "step": 1000, | |
| "train_runtime": 1964.9866, | |
| "train_tokens_per_second": 66703.762 | |
| }, | |
| { | |
| "epoch": 0.3644893540238181, | |
| "grad_norm": 2.578125, | |
| "learning_rate": 4.670226888826742e-05, | |
| "loss": 2.3818334579467773, | |
| "num_input_tokens_seen": 132382720, | |
| "step": 1010, | |
| "train_runtime": 1987.7787, | |
| "train_tokens_per_second": 66598.32 | |
| }, | |
| { | |
| "epoch": 0.36809815950920244, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 4.663011905395538e-05, | |
| "loss": 2.3537199020385744, | |
| "num_input_tokens_seen": 133693440, | |
| "step": 1020, | |
| "train_runtime": 2006.614, | |
| "train_tokens_per_second": 66626.388 | |
| }, | |
| { | |
| "epoch": 0.3717069649945868, | |
| "grad_norm": 2.25, | |
| "learning_rate": 4.655724545420826e-05, | |
| "loss": 2.310554313659668, | |
| "num_input_tokens_seen": 135004160, | |
| "step": 1030, | |
| "train_runtime": 2025.4588, | |
| "train_tokens_per_second": 66653.621 | |
| }, | |
| { | |
| "epoch": 0.3753157704799711, | |
| "grad_norm": 4.21875, | |
| "learning_rate": 4.648365052744962e-05, | |
| "loss": 2.2933753967285155, | |
| "num_input_tokens_seen": 136314880, | |
| "step": 1040, | |
| "train_runtime": 2044.3059, | |
| "train_tokens_per_second": 66680.276 | |
| }, | |
| { | |
| "epoch": 0.37892457596535545, | |
| "grad_norm": 3.0625, | |
| "learning_rate": 4.640933673623939e-05, | |
| "loss": 2.312954902648926, | |
| "num_input_tokens_seen": 137625600, | |
| "step": 1050, | |
| "train_runtime": 2063.1496, | |
| "train_tokens_per_second": 66706.553 | |
| }, | |
| { | |
| "epoch": 0.3825333814507398, | |
| "grad_norm": 4.28125, | |
| "learning_rate": 4.633430656719143e-05, | |
| "loss": 2.3173431396484374, | |
| "num_input_tokens_seen": 138936320, | |
| "step": 1060, | |
| "train_runtime": 2081.9779, | |
| "train_tokens_per_second": 66732.85 | |
| }, | |
| { | |
| "epoch": 0.3861421869361241, | |
| "grad_norm": 2.984375, | |
| "learning_rate": 4.625856253089028e-05, | |
| "loss": 2.2680578231811523, | |
| "num_input_tokens_seen": 140247040, | |
| "step": 1070, | |
| "train_runtime": 2100.8155, | |
| "train_tokens_per_second": 66758.379 | |
| }, | |
| { | |
| "epoch": 0.38975099242150846, | |
| "grad_norm": 3.1875, | |
| "learning_rate": 4.618210716180722e-05, | |
| "loss": 2.310435104370117, | |
| "num_input_tokens_seen": 141557760, | |
| "step": 1080, | |
| "train_runtime": 2119.6597, | |
| "train_tokens_per_second": 66783.249 | |
| }, | |
| { | |
| "epoch": 0.3933597979068928, | |
| "grad_norm": 3.21875, | |
| "learning_rate": 4.610494301821543e-05, | |
| "loss": 2.3136465072631838, | |
| "num_input_tokens_seen": 142868480, | |
| "step": 1090, | |
| "train_runtime": 2138.482, | |
| "train_tokens_per_second": 66808.362 | |
| }, | |
| { | |
| "epoch": 0.39696860339227713, | |
| "grad_norm": 3.265625, | |
| "learning_rate": 4.60270726821044e-05, | |
| "loss": 2.3062191009521484, | |
| "num_input_tokens_seen": 144179200, | |
| "step": 1100, | |
| "train_runtime": 2157.298, | |
| "train_tokens_per_second": 66833.233 | |
| }, | |
| { | |
| "epoch": 0.40057740887766147, | |
| "grad_norm": 3.46875, | |
| "learning_rate": 4.594849875909351e-05, | |
| "loss": 2.311140251159668, | |
| "num_input_tokens_seen": 145489920, | |
| "step": 1110, | |
| "train_runtime": 2178.7661, | |
| "train_tokens_per_second": 66776.292 | |
| }, | |
| { | |
| "epoch": 0.40418621436304586, | |
| "grad_norm": 2.96875, | |
| "learning_rate": 4.586922387834489e-05, | |
| "loss": 2.275248336791992, | |
| "num_input_tokens_seen": 146800640, | |
| "step": 1120, | |
| "train_runtime": 2197.586, | |
| "train_tokens_per_second": 66800.864 | |
| }, | |
| { | |
| "epoch": 0.4077950198484302, | |
| "grad_norm": 2.59375, | |
| "learning_rate": 4.5789250692475396e-05, | |
| "loss": 2.3349634170532227, | |
| "num_input_tokens_seen": 148111360, | |
| "step": 1130, | |
| "train_runtime": 2216.4069, | |
| "train_tokens_per_second": 66824.986 | |
| }, | |
| { | |
| "epoch": 0.41140382533381453, | |
| "grad_norm": 3.046875, | |
| "learning_rate": 4.5708581877467884e-05, | |
| "loss": 2.297293853759766, | |
| "num_input_tokens_seen": 149422080, | |
| "step": 1140, | |
| "train_runtime": 2235.2207, | |
| "train_tokens_per_second": 66848.914 | |
| }, | |
| { | |
| "epoch": 0.41501263081919887, | |
| "grad_norm": 3.515625, | |
| "learning_rate": 4.5627220132581646e-05, | |
| "loss": 2.3298309326171873, | |
| "num_input_tokens_seen": 150732800, | |
| "step": 1150, | |
| "train_runtime": 2254.0417, | |
| "train_tokens_per_second": 66872.231 | |
| }, | |
| { | |
| "epoch": 0.4186214363045832, | |
| "grad_norm": 2.515625, | |
| "learning_rate": 4.554516818026212e-05, | |
| "loss": 2.3104930877685548, | |
| "num_input_tokens_seen": 152043520, | |
| "step": 1160, | |
| "train_runtime": 2272.8631, | |
| "train_tokens_per_second": 66895.152 | |
| }, | |
| { | |
| "epoch": 0.42223024178996754, | |
| "grad_norm": 2.765625, | |
| "learning_rate": 4.546242876604976e-05, | |
| "loss": 2.2972536087036133, | |
| "num_input_tokens_seen": 153354240, | |
| "step": 1170, | |
| "train_runtime": 2291.6783, | |
| "train_tokens_per_second": 66917.875 | |
| }, | |
| { | |
| "epoch": 0.4258390472753519, | |
| "grad_norm": 2.78125, | |
| "learning_rate": 4.5379004658488175e-05, | |
| "loss": 2.274612617492676, | |
| "num_input_tokens_seen": 154664960, | |
| "step": 1180, | |
| "train_runtime": 2310.5193, | |
| "train_tokens_per_second": 66939.481 | |
| }, | |
| { | |
| "epoch": 0.4294478527607362, | |
| "grad_norm": 2.125, | |
| "learning_rate": 4.5294898649031515e-05, | |
| "loss": 2.28421630859375, | |
| "num_input_tokens_seen": 155975680, | |
| "step": 1190, | |
| "train_runtime": 2329.3618, | |
| "train_tokens_per_second": 66960.694 | |
| }, | |
| { | |
| "epoch": 0.43305665824612055, | |
| "grad_norm": 3.171875, | |
| "learning_rate": 4.521011355195106e-05, | |
| "loss": 2.290935516357422, | |
| "num_input_tokens_seen": 157286400, | |
| "step": 1200, | |
| "train_runtime": 2348.186, | |
| "train_tokens_per_second": 66982.087 | |
| }, | |
| { | |
| "epoch": 0.4366654637315049, | |
| "grad_norm": 2.78125, | |
| "learning_rate": 4.5124652204241016e-05, | |
| "loss": 2.308019828796387, | |
| "num_input_tokens_seen": 158597120, | |
| "step": 1210, | |
| "train_runtime": 2369.5346, | |
| "train_tokens_per_second": 66931.759 | |
| }, | |
| { | |
| "epoch": 0.4402742692168892, | |
| "grad_norm": 2.5, | |
| "learning_rate": 4.503851746552362e-05, | |
| "loss": 2.3127092361450194, | |
| "num_input_tokens_seen": 159907840, | |
| "step": 1220, | |
| "train_runtime": 2388.3658, | |
| "train_tokens_per_second": 66952.827 | |
| }, | |
| { | |
| "epoch": 0.44388307470227356, | |
| "grad_norm": 3.0625, | |
| "learning_rate": 4.4951712217953454e-05, | |
| "loss": 2.3049333572387694, | |
| "num_input_tokens_seen": 161218560, | |
| "step": 1230, | |
| "train_runtime": 2407.1991, | |
| "train_tokens_per_second": 66973.506 | |
| }, | |
| { | |
| "epoch": 0.4474918801876579, | |
| "grad_norm": 3.484375, | |
| "learning_rate": 4.486423936612101e-05, | |
| "loss": 2.2997787475585936, | |
| "num_input_tokens_seen": 162529280, | |
| "step": 1240, | |
| "train_runtime": 2426.0318, | |
| "train_tokens_per_second": 66993.878 | |
| }, | |
| { | |
| "epoch": 0.45110068567304223, | |
| "grad_norm": 3.875, | |
| "learning_rate": 4.477610183695543e-05, | |
| "loss": 2.3207189559936525, | |
| "num_input_tokens_seen": 163840000, | |
| "step": 1250, | |
| "train_runtime": 2444.8663, | |
| "train_tokens_per_second": 67013.89 | |
| }, | |
| { | |
| "epoch": 0.45470949115842657, | |
| "grad_norm": 2.71875, | |
| "learning_rate": 4.4687302579626706e-05, | |
| "loss": 2.2699203491210938, | |
| "num_input_tokens_seen": 165150720, | |
| "step": 1260, | |
| "train_runtime": 2463.704, | |
| "train_tokens_per_second": 67033.508 | |
| }, | |
| { | |
| "epoch": 0.4583182966438109, | |
| "grad_norm": 3.703125, | |
| "learning_rate": 4.459784456544685e-05, | |
| "loss": 2.281772994995117, | |
| "num_input_tokens_seen": 166461440, | |
| "step": 1270, | |
| "train_runtime": 2482.5216, | |
| "train_tokens_per_second": 67053.37 | |
| }, | |
| { | |
| "epoch": 0.46192710212919524, | |
| "grad_norm": 2.65625, | |
| "learning_rate": 4.4507730787770575e-05, | |
| "loss": 2.280086898803711, | |
| "num_input_tokens_seen": 167772160, | |
| "step": 1280, | |
| "train_runtime": 2501.3419, | |
| "train_tokens_per_second": 67072.862 | |
| }, | |
| { | |
| "epoch": 0.4655359076145796, | |
| "grad_norm": 2.296875, | |
| "learning_rate": 4.441696426189508e-05, | |
| "loss": 2.304541015625, | |
| "num_input_tokens_seen": 169082880, | |
| "step": 1290, | |
| "train_runtime": 2520.1698, | |
| "train_tokens_per_second": 67091.859 | |
| }, | |
| { | |
| "epoch": 0.4691447130999639, | |
| "grad_norm": 1.9375, | |
| "learning_rate": 4.432554802495917e-05, | |
| "loss": 2.3161603927612306, | |
| "num_input_tokens_seen": 170393600, | |
| "step": 1300, | |
| "train_runtime": 2538.9965, | |
| "train_tokens_per_second": 67110.609 | |
| }, | |
| { | |
| "epoch": 0.47275351858534825, | |
| "grad_norm": 2.4375, | |
| "learning_rate": 4.423348513584166e-05, | |
| "loss": 2.3051275253295898, | |
| "num_input_tokens_seen": 171704320, | |
| "step": 1310, | |
| "train_runtime": 2560.6455, | |
| "train_tokens_per_second": 67055.093 | |
| }, | |
| { | |
| "epoch": 0.4763623240707326, | |
| "grad_norm": 3.046875, | |
| "learning_rate": 4.414077867505895e-05, | |
| "loss": 2.2651365280151365, | |
| "num_input_tokens_seen": 173015040, | |
| "step": 1320, | |
| "train_runtime": 2579.4505, | |
| "train_tokens_per_second": 67074.378 | |
| }, | |
| { | |
| "epoch": 0.4799711295561169, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 4.4047431744662035e-05, | |
| "loss": 2.270708465576172, | |
| "num_input_tokens_seen": 174325760, | |
| "step": 1330, | |
| "train_runtime": 2598.2436, | |
| "train_tokens_per_second": 67093.694 | |
| }, | |
| { | |
| "epoch": 0.48357993504150126, | |
| "grad_norm": 2.296875, | |
| "learning_rate": 4.395344746813263e-05, | |
| "loss": 2.3111730575561524, | |
| "num_input_tokens_seen": 175636480, | |
| "step": 1340, | |
| "train_runtime": 2617.0378, | |
| "train_tokens_per_second": 67112.704 | |
| }, | |
| { | |
| "epoch": 0.4871887405268856, | |
| "grad_norm": 2.96875, | |
| "learning_rate": 4.3858828990278725e-05, | |
| "loss": 2.2733327865600588, | |
| "num_input_tokens_seen": 176947200, | |
| "step": 1350, | |
| "train_runtime": 2635.8228, | |
| "train_tokens_per_second": 67131.675 | |
| }, | |
| { | |
| "epoch": 0.49079754601226994, | |
| "grad_norm": 3.390625, | |
| "learning_rate": 4.376357947712929e-05, | |
| "loss": 2.228657531738281, | |
| "num_input_tokens_seen": 178257920, | |
| "step": 1360, | |
| "train_runtime": 2654.6177, | |
| "train_tokens_per_second": 67150.129 | |
| }, | |
| { | |
| "epoch": 0.4944063514976543, | |
| "grad_norm": 2.828125, | |
| "learning_rate": 4.366770211582837e-05, | |
| "loss": 2.281584358215332, | |
| "num_input_tokens_seen": 179568640, | |
| "step": 1370, | |
| "train_runtime": 2673.4148, | |
| "train_tokens_per_second": 67168.267 | |
| }, | |
| { | |
| "epoch": 0.4980151569830386, | |
| "grad_norm": 2.8125, | |
| "learning_rate": 4.357120011452846e-05, | |
| "loss": 2.324570083618164, | |
| "num_input_tokens_seen": 180879360, | |
| "step": 1380, | |
| "train_runtime": 2692.2055, | |
| "train_tokens_per_second": 67186.312 | |
| }, | |
| { | |
| "epoch": 0.501623962468423, | |
| "grad_norm": 2.578125, | |
| "learning_rate": 4.347407670228312e-05, | |
| "loss": 2.3087745666503907, | |
| "num_input_tokens_seen": 182190080, | |
| "step": 1390, | |
| "train_runtime": 2710.9858, | |
| "train_tokens_per_second": 67204.366 | |
| }, | |
| { | |
| "epoch": 0.5052327679538073, | |
| "grad_norm": 2.578125, | |
| "learning_rate": 4.337633512893893e-05, | |
| "loss": 2.241712760925293, | |
| "num_input_tokens_seen": 183500800, | |
| "step": 1400, | |
| "train_runtime": 2729.7708, | |
| "train_tokens_per_second": 67222.053 | |
| }, | |
| { | |
| "epoch": 0.5088415734391917, | |
| "grad_norm": 3.546875, | |
| "learning_rate": 4.3277978665026785e-05, | |
| "loss": 2.327380561828613, | |
| "num_input_tokens_seen": 184811520, | |
| "step": 1410, | |
| "train_runtime": 2751.2471, | |
| "train_tokens_per_second": 67173.727 | |
| }, | |
| { | |
| "epoch": 0.512450378924576, | |
| "grad_norm": 2.796875, | |
| "learning_rate": 4.3179010601652424e-05, | |
| "loss": 2.29742431640625, | |
| "num_input_tokens_seen": 186122240, | |
| "step": 1420, | |
| "train_runtime": 2770.0302, | |
| "train_tokens_per_second": 67191.412 | |
| }, | |
| { | |
| "epoch": 0.5160591844099603, | |
| "grad_norm": 3.5, | |
| "learning_rate": 4.30794342503863e-05, | |
| "loss": 2.2658599853515624, | |
| "num_input_tokens_seen": 187432960, | |
| "step": 1430, | |
| "train_runtime": 2788.8469, | |
| "train_tokens_per_second": 67208.05 | |
| }, | |
| { | |
| "epoch": 0.5196679898953447, | |
| "grad_norm": 2.796875, | |
| "learning_rate": 4.2979252943152815e-05, | |
| "loss": 2.249949073791504, | |
| "num_input_tokens_seen": 188743680, | |
| "step": 1440, | |
| "train_runtime": 2807.6459, | |
| "train_tokens_per_second": 67224.887 | |
| }, | |
| { | |
| "epoch": 0.523276795380729, | |
| "grad_norm": 2.4375, | |
| "learning_rate": 4.287847003211878e-05, | |
| "loss": 2.2962003707885743, | |
| "num_input_tokens_seen": 190054400, | |
| "step": 1450, | |
| "train_runtime": 2826.4466, | |
| "train_tokens_per_second": 67241.462 | |
| }, | |
| { | |
| "epoch": 0.5268856008661134, | |
| "grad_norm": 2.375, | |
| "learning_rate": 4.27770888895813e-05, | |
| "loss": 2.2966489791870117, | |
| "num_input_tokens_seen": 191365120, | |
| "step": 1460, | |
| "train_runtime": 2845.2424, | |
| "train_tokens_per_second": 67257.931 | |
| }, | |
| { | |
| "epoch": 0.5304944063514977, | |
| "grad_norm": 1.9453125, | |
| "learning_rate": 4.267511290785485e-05, | |
| "loss": 2.2982467651367187, | |
| "num_input_tokens_seen": 192675840, | |
| "step": 1470, | |
| "train_runtime": 2864.0538, | |
| "train_tokens_per_second": 67273.82 | |
| }, | |
| { | |
| "epoch": 0.534103211836882, | |
| "grad_norm": 2.640625, | |
| "learning_rate": 4.257254549915789e-05, | |
| "loss": 2.310243606567383, | |
| "num_input_tokens_seen": 193986560, | |
| "step": 1480, | |
| "train_runtime": 2882.8542, | |
| "train_tokens_per_second": 67289.757 | |
| }, | |
| { | |
| "epoch": 0.5377120173222664, | |
| "grad_norm": 2.453125, | |
| "learning_rate": 4.246939009549856e-05, | |
| "loss": 2.3411497116088866, | |
| "num_input_tokens_seen": 195297280, | |
| "step": 1490, | |
| "train_runtime": 2901.6511, | |
| "train_tokens_per_second": 67305.569 | |
| }, | |
| { | |
| "epoch": 0.5413208228076507, | |
| "grad_norm": 2.859375, | |
| "learning_rate": 4.2365650148559946e-05, | |
| "loss": 2.2888193130493164, | |
| "num_input_tokens_seen": 196608000, | |
| "step": 1500, | |
| "train_runtime": 2920.4506, | |
| "train_tokens_per_second": 67321.118 | |
| }, | |
| { | |
| "epoch": 0.544929628293035, | |
| "grad_norm": 2.625, | |
| "learning_rate": 4.2261329129584495e-05, | |
| "loss": 2.278774452209473, | |
| "num_input_tokens_seen": 197918720, | |
| "step": 1510, | |
| "train_runtime": 2944.0498, | |
| "train_tokens_per_second": 67226.689 | |
| }, | |
| { | |
| "epoch": 0.5485384337784194, | |
| "grad_norm": 2.359375, | |
| "learning_rate": 4.215643052925795e-05, | |
| "loss": 2.2698015213012694, | |
| "num_input_tokens_seen": 199229440, | |
| "step": 1520, | |
| "train_runtime": 2962.8554, | |
| "train_tokens_per_second": 67242.376 | |
| }, | |
| { | |
| "epoch": 0.5521472392638037, | |
| "grad_norm": 2.65625, | |
| "learning_rate": 4.2050957857592456e-05, | |
| "loss": 2.319766044616699, | |
| "num_input_tokens_seen": 200540160, | |
| "step": 1530, | |
| "train_runtime": 2981.6581, | |
| "train_tokens_per_second": 67257.934 | |
| }, | |
| { | |
| "epoch": 0.555756044749188, | |
| "grad_norm": 3.484375, | |
| "learning_rate": 4.194491464380919e-05, | |
| "loss": 2.2656042098999025, | |
| "num_input_tokens_seen": 201850880, | |
| "step": 1540, | |
| "train_runtime": 3000.4623, | |
| "train_tokens_per_second": 67273.26 | |
| }, | |
| { | |
| "epoch": 0.5593648502345724, | |
| "grad_norm": 2.75, | |
| "learning_rate": 4.1838304436220246e-05, | |
| "loss": 2.31202392578125, | |
| "num_input_tokens_seen": 203161600, | |
| "step": 1550, | |
| "train_runtime": 3019.2523, | |
| "train_tokens_per_second": 67288.712 | |
| }, | |
| { | |
| "epoch": 0.5629736557199567, | |
| "grad_norm": 2.953125, | |
| "learning_rate": 4.1731130802109863e-05, | |
| "loss": 2.211695098876953, | |
| "num_input_tokens_seen": 204472320, | |
| "step": 1560, | |
| "train_runtime": 3038.0539, | |
| "train_tokens_per_second": 67303.718 | |
| }, | |
| { | |
| "epoch": 0.5665824612053411, | |
| "grad_norm": 2.5625, | |
| "learning_rate": 4.162339732761514e-05, | |
| "loss": 2.27321720123291, | |
| "num_input_tokens_seen": 205783040, | |
| "step": 1570, | |
| "train_runtime": 3056.8504, | |
| "train_tokens_per_second": 67318.65 | |
| }, | |
| { | |
| "epoch": 0.5701912666907254, | |
| "grad_norm": 2.71875, | |
| "learning_rate": 4.151510761760597e-05, | |
| "loss": 2.234796142578125, | |
| "num_input_tokens_seen": 207093760, | |
| "step": 1580, | |
| "train_runtime": 3075.6457, | |
| "train_tokens_per_second": 67333.424 | |
| }, | |
| { | |
| "epoch": 0.5738000721761097, | |
| "grad_norm": 3.15625, | |
| "learning_rate": 4.140626529556444e-05, | |
| "loss": 2.2829927444458007, | |
| "num_input_tokens_seen": 208404480, | |
| "step": 1590, | |
| "train_runtime": 3094.4579, | |
| "train_tokens_per_second": 67347.654 | |
| }, | |
| { | |
| "epoch": 0.5774088776614941, | |
| "grad_norm": 2.59375, | |
| "learning_rate": 4.12968740034636e-05, | |
| "loss": 2.2796735763549805, | |
| "num_input_tokens_seen": 209715200, | |
| "step": 1600, | |
| "train_runtime": 3113.2505, | |
| "train_tokens_per_second": 67362.135 | |
| }, | |
| { | |
| "epoch": 0.5810176831468784, | |
| "grad_norm": 2.578125, | |
| "learning_rate": 4.118693740164558e-05, | |
| "loss": 2.2237993240356446, | |
| "num_input_tokens_seen": 211025920, | |
| "step": 1610, | |
| "train_runtime": 3135.5028, | |
| "train_tokens_per_second": 67302.099 | |
| }, | |
| { | |
| "epoch": 0.5846264886322627, | |
| "grad_norm": 1.953125, | |
| "learning_rate": 4.107645916869913e-05, | |
| "loss": 2.297933578491211, | |
| "num_input_tokens_seen": 212336640, | |
| "step": 1620, | |
| "train_runtime": 3154.2925, | |
| "train_tokens_per_second": 67316.725 | |
| }, | |
| { | |
| "epoch": 0.5882352941176471, | |
| "grad_norm": 2.625, | |
| "learning_rate": 4.09654430013365e-05, | |
| "loss": 2.2486343383789062, | |
| "num_input_tokens_seen": 213647360, | |
| "step": 1630, | |
| "train_runtime": 3173.0663, | |
| "train_tokens_per_second": 67331.515 | |
| }, | |
| { | |
| "epoch": 0.5918440996030314, | |
| "grad_norm": 2.9375, | |
| "learning_rate": 4.085389261426979e-05, | |
| "loss": 2.2843048095703127, | |
| "num_input_tokens_seen": 214958080, | |
| "step": 1640, | |
| "train_runtime": 3191.834, | |
| "train_tokens_per_second": 67346.258 | |
| }, | |
| { | |
| "epoch": 0.5954529050884158, | |
| "grad_norm": 3.15625, | |
| "learning_rate": 4.07418117400866e-05, | |
| "loss": 2.2387674331665037, | |
| "num_input_tokens_seen": 216268800, | |
| "step": 1650, | |
| "train_runtime": 3210.6231, | |
| "train_tokens_per_second": 67360.383 | |
| }, | |
| { | |
| "epoch": 0.5990617105738001, | |
| "grad_norm": 2.125, | |
| "learning_rate": 4.062920412912517e-05, | |
| "loss": 2.281134033203125, | |
| "num_input_tokens_seen": 217579520, | |
| "step": 1660, | |
| "train_runtime": 3229.3938, | |
| "train_tokens_per_second": 67374.726 | |
| }, | |
| { | |
| "epoch": 0.6026705160591844, | |
| "grad_norm": 2.359375, | |
| "learning_rate": 4.05160735493489e-05, | |
| "loss": 2.233013725280762, | |
| "num_input_tokens_seen": 218890240, | |
| "step": 1670, | |
| "train_runtime": 3248.1617, | |
| "train_tokens_per_second": 67388.961 | |
| }, | |
| { | |
| "epoch": 0.6062793215445688, | |
| "grad_norm": 3.328125, | |
| "learning_rate": 4.040242378622021e-05, | |
| "loss": 2.2088239669799803, | |
| "num_input_tokens_seen": 220200960, | |
| "step": 1680, | |
| "train_runtime": 3266.937, | |
| "train_tokens_per_second": 67402.879 | |
| }, | |
| { | |
| "epoch": 0.6098881270299531, | |
| "grad_norm": 2.390625, | |
| "learning_rate": 4.0288258642573956e-05, | |
| "loss": 2.2553569793701174, | |
| "num_input_tokens_seen": 221511680, | |
| "step": 1690, | |
| "train_runtime": 3285.7066, | |
| "train_tokens_per_second": 67416.756 | |
| }, | |
| { | |
| "epoch": 0.6134969325153374, | |
| "grad_norm": 2.46875, | |
| "learning_rate": 4.017358193849011e-05, | |
| "loss": 2.280741500854492, | |
| "num_input_tokens_seen": 222822400, | |
| "step": 1700, | |
| "train_runtime": 3304.4697, | |
| "train_tokens_per_second": 67430.608 | |
| }, | |
| { | |
| "epoch": 0.6171057380007218, | |
| "grad_norm": 2.421875, | |
| "learning_rate": 4.005839751116599e-05, | |
| "loss": 2.289920425415039, | |
| "num_input_tokens_seen": 224133120, | |
| "step": 1710, | |
| "train_runtime": 3325.6911, | |
| "train_tokens_per_second": 67394.45 | |
| }, | |
| { | |
| "epoch": 0.6207145434861061, | |
| "grad_norm": 2.609375, | |
| "learning_rate": 3.994270921478783e-05, | |
| "loss": 2.268573760986328, | |
| "num_input_tokens_seen": 225443840, | |
| "step": 1720, | |
| "train_runtime": 3344.471, | |
| "train_tokens_per_second": 67407.922 | |
| }, | |
| { | |
| "epoch": 0.6243233489714904, | |
| "grad_norm": 2.75, | |
| "learning_rate": 3.982652092040182e-05, | |
| "loss": 2.285994529724121, | |
| "num_input_tokens_seen": 226754560, | |
| "step": 1730, | |
| "train_runtime": 3363.2536, | |
| "train_tokens_per_second": 67421.191 | |
| }, | |
| { | |
| "epoch": 0.6279321544568748, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 3.97098365157846e-05, | |
| "loss": 2.289227294921875, | |
| "num_input_tokens_seen": 228065280, | |
| "step": 1740, | |
| "train_runtime": 3382.0456, | |
| "train_tokens_per_second": 67434.123 | |
| }, | |
| { | |
| "epoch": 0.6315409599422591, | |
| "grad_norm": 2.703125, | |
| "learning_rate": 3.959265990531317e-05, | |
| "loss": 2.2562992095947267, | |
| "num_input_tokens_seen": 229376000, | |
| "step": 1750, | |
| "train_runtime": 3400.853, | |
| "train_tokens_per_second": 67446.609 | |
| }, | |
| { | |
| "epoch": 0.6351497654276435, | |
| "grad_norm": 2.265625, | |
| "learning_rate": 3.947499500983417e-05, | |
| "loss": 2.248988151550293, | |
| "num_input_tokens_seen": 230686720, | |
| "step": 1760, | |
| "train_runtime": 3419.6339, | |
| "train_tokens_per_second": 67459.479 | |
| }, | |
| { | |
| "epoch": 0.6387585709130278, | |
| "grad_norm": 2.890625, | |
| "learning_rate": 3.9356845766532805e-05, | |
| "loss": 2.262241744995117, | |
| "num_input_tokens_seen": 231997440, | |
| "step": 1770, | |
| "train_runtime": 3438.4228, | |
| "train_tokens_per_second": 67472.051 | |
| }, | |
| { | |
| "epoch": 0.6423673763984121, | |
| "grad_norm": 2.796875, | |
| "learning_rate": 3.923821612880102e-05, | |
| "loss": 2.247925567626953, | |
| "num_input_tokens_seen": 233308160, | |
| "step": 1780, | |
| "train_runtime": 3457.2112, | |
| "train_tokens_per_second": 67484.498 | |
| }, | |
| { | |
| "epoch": 0.6459761818837965, | |
| "grad_norm": 2.328125, | |
| "learning_rate": 3.911911006610525e-05, | |
| "loss": 2.256356048583984, | |
| "num_input_tokens_seen": 234618880, | |
| "step": 1790, | |
| "train_runtime": 3475.9969, | |
| "train_tokens_per_second": 67496.862 | |
| }, | |
| { | |
| "epoch": 0.6495849873691808, | |
| "grad_norm": 2.59375, | |
| "learning_rate": 3.899953156385355e-05, | |
| "loss": 2.3100183486938475, | |
| "num_input_tokens_seen": 235929600, | |
| "step": 1800, | |
| "train_runtime": 3494.7778, | |
| "train_tokens_per_second": 67509.185 | |
| }, | |
| { | |
| "epoch": 0.6531937928545651, | |
| "grad_norm": 2.640625, | |
| "learning_rate": 3.8879484623262335e-05, | |
| "loss": 2.2395404815673827, | |
| "num_input_tokens_seen": 237240320, | |
| "step": 1810, | |
| "train_runtime": 3517.2255, | |
| "train_tokens_per_second": 67450.983 | |
| }, | |
| { | |
| "epoch": 0.6568025983399495, | |
| "grad_norm": 2.40625, | |
| "learning_rate": 3.8758973261222385e-05, | |
| "loss": 2.284636878967285, | |
| "num_input_tokens_seen": 238551040, | |
| "step": 1820, | |
| "train_runtime": 3536.0096, | |
| "train_tokens_per_second": 67463.346 | |
| }, | |
| { | |
| "epoch": 0.6604114038253338, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 3.863800151016451e-05, | |
| "loss": 2.2737716674804687, | |
| "num_input_tokens_seen": 239861760, | |
| "step": 1830, | |
| "train_runtime": 3554.7927, | |
| "train_tokens_per_second": 67475.598 | |
| }, | |
| { | |
| "epoch": 0.6640202093107181, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 3.851657341792458e-05, | |
| "loss": 2.3030860900878904, | |
| "num_input_tokens_seen": 241172480, | |
| "step": 1840, | |
| "train_runtime": 3573.5693, | |
| "train_tokens_per_second": 67487.842 | |
| }, | |
| { | |
| "epoch": 0.6676290147961025, | |
| "grad_norm": 2.875, | |
| "learning_rate": 3.839469304760813e-05, | |
| "loss": 2.274905204772949, | |
| "num_input_tokens_seen": 242483200, | |
| "step": 1850, | |
| "train_runtime": 3592.357, | |
| "train_tokens_per_second": 67499.751 | |
| }, | |
| { | |
| "epoch": 0.6712378202814868, | |
| "grad_norm": 3.28125, | |
| "learning_rate": 3.8272364477454344e-05, | |
| "loss": 2.2486251831054687, | |
| "num_input_tokens_seen": 243793920, | |
| "step": 1860, | |
| "train_runtime": 3611.1487, | |
| "train_tokens_per_second": 67511.46 | |
| }, | |
| { | |
| "epoch": 0.6748466257668712, | |
| "grad_norm": 2.53125, | |
| "learning_rate": 3.814959180069962e-05, | |
| "loss": 2.3203054428100587, | |
| "num_input_tokens_seen": 245104640, | |
| "step": 1870, | |
| "train_runtime": 3629.9298, | |
| "train_tokens_per_second": 67523.246 | |
| }, | |
| { | |
| "epoch": 0.6784554312522555, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 3.802637912544063e-05, | |
| "loss": 2.275309371948242, | |
| "num_input_tokens_seen": 246415360, | |
| "step": 1880, | |
| "train_runtime": 3648.7165, | |
| "train_tokens_per_second": 67534.805 | |
| }, | |
| { | |
| "epoch": 0.6820642367376398, | |
| "grad_norm": 2.71875, | |
| "learning_rate": 3.7902730574496804e-05, | |
| "loss": 2.259540557861328, | |
| "num_input_tokens_seen": 247726080, | |
| "step": 1890, | |
| "train_runtime": 3667.5018, | |
| "train_tokens_per_second": 67546.274 | |
| }, | |
| { | |
| "epoch": 0.6856730422230242, | |
| "grad_norm": 2.984375, | |
| "learning_rate": 3.777865028527245e-05, | |
| "loss": 2.2632009506225588, | |
| "num_input_tokens_seen": 249036800, | |
| "step": 1900, | |
| "train_runtime": 3686.2853, | |
| "train_tokens_per_second": 67557.658 | |
| }, | |
| { | |
| "epoch": 0.6892818477084085, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 3.765414240961824e-05, | |
| "loss": 2.2605398178100584, | |
| "num_input_tokens_seen": 250347520, | |
| "step": 1910, | |
| "train_runtime": 3708.6088, | |
| "train_tokens_per_second": 67504.428 | |
| }, | |
| { | |
| "epoch": 0.6928906531937928, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 3.7529211113692316e-05, | |
| "loss": 2.2630123138427733, | |
| "num_input_tokens_seen": 251658240, | |
| "step": 1920, | |
| "train_runtime": 3727.3827, | |
| "train_tokens_per_second": 67516.072 | |
| }, | |
| { | |
| "epoch": 0.6964994586791772, | |
| "grad_norm": 2.765625, | |
| "learning_rate": 3.7403860577820906e-05, | |
| "loss": 2.2614559173583983, | |
| "num_input_tokens_seen": 252968960, | |
| "step": 1930, | |
| "train_runtime": 3746.1659, | |
| "train_tokens_per_second": 67527.432 | |
| }, | |
| { | |
| "epoch": 0.7001082641645615, | |
| "grad_norm": 2.4375, | |
| "learning_rate": 3.727809499635841e-05, | |
| "loss": 2.271468162536621, | |
| "num_input_tokens_seen": 254279680, | |
| "step": 1940, | |
| "train_runtime": 3764.9463, | |
| "train_tokens_per_second": 67538.726 | |
| }, | |
| { | |
| "epoch": 0.7037170696499458, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 3.715191857754707e-05, | |
| "loss": 2.259329414367676, | |
| "num_input_tokens_seen": 255590400, | |
| "step": 1950, | |
| "train_runtime": 3783.7308, | |
| "train_tokens_per_second": 67549.837 | |
| }, | |
| { | |
| "epoch": 0.7073258751353302, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 3.702533554337618e-05, | |
| "loss": 2.255583381652832, | |
| "num_input_tokens_seen": 256901120, | |
| "step": 1960, | |
| "train_runtime": 3802.5028, | |
| "train_tokens_per_second": 67561.059 | |
| }, | |
| { | |
| "epoch": 0.7109346806207145, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 3.6898350129440745e-05, | |
| "loss": 2.227895164489746, | |
| "num_input_tokens_seen": 258211840, | |
| "step": 1970, | |
| "train_runtime": 3821.2826, | |
| "train_tokens_per_second": 67572.034 | |
| }, | |
| { | |
| "epoch": 0.7145434861060989, | |
| "grad_norm": 2.6875, | |
| "learning_rate": 3.6770966584799845e-05, | |
| "loss": 2.2536853790283202, | |
| "num_input_tokens_seen": 259522560, | |
| "step": 1980, | |
| "train_runtime": 3840.0617, | |
| "train_tokens_per_second": 67582.914 | |
| }, | |
| { | |
| "epoch": 0.7181522915914832, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 3.664318917183438e-05, | |
| "loss": 2.2597951889038086, | |
| "num_input_tokens_seen": 260833280, | |
| "step": 1990, | |
| "train_runtime": 3858.8425, | |
| "train_tokens_per_second": 67593.658 | |
| }, | |
| { | |
| "epoch": 0.7217610970768675, | |
| "grad_norm": 2.84375, | |
| "learning_rate": 3.651502216610451e-05, | |
| "loss": 2.2733741760253907, | |
| "num_input_tokens_seen": 262144000, | |
| "step": 2000, | |
| "train_runtime": 3877.6418, | |
| "train_tokens_per_second": 67603.976 | |
| }, | |
| { | |
| "epoch": 0.7253699025622519, | |
| "grad_norm": 3.203125, | |
| "learning_rate": 3.638646985620652e-05, | |
| "loss": 2.277943801879883, | |
| "num_input_tokens_seen": 263454720, | |
| "step": 2010, | |
| "train_runtime": 3901.0148, | |
| "train_tokens_per_second": 67534.919 | |
| }, | |
| { | |
| "epoch": 0.7289787080476362, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 3.625753654362939e-05, | |
| "loss": 2.316669464111328, | |
| "num_input_tokens_seen": 264765440, | |
| "step": 2020, | |
| "train_runtime": 3919.7696, | |
| "train_tokens_per_second": 67546.174 | |
| }, | |
| { | |
| "epoch": 0.7325875135330205, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 3.612822654261083e-05, | |
| "loss": 2.228474807739258, | |
| "num_input_tokens_seen": 266076160, | |
| "step": 2030, | |
| "train_runtime": 3938.527, | |
| "train_tokens_per_second": 67557.278 | |
| }, | |
| { | |
| "epoch": 0.7361963190184049, | |
| "grad_norm": 2.625, | |
| "learning_rate": 3.5998544179992887e-05, | |
| "loss": 2.28963623046875, | |
| "num_input_tokens_seen": 267386880, | |
| "step": 2040, | |
| "train_runtime": 3957.2799, | |
| "train_tokens_per_second": 67568.352 | |
| }, | |
| { | |
| "epoch": 0.7398051245037892, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 3.586849379507725e-05, | |
| "loss": 2.310571479797363, | |
| "num_input_tokens_seen": 268697600, | |
| "step": 2050, | |
| "train_runtime": 3976.0438, | |
| "train_tokens_per_second": 67579.134 | |
| }, | |
| { | |
| "epoch": 0.7434139299891735, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 3.573807973947996e-05, | |
| "loss": 2.256072235107422, | |
| "num_input_tokens_seen": 270008320, | |
| "step": 2060, | |
| "train_runtime": 3994.787, | |
| "train_tokens_per_second": 67590.167 | |
| }, | |
| { | |
| "epoch": 0.7470227354745579, | |
| "grad_norm": 2.390625, | |
| "learning_rate": 3.5607306376985874e-05, | |
| "loss": 2.2760551452636717, | |
| "num_input_tokens_seen": 271319040, | |
| "step": 2070, | |
| "train_runtime": 4013.5355, | |
| "train_tokens_per_second": 67601.007 | |
| }, | |
| { | |
| "epoch": 0.7506315409599422, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 3.547617808340259e-05, | |
| "loss": 2.2873741149902345, | |
| "num_input_tokens_seen": 272629760, | |
| "step": 2080, | |
| "train_runtime": 4032.283, | |
| "train_tokens_per_second": 67611.762 | |
| }, | |
| { | |
| "epoch": 0.7542403464453266, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 3.534469924641408e-05, | |
| "loss": 2.279720687866211, | |
| "num_input_tokens_seen": 273940480, | |
| "step": 2090, | |
| "train_runtime": 4051.0412, | |
| "train_tokens_per_second": 67622.239 | |
| }, | |
| { | |
| "epoch": 0.7578491519307109, | |
| "grad_norm": 2.0, | |
| "learning_rate": 3.521287426543384e-05, | |
| "loss": 2.284140396118164, | |
| "num_input_tokens_seen": 275251200, | |
| "step": 2100, | |
| "train_runtime": 4069.7944, | |
| "train_tokens_per_second": 67632.704 | |
| }, | |
| { | |
| "epoch": 0.7614579574160952, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 3.508070755145767e-05, | |
| "loss": 2.2155914306640625, | |
| "num_input_tokens_seen": 276561920, | |
| "step": 2110, | |
| "train_runtime": 4092.2481, | |
| "train_tokens_per_second": 67581.904 | |
| }, | |
| { | |
| "epoch": 0.7650667629014796, | |
| "grad_norm": 1.9375, | |
| "learning_rate": 3.494820352691615e-05, | |
| "loss": 2.2498100280761717, | |
| "num_input_tokens_seen": 277872640, | |
| "step": 2120, | |
| "train_runtime": 4111.0288, | |
| "train_tokens_per_second": 67591.995 | |
| }, | |
| { | |
| "epoch": 0.7686755683868639, | |
| "grad_norm": 2.53125, | |
| "learning_rate": 3.481536662552655e-05, | |
| "loss": 2.250745391845703, | |
| "num_input_tokens_seen": 279183360, | |
| "step": 2130, | |
| "train_runtime": 4129.81, | |
| "train_tokens_per_second": 67601.986 | |
| }, | |
| { | |
| "epoch": 0.7722843738722482, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 3.4682201292144565e-05, | |
| "loss": 2.253221321105957, | |
| "num_input_tokens_seen": 280494080, | |
| "step": 2140, | |
| "train_runtime": 4148.5896, | |
| "train_tokens_per_second": 67611.913 | |
| }, | |
| { | |
| "epoch": 0.7758931793576326, | |
| "grad_norm": 2.234375, | |
| "learning_rate": 3.454871198261556e-05, | |
| "loss": 2.2065752029418944, | |
| "num_input_tokens_seen": 281804800, | |
| "step": 2150, | |
| "train_runtime": 4167.3782, | |
| "train_tokens_per_second": 67621.604 | |
| }, | |
| { | |
| "epoch": 0.7795019848430169, | |
| "grad_norm": 2.359375, | |
| "learning_rate": 3.441490316362544e-05, | |
| "loss": 2.259677696228027, | |
| "num_input_tokens_seen": 283115520, | |
| "step": 2160, | |
| "train_runtime": 4186.1418, | |
| "train_tokens_per_second": 67631.613 | |
| }, | |
| { | |
| "epoch": 0.7831107903284013, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.428077931255123e-05, | |
| "loss": 2.291699981689453, | |
| "num_input_tokens_seen": 284426240, | |
| "step": 2170, | |
| "train_runtime": 4204.908, | |
| "train_tokens_per_second": 67641.489 | |
| }, | |
| { | |
| "epoch": 0.7867195958137856, | |
| "grad_norm": 3.0625, | |
| "learning_rate": 3.4146344917311246e-05, | |
| "loss": 2.212661552429199, | |
| "num_input_tokens_seen": 285736960, | |
| "step": 2180, | |
| "train_runtime": 4223.6825, | |
| "train_tokens_per_second": 67651.146 | |
| }, | |
| { | |
| "epoch": 0.7903284012991699, | |
| "grad_norm": 2.4375, | |
| "learning_rate": 3.401160447621492e-05, | |
| "loss": 2.2563989639282225, | |
| "num_input_tokens_seen": 287047680, | |
| "step": 2190, | |
| "train_runtime": 4242.4789, | |
| "train_tokens_per_second": 67660.367 | |
| }, | |
| { | |
| "epoch": 0.7939372067845543, | |
| "grad_norm": 2.703125, | |
| "learning_rate": 3.387656249781228e-05, | |
| "loss": 2.292235565185547, | |
| "num_input_tokens_seen": 288358400, | |
| "step": 2200, | |
| "train_runtime": 4261.2417, | |
| "train_tokens_per_second": 67670.041 | |
| }, | |
| { | |
| "epoch": 0.7975460122699386, | |
| "grad_norm": 2.296875, | |
| "learning_rate": 3.374122350074312e-05, | |
| "loss": 2.186331367492676, | |
| "num_input_tokens_seen": 289669120, | |
| "step": 2210, | |
| "train_runtime": 4283.2186, | |
| "train_tokens_per_second": 67628.843 | |
| }, | |
| { | |
| "epoch": 0.8011548177553229, | |
| "grad_norm": 2.234375, | |
| "learning_rate": 3.360559201358573e-05, | |
| "loss": 2.268985557556152, | |
| "num_input_tokens_seen": 290979840, | |
| "step": 2220, | |
| "train_runtime": 4301.9788, | |
| "train_tokens_per_second": 67638.604 | |
| }, | |
| { | |
| "epoch": 0.8047636232407073, | |
| "grad_norm": 2.546875, | |
| "learning_rate": 3.3469672574705444e-05, | |
| "loss": 2.2512365341186524, | |
| "num_input_tokens_seen": 292290560, | |
| "step": 2230, | |
| "train_runtime": 4320.7387, | |
| "train_tokens_per_second": 67648.284 | |
| }, | |
| { | |
| "epoch": 0.8083724287260917, | |
| "grad_norm": 2.203125, | |
| "learning_rate": 3.333346973210276e-05, | |
| "loss": 2.2132787704467773, | |
| "num_input_tokens_seen": 293601280, | |
| "step": 2240, | |
| "train_runtime": 4339.4961, | |
| "train_tokens_per_second": 67657.919 | |
| }, | |
| { | |
| "epoch": 0.811981234211476, | |
| "grad_norm": 2.578125, | |
| "learning_rate": 3.31969880432611e-05, | |
| "loss": 2.219511032104492, | |
| "num_input_tokens_seen": 294912000, | |
| "step": 2250, | |
| "train_runtime": 4358.2565, | |
| "train_tokens_per_second": 67667.426 | |
| }, | |
| { | |
| "epoch": 0.8155900396968604, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 3.306023207499439e-05, | |
| "loss": 2.2744468688964843, | |
| "num_input_tokens_seen": 296222720, | |
| "step": 2260, | |
| "train_runtime": 4377.0289, | |
| "train_tokens_per_second": 67676.665 | |
| }, | |
| { | |
| "epoch": 0.8191988451822447, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 3.292320640329426e-05, | |
| "loss": 2.2337514877319338, | |
| "num_input_tokens_seen": 297533440, | |
| "step": 2270, | |
| "train_runtime": 4395.8065, | |
| "train_tokens_per_second": 67685.746 | |
| }, | |
| { | |
| "epoch": 0.8228076506676291, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 3.27859156131768e-05, | |
| "loss": 2.217744064331055, | |
| "num_input_tokens_seen": 298844160, | |
| "step": 2280, | |
| "train_runtime": 4414.5824, | |
| "train_tokens_per_second": 67694.775 | |
| }, | |
| { | |
| "epoch": 0.8264164561530134, | |
| "grad_norm": 2.4375, | |
| "learning_rate": 3.2648364298529294e-05, | |
| "loss": 2.2992366790771483, | |
| "num_input_tokens_seen": 300154880, | |
| "step": 2290, | |
| "train_runtime": 4433.3466, | |
| "train_tokens_per_second": 67703.906 | |
| }, | |
| { | |
| "epoch": 0.8300252616383977, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 3.2510557061956424e-05, | |
| "loss": 2.265240287780762, | |
| "num_input_tokens_seen": 301465600, | |
| "step": 2300, | |
| "train_runtime": 4452.1281, | |
| "train_tokens_per_second": 67712.697 | |
| }, | |
| { | |
| "epoch": 0.8336340671237821, | |
| "grad_norm": 2.390625, | |
| "learning_rate": 3.2372498514626255e-05, | |
| "loss": 2.257766532897949, | |
| "num_input_tokens_seen": 302776320, | |
| "step": 2310, | |
| "train_runtime": 4474.0527, | |
| "train_tokens_per_second": 67673.838 | |
| }, | |
| { | |
| "epoch": 0.8372428726091664, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.223419327611599e-05, | |
| "loss": 2.2734552383422852, | |
| "num_input_tokens_seen": 304087040, | |
| "step": 2320, | |
| "train_runtime": 4492.8568, | |
| "train_tokens_per_second": 67682.335 | |
| }, | |
| { | |
| "epoch": 0.8408516780945507, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 3.209564597425734e-05, | |
| "loss": 2.240528106689453, | |
| "num_input_tokens_seen": 305397760, | |
| "step": 2330, | |
| "train_runtime": 4511.6404, | |
| "train_tokens_per_second": 67691.069 | |
| }, | |
| { | |
| "epoch": 0.8444604835799351, | |
| "grad_norm": 2.25, | |
| "learning_rate": 3.1956861244981714e-05, | |
| "loss": 2.2675090789794923, | |
| "num_input_tokens_seen": 306708480, | |
| "step": 2340, | |
| "train_runtime": 4530.4269, | |
| "train_tokens_per_second": 67699.686 | |
| }, | |
| { | |
| "epoch": 0.8480692890653194, | |
| "grad_norm": 2.421875, | |
| "learning_rate": 3.181784373216507e-05, | |
| "loss": 2.2498952865600588, | |
| "num_input_tokens_seen": 308019200, | |
| "step": 2350, | |
| "train_runtime": 4549.215, | |
| "train_tokens_per_second": 67708.208 | |
| }, | |
| { | |
| "epoch": 0.8516780945507038, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 3.1678598087472564e-05, | |
| "loss": 2.2409832000732424, | |
| "num_input_tokens_seen": 309329920, | |
| "step": 2360, | |
| "train_runtime": 4567.9867, | |
| "train_tokens_per_second": 67716.904 | |
| }, | |
| { | |
| "epoch": 0.8552869000360881, | |
| "grad_norm": 1.8671875, | |
| "learning_rate": 3.153912897020283e-05, | |
| "loss": 2.2946495056152343, | |
| "num_input_tokens_seen": 310640640, | |
| "step": 2370, | |
| "train_runtime": 4586.7663, | |
| "train_tokens_per_second": 67725.413 | |
| }, | |
| { | |
| "epoch": 0.8588957055214724, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 3.139944104713214e-05, | |
| "loss": 2.2439815521240236, | |
| "num_input_tokens_seen": 311951360, | |
| "step": 2380, | |
| "train_runtime": 4605.5614, | |
| "train_tokens_per_second": 67733.623 | |
| }, | |
| { | |
| "epoch": 0.8625045110068568, | |
| "grad_norm": 2.234375, | |
| "learning_rate": 3.1259538992358226e-05, | |
| "loss": 2.274890327453613, | |
| "num_input_tokens_seen": 313262080, | |
| "step": 2390, | |
| "train_runtime": 4624.3548, | |
| "train_tokens_per_second": 67741.791 | |
| }, | |
| { | |
| "epoch": 0.8661133164922411, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.11194274871439e-05, | |
| "loss": 2.311928367614746, | |
| "num_input_tokens_seen": 314572800, | |
| "step": 2400, | |
| "train_runtime": 4643.1261, | |
| "train_tokens_per_second": 67750.217 | |
| }, | |
| { | |
| "epoch": 0.8697221219776254, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 3.097911121976035e-05, | |
| "loss": 2.2456386566162108, | |
| "num_input_tokens_seen": 315883520, | |
| "step": 2410, | |
| "train_runtime": 4665.7859, | |
| "train_tokens_per_second": 67702.103 | |
| }, | |
| { | |
| "epoch": 0.8733309274630098, | |
| "grad_norm": 1.953125, | |
| "learning_rate": 3.083859488533036e-05, | |
| "loss": 2.2625568389892576, | |
| "num_input_tokens_seen": 317194240, | |
| "step": 2420, | |
| "train_runtime": 4684.5371, | |
| "train_tokens_per_second": 67710.904 | |
| }, | |
| { | |
| "epoch": 0.8769397329483941, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 3.069788318567113e-05, | |
| "loss": 2.242539978027344, | |
| "num_input_tokens_seen": 318504960, | |
| "step": 2430, | |
| "train_runtime": 4703.3144, | |
| "train_tokens_per_second": 67719.257 | |
| }, | |
| { | |
| "epoch": 0.8805485384337784, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 3.055698082913697e-05, | |
| "loss": 2.241316795349121, | |
| "num_input_tokens_seen": 319815680, | |
| "step": 2440, | |
| "train_runtime": 4722.0855, | |
| "train_tokens_per_second": 67727.634 | |
| }, | |
| { | |
| "epoch": 0.8841573439191628, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.0415892530461776e-05, | |
| "loss": 2.2707977294921875, | |
| "num_input_tokens_seen": 321126400, | |
| "step": 2450, | |
| "train_runtime": 4740.8653, | |
| "train_tokens_per_second": 67735.82 | |
| }, | |
| { | |
| "epoch": 0.8877661494045471, | |
| "grad_norm": 2.25, | |
| "learning_rate": 3.0274623010601267e-05, | |
| "loss": 2.2340885162353517, | |
| "num_input_tokens_seen": 322437120, | |
| "step": 2460, | |
| "train_runtime": 4759.626, | |
| "train_tokens_per_second": 67744.213 | |
| }, | |
| { | |
| "epoch": 0.8913749548899315, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 3.0133176996574963e-05, | |
| "loss": 2.1937400817871096, | |
| "num_input_tokens_seen": 323747840, | |
| "step": 2470, | |
| "train_runtime": 4779.0775, | |
| "train_tokens_per_second": 67742.747 | |
| }, | |
| { | |
| "epoch": 0.8949837603753158, | |
| "grad_norm": 1.9921875, | |
| "learning_rate": 2.999155922130809e-05, | |
| "loss": 2.2225208282470703, | |
| "num_input_tokens_seen": 325058560, | |
| "step": 2480, | |
| "train_runtime": 4797.8483, | |
| "train_tokens_per_second": 67750.904 | |
| }, | |
| { | |
| "epoch": 0.8985925658607001, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 2.9849774423473176e-05, | |
| "loss": 2.2455957412719725, | |
| "num_input_tokens_seen": 326369280, | |
| "step": 2490, | |
| "train_runtime": 4816.6232, | |
| "train_tokens_per_second": 67758.939 | |
| }, | |
| { | |
| "epoch": 0.9022013713460845, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 2.970782734733146e-05, | |
| "loss": 2.258774757385254, | |
| "num_input_tokens_seen": 327680000, | |
| "step": 2500, | |
| "train_runtime": 4835.399, | |
| "train_tokens_per_second": 67766.899 | |
| }, | |
| { | |
| "epoch": 0.9058101768314688, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 2.956572274257422e-05, | |
| "loss": 2.2699337005615234, | |
| "num_input_tokens_seen": 328990720, | |
| "step": 2510, | |
| "train_runtime": 4858.431, | |
| "train_tokens_per_second": 67715.425 | |
| }, | |
| { | |
| "epoch": 0.9094189823168531, | |
| "grad_norm": 2.5, | |
| "learning_rate": 2.9423465364163772e-05, | |
| "loss": 2.2766401290893556, | |
| "num_input_tokens_seen": 330301440, | |
| "step": 2520, | |
| "train_runtime": 4877.191, | |
| "train_tokens_per_second": 67723.703 | |
| }, | |
| { | |
| "epoch": 0.9130277878022375, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 2.928105997217438e-05, | |
| "loss": 2.2700592041015626, | |
| "num_input_tokens_seen": 331612160, | |
| "step": 2530, | |
| "train_runtime": 4895.9497, | |
| "train_tokens_per_second": 67731.937 | |
| }, | |
| { | |
| "epoch": 0.9166365932876218, | |
| "grad_norm": 2.359375, | |
| "learning_rate": 2.913851133163302e-05, | |
| "loss": 2.2220373153686523, | |
| "num_input_tokens_seen": 332922880, | |
| "step": 2540, | |
| "train_runtime": 4914.7219, | |
| "train_tokens_per_second": 67739.923 | |
| }, | |
| { | |
| "epoch": 0.9202453987730062, | |
| "grad_norm": 1.96875, | |
| "learning_rate": 2.8995824212359895e-05, | |
| "loss": 2.2467634201049806, | |
| "num_input_tokens_seen": 334233600, | |
| "step": 2550, | |
| "train_runtime": 4933.5018, | |
| "train_tokens_per_second": 67747.741 | |
| }, | |
| { | |
| "epoch": 0.9238542042583905, | |
| "grad_norm": 2.203125, | |
| "learning_rate": 2.8853003388808836e-05, | |
| "loss": 2.245954704284668, | |
| "num_input_tokens_seen": 335544320, | |
| "step": 2560, | |
| "train_runtime": 4952.2584, | |
| "train_tokens_per_second": 67755.818 | |
| }, | |
| { | |
| "epoch": 0.9274630097437748, | |
| "grad_norm": 1.96875, | |
| "learning_rate": 2.871005363990757e-05, | |
| "loss": 2.262437438964844, | |
| "num_input_tokens_seen": 336855040, | |
| "step": 2570, | |
| "train_runtime": 4971.0339, | |
| "train_tokens_per_second": 67763.577 | |
| }, | |
| { | |
| "epoch": 0.9310718152291592, | |
| "grad_norm": 2.328125, | |
| "learning_rate": 2.8566979748897782e-05, | |
| "loss": 2.306426429748535, | |
| "num_input_tokens_seen": 338165760, | |
| "step": 2580, | |
| "train_runtime": 4989.8069, | |
| "train_tokens_per_second": 67771.312 | |
| }, | |
| { | |
| "epoch": 0.9346806207145435, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 2.8423786503175083e-05, | |
| "loss": 2.2506465911865234, | |
| "num_input_tokens_seen": 339476480, | |
| "step": 2590, | |
| "train_runtime": 5008.578, | |
| "train_tokens_per_second": 67779.015 | |
| }, | |
| { | |
| "epoch": 0.9382894261999278, | |
| "grad_norm": 2.640625, | |
| "learning_rate": 2.8280478694128804e-05, | |
| "loss": 2.249863052368164, | |
| "num_input_tokens_seen": 340787200, | |
| "step": 2600, | |
| "train_runtime": 5027.3701, | |
| "train_tokens_per_second": 67786.376 | |
| }, | |
| { | |
| "epoch": 0.9418982316853122, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 2.8137061116981693e-05, | |
| "loss": 2.2413703918457033, | |
| "num_input_tokens_seen": 342097920, | |
| "step": 2610, | |
| "train_runtime": 5049.0415, | |
| "train_tokens_per_second": 67755.022 | |
| }, | |
| { | |
| "epoch": 0.9455070371706965, | |
| "grad_norm": 2.4375, | |
| "learning_rate": 2.799353857062944e-05, | |
| "loss": 2.236385154724121, | |
| "num_input_tokens_seen": 343408640, | |
| "step": 2620, | |
| "train_runtime": 5067.8245, | |
| "train_tokens_per_second": 67762.535 | |
| }, | |
| { | |
| "epoch": 0.9491158426560808, | |
| "grad_norm": 2.203125, | |
| "learning_rate": 2.7849915857480103e-05, | |
| "loss": 2.2933725357055663, | |
| "num_input_tokens_seen": 344719360, | |
| "step": 2630, | |
| "train_runtime": 5086.5939, | |
| "train_tokens_per_second": 67770.175 | |
| }, | |
| { | |
| "epoch": 0.9527246481414652, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 2.770619778329344e-05, | |
| "loss": 2.244718551635742, | |
| "num_input_tokens_seen": 346030080, | |
| "step": 2640, | |
| "train_runtime": 5105.4095, | |
| "train_tokens_per_second": 67777.145 | |
| }, | |
| { | |
| "epoch": 0.9563334536268495, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 2.756238915702007e-05, | |
| "loss": 2.2527402877807616, | |
| "num_input_tokens_seen": 347340800, | |
| "step": 2650, | |
| "train_runtime": 5124.1871, | |
| "train_tokens_per_second": 67784.566 | |
| }, | |
| { | |
| "epoch": 0.9599422591122339, | |
| "grad_norm": 1.859375, | |
| "learning_rate": 2.7418494790640576e-05, | |
| "loss": 2.250338554382324, | |
| "num_input_tokens_seen": 348651520, | |
| "step": 2660, | |
| "train_runtime": 5142.973, | |
| "train_tokens_per_second": 67791.824 | |
| }, | |
| { | |
| "epoch": 0.9635510645976182, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 2.7274519499004497e-05, | |
| "loss": 2.231460380554199, | |
| "num_input_tokens_seen": 349962240, | |
| "step": 2670, | |
| "train_runtime": 5161.7907, | |
| "train_tokens_per_second": 67798.611 | |
| }, | |
| { | |
| "epoch": 0.9671598700830025, | |
| "grad_norm": 2.5625, | |
| "learning_rate": 2.7130468099669204e-05, | |
| "loss": 2.257509231567383, | |
| "num_input_tokens_seen": 351272960, | |
| "step": 2680, | |
| "train_runtime": 5180.5654, | |
| "train_tokens_per_second": 67805.912 | |
| }, | |
| { | |
| "epoch": 0.9707686755683869, | |
| "grad_norm": 1.75, | |
| "learning_rate": 2.6986345412738717e-05, | |
| "loss": 2.2456037521362306, | |
| "num_input_tokens_seen": 352583680, | |
| "step": 2690, | |
| "train_runtime": 5199.3394, | |
| "train_tokens_per_second": 67813.168 | |
| }, | |
| { | |
| "epoch": 0.9743774810537712, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 2.684215626070241e-05, | |
| "loss": 2.220039176940918, | |
| "num_input_tokens_seen": 353894400, | |
| "step": 2700, | |
| "train_runtime": 5218.1178, | |
| "train_tokens_per_second": 67820.317 | |
| }, | |
| { | |
| "epoch": 0.9779862865391555, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 2.6697905468273638e-05, | |
| "loss": 2.2261730194091798, | |
| "num_input_tokens_seen": 355205120, | |
| "step": 2710, | |
| "train_runtime": 5240.1257, | |
| "train_tokens_per_second": 67785.61 | |
| }, | |
| { | |
| "epoch": 0.9815950920245399, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 2.6553597862228306e-05, | |
| "loss": 2.2150230407714844, | |
| "num_input_tokens_seen": 356515840, | |
| "step": 2720, | |
| "train_runtime": 5258.914, | |
| "train_tokens_per_second": 67792.673 | |
| }, | |
| { | |
| "epoch": 0.9852038975099242, | |
| "grad_norm": 2.125, | |
| "learning_rate": 2.6409238271243374e-05, | |
| "loss": 2.26368408203125, | |
| "num_input_tokens_seen": 357826560, | |
| "step": 2730, | |
| "train_runtime": 5277.6776, | |
| "train_tokens_per_second": 67800.003 | |
| }, | |
| { | |
| "epoch": 0.9888127029953085, | |
| "grad_norm": 1.984375, | |
| "learning_rate": 2.6264831525735245e-05, | |
| "loss": 2.280439758300781, | |
| "num_input_tokens_seen": 359137280, | |
| "step": 2740, | |
| "train_runtime": 5296.4537, | |
| "train_tokens_per_second": 67807.121 | |
| }, | |
| { | |
| "epoch": 0.9924215084806929, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 2.612038245769818e-05, | |
| "loss": 2.2530561447143556, | |
| "num_input_tokens_seen": 360448000, | |
| "step": 2750, | |
| "train_runtime": 5315.2093, | |
| "train_tokens_per_second": 67814.45 | |
| }, | |
| { | |
| "epoch": 0.9960303139660772, | |
| "grad_norm": 2.484375, | |
| "learning_rate": 2.5975895900542596e-05, | |
| "loss": 2.2372438430786135, | |
| "num_input_tokens_seen": 361758720, | |
| "step": 2760, | |
| "train_runtime": 5333.9785, | |
| "train_tokens_per_second": 67821.556 | |
| }, | |
| { | |
| "epoch": 0.9996391194514616, | |
| "grad_norm": 2.296875, | |
| "learning_rate": 2.5831376688933305e-05, | |
| "loss": 2.229551315307617, | |
| "num_input_tokens_seen": 363069440, | |
| "step": 2770, | |
| "train_runtime": 5352.7536, | |
| "train_tokens_per_second": 67828.535 | |
| }, | |
| { | |
| "epoch": 1.003247924936846, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 2.5686829658627814e-05, | |
| "loss": 2.193307113647461, | |
| "num_input_tokens_seen": 364331008, | |
| "step": 2780, | |
| "train_runtime": 5371.326, | |
| "train_tokens_per_second": 67828.877 | |
| }, | |
| { | |
| "epoch": 1.0068567304222302, | |
| "grad_norm": 1.9765625, | |
| "learning_rate": 2.5542259646314425e-05, | |
| "loss": 2.221421241760254, | |
| "num_input_tokens_seen": 365641728, | |
| "step": 2790, | |
| "train_runtime": 5390.0707, | |
| "train_tokens_per_second": 67836.166 | |
| }, | |
| { | |
| "epoch": 1.0104655359076147, | |
| "grad_norm": 1.75, | |
| "learning_rate": 2.539767148945048e-05, | |
| "loss": 2.2600011825561523, | |
| "num_input_tokens_seen": 366952448, | |
| "step": 2800, | |
| "train_runtime": 5408.8177, | |
| "train_tokens_per_second": 67843.375 | |
| }, | |
| { | |
| "epoch": 1.014074341392999, | |
| "grad_norm": 2.328125, | |
| "learning_rate": 2.5253070026100428e-05, | |
| "loss": 2.1858745574951173, | |
| "num_input_tokens_seen": 368263168, | |
| "step": 2810, | |
| "train_runtime": 5430.762, | |
| "train_tokens_per_second": 67810.588 | |
| }, | |
| { | |
| "epoch": 1.0176831468783833, | |
| "grad_norm": 2.234375, | |
| "learning_rate": 2.5108460094773984e-05, | |
| "loss": 2.232530975341797, | |
| "num_input_tokens_seen": 369573888, | |
| "step": 2820, | |
| "train_runtime": 5449.5183, | |
| "train_tokens_per_second": 67817.717 | |
| }, | |
| { | |
| "epoch": 1.0212919523637676, | |
| "grad_norm": 2.359375, | |
| "learning_rate": 2.4963846534264197e-05, | |
| "loss": 2.2220739364624023, | |
| "num_input_tokens_seen": 370884608, | |
| "step": 2830, | |
| "train_runtime": 5468.2804, | |
| "train_tokens_per_second": 67824.724 | |
| }, | |
| { | |
| "epoch": 1.024900757849152, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 2.4819234183485572e-05, | |
| "loss": 2.225343132019043, | |
| "num_input_tokens_seen": 372195328, | |
| "step": 2840, | |
| "train_runtime": 5487.0445, | |
| "train_tokens_per_second": 67831.658 | |
| }, | |
| { | |
| "epoch": 1.0285095633345362, | |
| "grad_norm": 1.9375, | |
| "learning_rate": 2.4674627881312103e-05, | |
| "loss": 2.255137252807617, | |
| "num_input_tokens_seen": 373506048, | |
| "step": 2850, | |
| "train_runtime": 5505.7991, | |
| "train_tokens_per_second": 67838.663 | |
| }, | |
| { | |
| "epoch": 1.0321183688199207, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 2.4530032466415428e-05, | |
| "loss": 2.248682975769043, | |
| "num_input_tokens_seen": 374816768, | |
| "step": 2860, | |
| "train_runtime": 5524.5617, | |
| "train_tokens_per_second": 67845.521 | |
| }, | |
| { | |
| "epoch": 1.035727174305305, | |
| "grad_norm": 2.34375, | |
| "learning_rate": 2.438545277710285e-05, | |
| "loss": 2.166554832458496, | |
| "num_input_tokens_seen": 376127488, | |
| "step": 2870, | |
| "train_runtime": 5543.3218, | |
| "train_tokens_per_second": 67852.364 | |
| }, | |
| { | |
| "epoch": 1.0393359797906894, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 2.4240893651155515e-05, | |
| "loss": 2.2574790954589843, | |
| "num_input_tokens_seen": 377438208, | |
| "step": 2880, | |
| "train_runtime": 5562.0818, | |
| "train_tokens_per_second": 67859.162 | |
| }, | |
| { | |
| "epoch": 1.0429447852760736, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 2.4096359925666478e-05, | |
| "loss": 2.206853675842285, | |
| "num_input_tokens_seen": 378748928, | |
| "step": 2890, | |
| "train_runtime": 5580.8539, | |
| "train_tokens_per_second": 67865.767 | |
| }, | |
| { | |
| "epoch": 1.046553590761458, | |
| "grad_norm": 2.5, | |
| "learning_rate": 2.395185643687885e-05, | |
| "loss": 2.2421005249023436, | |
| "num_input_tokens_seen": 380059648, | |
| "step": 2900, | |
| "train_runtime": 5599.6107, | |
| "train_tokens_per_second": 67872.512 | |
| }, | |
| { | |
| "epoch": 1.0501623962468423, | |
| "grad_norm": 1.875, | |
| "learning_rate": 2.380738802002403e-05, | |
| "loss": 2.2542638778686523, | |
| "num_input_tokens_seen": 381370368, | |
| "step": 2910, | |
| "train_runtime": 5622.0304, | |
| "train_tokens_per_second": 67834.988 | |
| }, | |
| { | |
| "epoch": 1.0537712017322267, | |
| "grad_norm": 2.59375, | |
| "learning_rate": 2.366295950915985e-05, | |
| "loss": 2.248210144042969, | |
| "num_input_tokens_seen": 382681088, | |
| "step": 2920, | |
| "train_runtime": 5640.7541, | |
| "train_tokens_per_second": 67842.186 | |
| }, | |
| { | |
| "epoch": 1.057380007217611, | |
| "grad_norm": 2.46875, | |
| "learning_rate": 2.3518575737008867e-05, | |
| "loss": 2.2071243286132813, | |
| "num_input_tokens_seen": 383991808, | |
| "step": 2930, | |
| "train_runtime": 5659.5048, | |
| "train_tokens_per_second": 67849.012 | |
| }, | |
| { | |
| "epoch": 1.0609888127029954, | |
| "grad_norm": 2.265625, | |
| "learning_rate": 2.3374241534796602e-05, | |
| "loss": 2.2425615310668947, | |
| "num_input_tokens_seen": 385302528, | |
| "step": 2940, | |
| "train_runtime": 5678.2419, | |
| "train_tokens_per_second": 67855.956 | |
| }, | |
| { | |
| "epoch": 1.0645976181883796, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 2.3229961732089973e-05, | |
| "loss": 2.219411277770996, | |
| "num_input_tokens_seen": 386613248, | |
| "step": 2950, | |
| "train_runtime": 5696.9934, | |
| "train_tokens_per_second": 67862.681 | |
| }, | |
| { | |
| "epoch": 1.068206423673764, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 2.308574115663556e-05, | |
| "loss": 2.201869583129883, | |
| "num_input_tokens_seen": 387923968, | |
| "step": 2960, | |
| "train_runtime": 5715.7762, | |
| "train_tokens_per_second": 67868.992 | |
| }, | |
| { | |
| "epoch": 1.0718152291591483, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 2.2941584634198217e-05, | |
| "loss": 2.235122871398926, | |
| "num_input_tokens_seen": 389234688, | |
| "step": 2970, | |
| "train_runtime": 5734.5443, | |
| "train_tokens_per_second": 67875.435 | |
| }, | |
| { | |
| "epoch": 1.0754240346445327, | |
| "grad_norm": 3.015625, | |
| "learning_rate": 2.279749698839946e-05, | |
| "loss": 2.2270109176635744, | |
| "num_input_tokens_seen": 390545408, | |
| "step": 2980, | |
| "train_runtime": 5753.3138, | |
| "train_tokens_per_second": 67881.819 | |
| }, | |
| { | |
| "epoch": 1.079032840129917, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 2.2653483040556157e-05, | |
| "loss": 2.229469871520996, | |
| "num_input_tokens_seen": 391856128, | |
| "step": 2990, | |
| "train_runtime": 5772.0918, | |
| "train_tokens_per_second": 67888.062 | |
| }, | |
| { | |
| "epoch": 1.0826416456153014, | |
| "grad_norm": 1.7890625, | |
| "learning_rate": 2.250954760951916e-05, | |
| "loss": 2.199754333496094, | |
| "num_input_tokens_seen": 393166848, | |
| "step": 3000, | |
| "train_runtime": 5790.8659, | |
| "train_tokens_per_second": 67894.311 | |
| }, | |
| { | |
| "epoch": 1.0862504511006856, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 2.2365695511512075e-05, | |
| "loss": 2.1993585586547852, | |
| "num_input_tokens_seen": 394477568, | |
| "step": 3010, | |
| "train_runtime": 5814.6634, | |
| "train_tokens_per_second": 67841.858 | |
| }, | |
| { | |
| "epoch": 1.08985925658607, | |
| "grad_norm": 2.328125, | |
| "learning_rate": 2.2221931559970076e-05, | |
| "loss": 2.249158477783203, | |
| "num_input_tokens_seen": 395788288, | |
| "step": 3020, | |
| "train_runtime": 5833.4374, | |
| "train_tokens_per_second": 67848.21 | |
| }, | |
| { | |
| "epoch": 1.0934680620714543, | |
| "grad_norm": 1.75, | |
| "learning_rate": 2.2078260565378913e-05, | |
| "loss": 2.2337362289428713, | |
| "num_input_tokens_seen": 397099008, | |
| "step": 3030, | |
| "train_runtime": 5852.2209, | |
| "train_tokens_per_second": 67854.412 | |
| }, | |
| { | |
| "epoch": 1.0970768675568388, | |
| "grad_norm": 2.234375, | |
| "learning_rate": 2.193468733511386e-05, | |
| "loss": 2.2763225555419924, | |
| "num_input_tokens_seen": 398409728, | |
| "step": 3040, | |
| "train_runtime": 5870.9916, | |
| "train_tokens_per_second": 67860.722 | |
| }, | |
| { | |
| "epoch": 1.100685673042223, | |
| "grad_norm": 1.890625, | |
| "learning_rate": 2.179121667327893e-05, | |
| "loss": 2.2377885818481444, | |
| "num_input_tokens_seen": 399720448, | |
| "step": 3050, | |
| "train_runtime": 5889.7662, | |
| "train_tokens_per_second": 67866.947 | |
| }, | |
| { | |
| "epoch": 1.1042944785276074, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 2.164785338054607e-05, | |
| "loss": 2.224856948852539, | |
| "num_input_tokens_seen": 401031168, | |
| "step": 3060, | |
| "train_runtime": 5908.5456, | |
| "train_tokens_per_second": 67873.076 | |
| }, | |
| { | |
| "epoch": 1.1079032840129917, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 2.1504602253994572e-05, | |
| "loss": 2.2104814529418944, | |
| "num_input_tokens_seen": 402341888, | |
| "step": 3070, | |
| "train_runtime": 5927.3145, | |
| "train_tokens_per_second": 67879.288 | |
| }, | |
| { | |
| "epoch": 1.111512089498376, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 2.1361468086950505e-05, | |
| "loss": 2.22839298248291, | |
| "num_input_tokens_seen": 403652608, | |
| "step": 3080, | |
| "train_runtime": 5946.1084, | |
| "train_tokens_per_second": 67885.174 | |
| }, | |
| { | |
| "epoch": 1.1151208949837603, | |
| "grad_norm": 1.765625, | |
| "learning_rate": 2.1218455668826394e-05, | |
| "loss": 2.199458122253418, | |
| "num_input_tokens_seen": 404963328, | |
| "step": 3090, | |
| "train_runtime": 5964.9101, | |
| "train_tokens_per_second": 67890.936 | |
| }, | |
| { | |
| "epoch": 1.1187297004691448, | |
| "grad_norm": 2.265625, | |
| "learning_rate": 2.10755697849609e-05, | |
| "loss": 2.200012969970703, | |
| "num_input_tokens_seen": 406274048, | |
| "step": 3100, | |
| "train_runtime": 5983.7215, | |
| "train_tokens_per_second": 67896.551 | |
| }, | |
| { | |
| "epoch": 1.122338505954529, | |
| "grad_norm": 2.28125, | |
| "learning_rate": 2.0932815216458712e-05, | |
| "loss": 2.2353172302246094, | |
| "num_input_tokens_seen": 407584768, | |
| "step": 3110, | |
| "train_runtime": 6006.3211, | |
| "train_tokens_per_second": 67859.304 | |
| }, | |
| { | |
| "epoch": 1.1259473114399134, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 2.07901967400306e-05, | |
| "loss": 2.2090152740478515, | |
| "num_input_tokens_seen": 408895488, | |
| "step": 3120, | |
| "train_runtime": 6025.1377, | |
| "train_tokens_per_second": 67864.919 | |
| }, | |
| { | |
| "epoch": 1.1295561169252977, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 2.0647719127833536e-05, | |
| "loss": 2.1954586029052736, | |
| "num_input_tokens_seen": 410206208, | |
| "step": 3130, | |
| "train_runtime": 6043.9279, | |
| "train_tokens_per_second": 67870.798 | |
| }, | |
| { | |
| "epoch": 1.1331649224106821, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 2.0505387147311057e-05, | |
| "loss": 2.226312828063965, | |
| "num_input_tokens_seen": 411516928, | |
| "step": 3140, | |
| "train_runtime": 6062.7198, | |
| "train_tokens_per_second": 67876.62 | |
| }, | |
| { | |
| "epoch": 1.1367737278960663, | |
| "grad_norm": 2.453125, | |
| "learning_rate": 2.036320556103368e-05, | |
| "loss": 2.17757568359375, | |
| "num_input_tokens_seen": 412827648, | |
| "step": 3150, | |
| "train_runtime": 6081.5285, | |
| "train_tokens_per_second": 67882.218 | |
| }, | |
| { | |
| "epoch": 1.1403825333814508, | |
| "grad_norm": 1.890625, | |
| "learning_rate": 2.0221179126539636e-05, | |
| "loss": 2.235516357421875, | |
| "num_input_tokens_seen": 414138368, | |
| "step": 3160, | |
| "train_runtime": 6100.3197, | |
| "train_tokens_per_second": 67887.978 | |
| }, | |
| { | |
| "epoch": 1.143991338866835, | |
| "grad_norm": 2.125, | |
| "learning_rate": 2.0079312596175563e-05, | |
| "loss": 2.219258499145508, | |
| "num_input_tokens_seen": 415449088, | |
| "step": 3170, | |
| "train_runtime": 6119.0789, | |
| "train_tokens_per_second": 67894.056 | |
| }, | |
| { | |
| "epoch": 1.1476001443522195, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 1.9937610716937595e-05, | |
| "loss": 2.2164329528808593, | |
| "num_input_tokens_seen": 416759808, | |
| "step": 3180, | |
| "train_runtime": 6137.8386, | |
| "train_tokens_per_second": 67900.092 | |
| }, | |
| { | |
| "epoch": 1.1512089498376037, | |
| "grad_norm": 2.515625, | |
| "learning_rate": 1.9796078230312438e-05, | |
| "loss": 2.214109420776367, | |
| "num_input_tokens_seen": 418070528, | |
| "step": 3190, | |
| "train_runtime": 6156.6084, | |
| "train_tokens_per_second": 67905.98 | |
| }, | |
| { | |
| "epoch": 1.1548177553229881, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 1.9654719872118775e-05, | |
| "loss": 2.223517417907715, | |
| "num_input_tokens_seen": 419381248, | |
| "step": 3200, | |
| "train_runtime": 6175.3896, | |
| "train_tokens_per_second": 67911.706 | |
| }, | |
| { | |
| "epoch": 1.1584265608083724, | |
| "grad_norm": 1.9375, | |
| "learning_rate": 1.951354037234876e-05, | |
| "loss": 2.2522729873657226, | |
| "num_input_tokens_seen": 420691968, | |
| "step": 3210, | |
| "train_runtime": 6198.4055, | |
| "train_tokens_per_second": 67870.998 | |
| }, | |
| { | |
| "epoch": 1.1620353662937568, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 1.937254445500979e-05, | |
| "loss": 2.194486618041992, | |
| "num_input_tokens_seen": 422002688, | |
| "step": 3220, | |
| "train_runtime": 6217.15, | |
| "train_tokens_per_second": 67877.192 | |
| }, | |
| { | |
| "epoch": 1.165644171779141, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 1.9231736837966384e-05, | |
| "loss": 2.242540740966797, | |
| "num_input_tokens_seen": 423313408, | |
| "step": 3230, | |
| "train_runtime": 6235.9087, | |
| "train_tokens_per_second": 67883.195 | |
| }, | |
| { | |
| "epoch": 1.1692529772645255, | |
| "grad_norm": 1.96875, | |
| "learning_rate": 1.909112223278236e-05, | |
| "loss": 2.2135072708129884, | |
| "num_input_tokens_seen": 424624128, | |
| "step": 3240, | |
| "train_runtime": 6254.6817, | |
| "train_tokens_per_second": 67889.006 | |
| }, | |
| { | |
| "epoch": 1.1728617827499097, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 1.895070534456316e-05, | |
| "loss": 2.252424430847168, | |
| "num_input_tokens_seen": 425934848, | |
| "step": 3250, | |
| "train_runtime": 6273.4441, | |
| "train_tokens_per_second": 67894.898 | |
| }, | |
| { | |
| "epoch": 1.1764705882352942, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 1.881049087179842e-05, | |
| "loss": 2.216765594482422, | |
| "num_input_tokens_seen": 427245568, | |
| "step": 3260, | |
| "train_runtime": 6292.2219, | |
| "train_tokens_per_second": 67900.588 | |
| }, | |
| { | |
| "epoch": 1.1800793937206784, | |
| "grad_norm": 1.921875, | |
| "learning_rate": 1.8670483506204745e-05, | |
| "loss": 2.2357194900512694, | |
| "num_input_tokens_seen": 428556288, | |
| "step": 3270, | |
| "train_runtime": 6310.9899, | |
| "train_tokens_per_second": 67906.35 | |
| }, | |
| { | |
| "epoch": 1.1836881992060628, | |
| "grad_norm": 1.71875, | |
| "learning_rate": 1.8530687932568753e-05, | |
| "loss": 2.248133087158203, | |
| "num_input_tokens_seen": 429867008, | |
| "step": 3280, | |
| "train_runtime": 6329.8002, | |
| "train_tokens_per_second": 67911.624 | |
| }, | |
| { | |
| "epoch": 1.187297004691447, | |
| "grad_norm": 1.828125, | |
| "learning_rate": 1.8391108828590244e-05, | |
| "loss": 2.214917755126953, | |
| "num_input_tokens_seen": 431177728, | |
| "step": 3290, | |
| "train_runtime": 6348.5929, | |
| "train_tokens_per_second": 67917.054 | |
| }, | |
| { | |
| "epoch": 1.1909058101768315, | |
| "grad_norm": 1.8828125, | |
| "learning_rate": 1.8251750864725782e-05, | |
| "loss": 2.179270935058594, | |
| "num_input_tokens_seen": 432488448, | |
| "step": 3300, | |
| "train_runtime": 6367.3551, | |
| "train_tokens_per_second": 67922.778 | |
| }, | |
| { | |
| "epoch": 1.1945146156622157, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 1.8112618704032325e-05, | |
| "loss": 2.2112674713134766, | |
| "num_input_tokens_seen": 433799168, | |
| "step": 3310, | |
| "train_runtime": 6389.3478, | |
| "train_tokens_per_second": 67894.124 | |
| }, | |
| { | |
| "epoch": 1.1981234211476002, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 1.7973717002011226e-05, | |
| "loss": 2.2106258392333986, | |
| "num_input_tokens_seen": 435109888, | |
| "step": 3320, | |
| "train_runtime": 6408.1106, | |
| "train_tokens_per_second": 67899.871 | |
| }, | |
| { | |
| "epoch": 1.2017322266329844, | |
| "grad_norm": 1.8828125, | |
| "learning_rate": 1.783505040645249e-05, | |
| "loss": 2.197174072265625, | |
| "num_input_tokens_seen": 436420608, | |
| "step": 3330, | |
| "train_runtime": 6426.8536, | |
| "train_tokens_per_second": 67905.796 | |
| }, | |
| { | |
| "epoch": 1.2053410321183688, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 1.76966235572792e-05, | |
| "loss": 2.216184616088867, | |
| "num_input_tokens_seen": 437731328, | |
| "step": 3340, | |
| "train_runtime": 6445.594, | |
| "train_tokens_per_second": 67911.713 | |
| }, | |
| { | |
| "epoch": 1.208949837603753, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 1.7558441086392305e-05, | |
| "loss": 2.179450798034668, | |
| "num_input_tokens_seen": 439042048, | |
| "step": 3350, | |
| "train_runtime": 6464.3436, | |
| "train_tokens_per_second": 67917.499 | |
| }, | |
| { | |
| "epoch": 1.2125586430891375, | |
| "grad_norm": 1.78125, | |
| "learning_rate": 1.742050761751558e-05, | |
| "loss": 2.254531478881836, | |
| "num_input_tokens_seen": 440352768, | |
| "step": 3360, | |
| "train_runtime": 6483.0846, | |
| "train_tokens_per_second": 67923.342 | |
| }, | |
| { | |
| "epoch": 1.2161674485745217, | |
| "grad_norm": 2.265625, | |
| "learning_rate": 1.7282827766040982e-05, | |
| "loss": 2.186991882324219, | |
| "num_input_tokens_seen": 441663488, | |
| "step": 3370, | |
| "train_runtime": 6501.8258, | |
| "train_tokens_per_second": 67929.148 | |
| }, | |
| { | |
| "epoch": 1.2197762540599062, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 1.714540613887415e-05, | |
| "loss": 2.190296173095703, | |
| "num_input_tokens_seen": 442974208, | |
| "step": 3380, | |
| "train_runtime": 6520.563, | |
| "train_tokens_per_second": 67934.963 | |
| }, | |
| { | |
| "epoch": 1.2233850595452904, | |
| "grad_norm": 1.84375, | |
| "learning_rate": 1.7008247334280292e-05, | |
| "loss": 2.233493614196777, | |
| "num_input_tokens_seen": 444284928, | |
| "step": 3390, | |
| "train_runtime": 6539.3093, | |
| "train_tokens_per_second": 67940.651 | |
| }, | |
| { | |
| "epoch": 1.2269938650306749, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 1.6871355941730295e-05, | |
| "loss": 2.224575996398926, | |
| "num_input_tokens_seen": 445595648, | |
| "step": 3400, | |
| "train_runtime": 6558.0392, | |
| "train_tokens_per_second": 67946.476 | |
| }, | |
| { | |
| "epoch": 1.230602670516059, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 1.6734736541747192e-05, | |
| "loss": 2.2136987686157226, | |
| "num_input_tokens_seen": 446906368, | |
| "step": 3410, | |
| "train_runtime": 6580.298, | |
| "train_tokens_per_second": 67915.825 | |
| }, | |
| { | |
| "epoch": 1.2342114760014435, | |
| "grad_norm": 1.59375, | |
| "learning_rate": 1.6598393705752843e-05, | |
| "loss": 2.2252714157104494, | |
| "num_input_tokens_seen": 448217088, | |
| "step": 3420, | |
| "train_runtime": 6599.0501, | |
| "train_tokens_per_second": 67921.456 | |
| }, | |
| { | |
| "epoch": 1.2378202814868278, | |
| "grad_norm": 2.421875, | |
| "learning_rate": 1.6462331995915042e-05, | |
| "loss": 2.2220790863037108, | |
| "num_input_tokens_seen": 449527808, | |
| "step": 3430, | |
| "train_runtime": 6617.8017, | |
| "train_tokens_per_second": 67927.06 | |
| }, | |
| { | |
| "epoch": 1.2414290869722122, | |
| "grad_norm": 1.921875, | |
| "learning_rate": 1.632655596499478e-05, | |
| "loss": 2.19171142578125, | |
| "num_input_tokens_seen": 450838528, | |
| "step": 3440, | |
| "train_runtime": 6636.5497, | |
| "train_tokens_per_second": 67932.668 | |
| }, | |
| { | |
| "epoch": 1.2450378924575964, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 1.6191070156193973e-05, | |
| "loss": 2.2106775283813476, | |
| "num_input_tokens_seen": 452149248, | |
| "step": 3450, | |
| "train_runtime": 6655.3073, | |
| "train_tokens_per_second": 67938.148 | |
| }, | |
| { | |
| "epoch": 1.2486466979429809, | |
| "grad_norm": 1.75, | |
| "learning_rate": 1.6055879103003393e-05, | |
| "loss": 2.2294937133789063, | |
| "num_input_tokens_seen": 453459968, | |
| "step": 3460, | |
| "train_runtime": 6674.058, | |
| "train_tokens_per_second": 67943.666 | |
| }, | |
| { | |
| "epoch": 1.2522555034283651, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 1.5920987329051016e-05, | |
| "loss": 2.257633018493652, | |
| "num_input_tokens_seen": 454770688, | |
| "step": 3470, | |
| "train_runtime": 6692.8111, | |
| "train_tokens_per_second": 67949.13 | |
| }, | |
| { | |
| "epoch": 1.2558643089137496, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 1.5786399347950607e-05, | |
| "loss": 2.2481691360473635, | |
| "num_input_tokens_seen": 456081408, | |
| "step": 3480, | |
| "train_runtime": 6711.5556, | |
| "train_tokens_per_second": 67954.649 | |
| }, | |
| { | |
| "epoch": 1.259473114399134, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 1.5652119663150755e-05, | |
| "loss": 2.25321102142334, | |
| "num_input_tokens_seen": 457392128, | |
| "step": 3490, | |
| "train_runtime": 6730.3387, | |
| "train_tokens_per_second": 67959.749 | |
| }, | |
| { | |
| "epoch": 1.2630819198845182, | |
| "grad_norm": 1.96875, | |
| "learning_rate": 1.551815276778411e-05, | |
| "loss": 2.201145553588867, | |
| "num_input_tokens_seen": 458702848, | |
| "step": 3500, | |
| "train_runtime": 6749.0904, | |
| "train_tokens_per_second": 67965.137 | |
| }, | |
| { | |
| "epoch": 1.2666907253699025, | |
| "grad_norm": 1.9296875, | |
| "learning_rate": 1.5384503144517105e-05, | |
| "loss": 2.2279090881347656, | |
| "num_input_tokens_seen": 460013568, | |
| "step": 3510, | |
| "train_runtime": 6772.1939, | |
| "train_tokens_per_second": 67926.816 | |
| }, | |
| { | |
| "epoch": 1.270299530855287, | |
| "grad_norm": 1.8984375, | |
| "learning_rate": 1.5251175265399909e-05, | |
| "loss": 2.2312782287597654, | |
| "num_input_tokens_seen": 461324288, | |
| "step": 3520, | |
| "train_runtime": 6791.1594, | |
| "train_tokens_per_second": 67930.122 | |
| }, | |
| { | |
| "epoch": 1.2739083363406714, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 1.5118173591716812e-05, | |
| "loss": 2.2547531127929688, | |
| "num_input_tokens_seen": 462635008, | |
| "step": 3530, | |
| "train_runtime": 6809.949, | |
| "train_tokens_per_second": 67935.165 | |
| }, | |
| { | |
| "epoch": 1.2775171418260556, | |
| "grad_norm": 1.734375, | |
| "learning_rate": 1.4985502573836957e-05, | |
| "loss": 2.2237892150878906, | |
| "num_input_tokens_seen": 463945728, | |
| "step": 3540, | |
| "train_runtime": 6828.7257, | |
| "train_tokens_per_second": 67940.308 | |
| }, | |
| { | |
| "epoch": 1.2811259473114398, | |
| "grad_norm": 1.8671875, | |
| "learning_rate": 1.4853166651065396e-05, | |
| "loss": 2.2387939453125, | |
| "num_input_tokens_seen": 465256448, | |
| "step": 3550, | |
| "train_runtime": 6847.4866, | |
| "train_tokens_per_second": 67945.58 | |
| }, | |
| { | |
| "epoch": 1.2847347527968243, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 1.4721170251494587e-05, | |
| "loss": 2.2387521743774412, | |
| "num_input_tokens_seen": 466567168, | |
| "step": 3560, | |
| "train_runtime": 6866.2656, | |
| "train_tokens_per_second": 67950.644 | |
| }, | |
| { | |
| "epoch": 1.2883435582822087, | |
| "grad_norm": 2.375, | |
| "learning_rate": 1.4589517791856167e-05, | |
| "loss": 2.2455513000488283, | |
| "num_input_tokens_seen": 467877888, | |
| "step": 3570, | |
| "train_runtime": 6885.0262, | |
| "train_tokens_per_second": 67955.862 | |
| }, | |
| { | |
| "epoch": 1.291952363767593, | |
| "grad_norm": 1.9453125, | |
| "learning_rate": 1.4458213677373245e-05, | |
| "loss": 2.2595149993896486, | |
| "num_input_tokens_seen": 469188608, | |
| "step": 3580, | |
| "train_runtime": 6903.7905, | |
| "train_tokens_per_second": 67961.014 | |
| }, | |
| { | |
| "epoch": 1.2955611692529772, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 1.4327262301612886e-05, | |
| "loss": 2.225126838684082, | |
| "num_input_tokens_seen": 470499328, | |
| "step": 3590, | |
| "train_runtime": 6922.5486, | |
| "train_tokens_per_second": 67966.201 | |
| }, | |
| { | |
| "epoch": 1.2991699747383616, | |
| "grad_norm": 1.90625, | |
| "learning_rate": 1.4196668046339251e-05, | |
| "loss": 2.197856903076172, | |
| "num_input_tokens_seen": 471810048, | |
| "step": 3600, | |
| "train_runtime": 6941.3026, | |
| "train_tokens_per_second": 67971.399 | |
| }, | |
| { | |
| "epoch": 1.302778780223746, | |
| "grad_norm": 1.7109375, | |
| "learning_rate": 1.4066435281366814e-05, | |
| "loss": 2.2238494873046877, | |
| "num_input_tokens_seen": 473120768, | |
| "step": 3610, | |
| "train_runtime": 6962.6928, | |
| "train_tokens_per_second": 67950.832 | |
| }, | |
| { | |
| "epoch": 1.3063875857091303, | |
| "grad_norm": 1.71875, | |
| "learning_rate": 1.3936568364414254e-05, | |
| "loss": 2.215565299987793, | |
| "num_input_tokens_seen": 474431488, | |
| "step": 3620, | |
| "train_runtime": 6981.4678, | |
| "train_tokens_per_second": 67955.837 | |
| }, | |
| { | |
| "epoch": 1.3099963911945145, | |
| "grad_norm": 1.953125, | |
| "learning_rate": 1.380707164095862e-05, | |
| "loss": 2.229986572265625, | |
| "num_input_tokens_seen": 475742208, | |
| "step": 3630, | |
| "train_runtime": 7000.2328, | |
| "train_tokens_per_second": 67960.913 | |
| }, | |
| { | |
| "epoch": 1.313605196679899, | |
| "grad_norm": 1.8046875, | |
| "learning_rate": 1.3677949444089907e-05, | |
| "loss": 2.273609924316406, | |
| "num_input_tokens_seen": 477052928, | |
| "step": 3640, | |
| "train_runtime": 7019.0256, | |
| "train_tokens_per_second": 67965.691 | |
| }, | |
| { | |
| "epoch": 1.3172140021652834, | |
| "grad_norm": 1.609375, | |
| "learning_rate": 1.3549206094366045e-05, | |
| "loss": 2.212572479248047, | |
| "num_input_tokens_seen": 478363648, | |
| "step": 3650, | |
| "train_runtime": 7037.7829, | |
| "train_tokens_per_second": 67970.788 | |
| }, | |
| { | |
| "epoch": 1.3208228076506676, | |
| "grad_norm": 2.0, | |
| "learning_rate": 1.3420845899668425e-05, | |
| "loss": 2.2558984756469727, | |
| "num_input_tokens_seen": 479674368, | |
| "step": 3660, | |
| "train_runtime": 7056.5456, | |
| "train_tokens_per_second": 67975.805 | |
| }, | |
| { | |
| "epoch": 1.3244316131360518, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 1.3292873155057616e-05, | |
| "loss": 2.2416217803955076, | |
| "num_input_tokens_seen": 480985088, | |
| "step": 3670, | |
| "train_runtime": 7075.3311, | |
| "train_tokens_per_second": 67980.577 | |
| }, | |
| { | |
| "epoch": 1.3280404186214363, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 1.3165292142629771e-05, | |
| "loss": 2.219058799743652, | |
| "num_input_tokens_seen": 482295808, | |
| "step": 3680, | |
| "train_runtime": 7094.1126, | |
| "train_tokens_per_second": 67985.361 | |
| }, | |
| { | |
| "epoch": 1.3316492241068207, | |
| "grad_norm": 1.6640625, | |
| "learning_rate": 1.3038107131373267e-05, | |
| "loss": 2.240825080871582, | |
| "num_input_tokens_seen": 483606528, | |
| "step": 3690, | |
| "train_runtime": 7112.88, | |
| "train_tokens_per_second": 67990.256 | |
| }, | |
| { | |
| "epoch": 1.335258029592205, | |
| "grad_norm": 1.7890625, | |
| "learning_rate": 1.2911322377025903e-05, | |
| "loss": 2.1871011734008787, | |
| "num_input_tokens_seen": 484917248, | |
| "step": 3700, | |
| "train_runtime": 7131.662, | |
| "train_tokens_per_second": 67994.985 | |
| }, | |
| { | |
| "epoch": 1.3388668350775892, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 1.2784942121932436e-05, | |
| "loss": 2.187872886657715, | |
| "num_input_tokens_seen": 486227968, | |
| "step": 3710, | |
| "train_runtime": 7152.9267, | |
| "train_tokens_per_second": 67976.087 | |
| }, | |
| { | |
| "epoch": 1.3424756405629736, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 1.2658970594902753e-05, | |
| "loss": 2.25146369934082, | |
| "num_input_tokens_seen": 487538688, | |
| "step": 3720, | |
| "train_runtime": 7171.733, | |
| "train_tokens_per_second": 67980.597 | |
| }, | |
| { | |
| "epoch": 1.346084446048358, | |
| "grad_norm": 1.921875, | |
| "learning_rate": 1.2533412011070223e-05, | |
| "loss": 2.2136253356933593, | |
| "num_input_tokens_seen": 488849408, | |
| "step": 3730, | |
| "train_runtime": 7190.5443, | |
| "train_tokens_per_second": 67985.036 | |
| }, | |
| { | |
| "epoch": 1.3496932515337423, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 1.2408270571750725e-05, | |
| "loss": 2.2115272521972655, | |
| "num_input_tokens_seen": 490160128, | |
| "step": 3740, | |
| "train_runtime": 7209.3456, | |
| "train_tokens_per_second": 67989.545 | |
| }, | |
| { | |
| "epoch": 1.3533020570191265, | |
| "grad_norm": 1.7734375, | |
| "learning_rate": 1.2283550464302118e-05, | |
| "loss": 2.2137119293212892, | |
| "num_input_tokens_seen": 491470848, | |
| "step": 3750, | |
| "train_runtime": 7228.1812, | |
| "train_tokens_per_second": 67993.709 | |
| }, | |
| { | |
| "epoch": 1.356910862504511, | |
| "grad_norm": 1.640625, | |
| "learning_rate": 1.2159255861984018e-05, | |
| "loss": 2.266486930847168, | |
| "num_input_tokens_seen": 492781568, | |
| "step": 3760, | |
| "train_runtime": 7247.0792, | |
| "train_tokens_per_second": 67997.266 | |
| }, | |
| { | |
| "epoch": 1.3605196679898954, | |
| "grad_norm": 2.34375, | |
| "learning_rate": 1.2035390923818243e-05, | |
| "loss": 2.1991031646728514, | |
| "num_input_tokens_seen": 494092288, | |
| "step": 3770, | |
| "train_runtime": 7265.8955, | |
| "train_tokens_per_second": 68001.568 | |
| }, | |
| { | |
| "epoch": 1.3641284734752797, | |
| "grad_norm": 1.9765625, | |
| "learning_rate": 1.1911959794449613e-05, | |
| "loss": 2.2052324295043944, | |
| "num_input_tokens_seen": 495403008, | |
| "step": 3780, | |
| "train_runtime": 7284.703, | |
| "train_tokens_per_second": 68005.931 | |
| }, | |
| { | |
| "epoch": 1.3677372789606639, | |
| "grad_norm": 1.609375, | |
| "learning_rate": 1.1788966604007276e-05, | |
| "loss": 2.2269506454467773, | |
| "num_input_tokens_seen": 496713728, | |
| "step": 3790, | |
| "train_runtime": 7303.501, | |
| "train_tokens_per_second": 68010.359 | |
| }, | |
| { | |
| "epoch": 1.3713460844460483, | |
| "grad_norm": 1.7578125, | |
| "learning_rate": 1.1666415467966477e-05, | |
| "loss": 2.2677322387695313, | |
| "num_input_tokens_seen": 498024448, | |
| "step": 3800, | |
| "train_runtime": 7322.3167, | |
| "train_tokens_per_second": 68014.601 | |
| }, | |
| { | |
| "epoch": 1.3749548899314328, | |
| "grad_norm": 1.8828125, | |
| "learning_rate": 1.1544310487010932e-05, | |
| "loss": 2.25917911529541, | |
| "num_input_tokens_seen": 499335168, | |
| "step": 3810, | |
| "train_runtime": 7343.6783, | |
| "train_tokens_per_second": 67995.24 | |
| }, | |
| { | |
| "epoch": 1.378563695416817, | |
| "grad_norm": 1.7890625, | |
| "learning_rate": 1.1422655746895508e-05, | |
| "loss": 2.1915868759155273, | |
| "num_input_tokens_seen": 500645888, | |
| "step": 3820, | |
| "train_runtime": 7362.4631, | |
| "train_tokens_per_second": 67999.783 | |
| }, | |
| { | |
| "epoch": 1.3821725009022015, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 1.1301455318309586e-05, | |
| "loss": 2.1912534713745115, | |
| "num_input_tokens_seen": 501956608, | |
| "step": 3830, | |
| "train_runtime": 7381.2253, | |
| "train_tokens_per_second": 68004.51 | |
| }, | |
| { | |
| "epoch": 1.3857813063875857, | |
| "grad_norm": 1.78125, | |
| "learning_rate": 1.1180713256740835e-05, | |
| "loss": 2.268548583984375, | |
| "num_input_tokens_seen": 503267328, | |
| "step": 3840, | |
| "train_runtime": 7400.018, | |
| "train_tokens_per_second": 68008.933 | |
| }, | |
| { | |
| "epoch": 1.3893901118729701, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 1.1060433602339502e-05, | |
| "loss": 2.223955535888672, | |
| "num_input_tokens_seen": 504578048, | |
| "step": 3850, | |
| "train_runtime": 7418.8214, | |
| "train_tokens_per_second": 68013.236 | |
| }, | |
| { | |
| "epoch": 1.3929989173583543, | |
| "grad_norm": 1.6484375, | |
| "learning_rate": 1.0940620379783195e-05, | |
| "loss": 2.2536026000976563, | |
| "num_input_tokens_seen": 505888768, | |
| "step": 3860, | |
| "train_runtime": 7437.601, | |
| "train_tokens_per_second": 68017.735 | |
| }, | |
| { | |
| "epoch": 1.3966077228437388, | |
| "grad_norm": 1.9453125, | |
| "learning_rate": 1.082127759814231e-05, | |
| "loss": 2.245090103149414, | |
| "num_input_tokens_seen": 507199488, | |
| "step": 3870, | |
| "train_runtime": 7456.3604, | |
| "train_tokens_per_second": 68022.394 | |
| }, | |
| { | |
| "epoch": 1.400216528329123, | |
| "grad_norm": 1.875, | |
| "learning_rate": 1.0702409250745751e-05, | |
| "loss": 2.2549039840698244, | |
| "num_input_tokens_seen": 508510208, | |
| "step": 3880, | |
| "train_runtime": 7475.13, | |
| "train_tokens_per_second": 68026.939 | |
| }, | |
| { | |
| "epoch": 1.4038253338145075, | |
| "grad_norm": 1.8359375, | |
| "learning_rate": 1.0584019315047423e-05, | |
| "loss": 2.2847557067871094, | |
| "num_input_tokens_seen": 509820928, | |
| "step": 3890, | |
| "train_runtime": 7493.8996, | |
| "train_tokens_per_second": 68031.46 | |
| }, | |
| { | |
| "epoch": 1.4074341392998917, | |
| "grad_norm": 1.890625, | |
| "learning_rate": 1.0466111752493077e-05, | |
| "loss": 2.2113019943237306, | |
| "num_input_tokens_seen": 511131648, | |
| "step": 3900, | |
| "train_runtime": 7512.6698, | |
| "train_tokens_per_second": 68035.953 | |
| }, | |
| { | |
| "epoch": 1.4110429447852761, | |
| "grad_norm": 1.6953125, | |
| "learning_rate": 1.034869050838779e-05, | |
| "loss": 2.2435705184936525, | |
| "num_input_tokens_seen": 512442368, | |
| "step": 3910, | |
| "train_runtime": 7534.829, | |
| "train_tokens_per_second": 68009.821 | |
| }, | |
| { | |
| "epoch": 1.4146517502706604, | |
| "grad_norm": 1.65625, | |
| "learning_rate": 1.0231759511763902e-05, | |
| "loss": 2.2892152786254885, | |
| "num_input_tokens_seen": 513753088, | |
| "step": 3920, | |
| "train_runtime": 7553.6258, | |
| "train_tokens_per_second": 68014.104 | |
| }, | |
| { | |
| "epoch": 1.4182605557560448, | |
| "grad_norm": 2.171875, | |
| "learning_rate": 1.0115322675249642e-05, | |
| "loss": 2.216525077819824, | |
| "num_input_tokens_seen": 515063808, | |
| "step": 3930, | |
| "train_runtime": 7572.4038, | |
| "train_tokens_per_second": 68018.534 | |
| }, | |
| { | |
| "epoch": 1.421869361241429, | |
| "grad_norm": 1.828125, | |
| "learning_rate": 9.999383894938086e-06, | |
| "loss": 2.2413888931274415, | |
| "num_input_tokens_seen": 516374528, | |
| "step": 3940, | |
| "train_runtime": 7591.1718, | |
| "train_tokens_per_second": 68023.033 | |
| }, | |
| { | |
| "epoch": 1.4254781667268135, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 9.883947050256884e-06, | |
| "loss": 2.204883575439453, | |
| "num_input_tokens_seen": 517685248, | |
| "step": 3950, | |
| "train_runtime": 7609.9505, | |
| "train_tokens_per_second": 68027.413 | |
| }, | |
| { | |
| "epoch": 1.4290869722121977, | |
| "grad_norm": 1.8984375, | |
| "learning_rate": 9.769016003838421e-06, | |
| "loss": 2.215869140625, | |
| "num_input_tokens_seen": 518995968, | |
| "step": 3960, | |
| "train_runtime": 7628.7261, | |
| "train_tokens_per_second": 68031.8 | |
| }, | |
| { | |
| "epoch": 1.4326957776975822, | |
| "grad_norm": 1.6953125, | |
| "learning_rate": 9.654594601390534e-06, | |
| "loss": 2.277448844909668, | |
| "num_input_tokens_seen": 520306688, | |
| "step": 3970, | |
| "train_runtime": 7647.5178, | |
| "train_tokens_per_second": 68036.021 | |
| }, | |
| { | |
| "epoch": 1.4363045831829664, | |
| "grad_norm": 1.8046875, | |
| "learning_rate": 9.5406866715679e-06, | |
| "loss": 2.23470516204834, | |
| "num_input_tokens_seen": 521617408, | |
| "step": 3980, | |
| "train_runtime": 7666.2817, | |
| "train_tokens_per_second": 68040.47 | |
| }, | |
| { | |
| "epoch": 1.4399133886683508, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 9.427296025843862e-06, | |
| "loss": 2.2300508499145506, | |
| "num_input_tokens_seen": 522928128, | |
| "step": 3990, | |
| "train_runtime": 7685.0659, | |
| "train_tokens_per_second": 68044.716 | |
| }, | |
| { | |
| "epoch": 1.443522194153735, | |
| "grad_norm": 1.7421875, | |
| "learning_rate": 9.314426458382938e-06, | |
| "loss": 2.254155731201172, | |
| "num_input_tokens_seen": 524238848, | |
| "step": 4000, | |
| "train_runtime": 7703.8585, | |
| "train_tokens_per_second": 68048.867 | |
| }, | |
| { | |
| "epoch": 1.4471309996391195, | |
| "grad_norm": 1.9453125, | |
| "learning_rate": 9.20208174591383e-06, | |
| "loss": 2.233040618896484, | |
| "num_input_tokens_seen": 525549568, | |
| "step": 4010, | |
| "train_runtime": 7727.4509, | |
| "train_tokens_per_second": 68010.729 | |
| }, | |
| { | |
| "epoch": 1.4507398051245037, | |
| "grad_norm": 1.9453125, | |
| "learning_rate": 9.090265647603083e-06, | |
| "loss": 2.220596122741699, | |
| "num_input_tokens_seen": 526860288, | |
| "step": 4020, | |
| "train_runtime": 7746.2345, | |
| "train_tokens_per_second": 68015.019 | |
| }, | |
| { | |
| "epoch": 1.4543486106098882, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 8.97898190492926e-06, | |
| "loss": 2.231102180480957, | |
| "num_input_tokens_seen": 528171008, | |
| "step": 4030, | |
| "train_runtime": 7765.0306, | |
| "train_tokens_per_second": 68019.18 | |
| }, | |
| { | |
| "epoch": 1.4579574160952724, | |
| "grad_norm": 1.5390625, | |
| "learning_rate": 8.868234241557788e-06, | |
| "loss": 2.213207244873047, | |
| "num_input_tokens_seen": 529481728, | |
| "step": 4040, | |
| "train_runtime": 7783.8347, | |
| "train_tokens_per_second": 68023.249 | |
| }, | |
| { | |
| "epoch": 1.4615662215806569, | |
| "grad_norm": 1.7734375, | |
| "learning_rate": 8.758026363216345e-06, | |
| "loss": 2.2278326034545897, | |
| "num_input_tokens_seen": 530792448, | |
| "step": 4050, | |
| "train_runtime": 7802.6402, | |
| "train_tokens_per_second": 68027.287 | |
| }, | |
| { | |
| "epoch": 1.465175027066041, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 8.648361957570859e-06, | |
| "loss": 2.2364572525024413, | |
| "num_input_tokens_seen": 532103168, | |
| "step": 4060, | |
| "train_runtime": 7821.428, | |
| "train_tokens_per_second": 68031.46 | |
| }, | |
| { | |
| "epoch": 1.4687838325514255, | |
| "grad_norm": 1.5859375, | |
| "learning_rate": 8.539244694102107e-06, | |
| "loss": 2.2006353378295898, | |
| "num_input_tokens_seen": 533413888, | |
| "step": 4070, | |
| "train_runtime": 7840.2057, | |
| "train_tokens_per_second": 68035.7 | |
| }, | |
| { | |
| "epoch": 1.4723926380368098, | |
| "grad_norm": 1.71875, | |
| "learning_rate": 8.430678223982969e-06, | |
| "loss": 2.2076269149780274, | |
| "num_input_tokens_seen": 534724608, | |
| "step": 4080, | |
| "train_runtime": 7858.9877, | |
| "train_tokens_per_second": 68039.883 | |
| }, | |
| { | |
| "epoch": 1.4760014435221942, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 8.322666179956188e-06, | |
| "loss": 2.2272457122802733, | |
| "num_input_tokens_seen": 536035328, | |
| "step": 4090, | |
| "train_runtime": 7877.7613, | |
| "train_tokens_per_second": 68044.119 | |
| }, | |
| { | |
| "epoch": 1.4796102490075784, | |
| "grad_norm": 1.7578125, | |
| "learning_rate": 8.21521217621288e-06, | |
| "loss": 2.2090341567993166, | |
| "num_input_tokens_seen": 537346048, | |
| "step": 4100, | |
| "train_runtime": 7896.5448, | |
| "train_tokens_per_second": 68048.25 | |
| }, | |
| { | |
| "epoch": 1.4832190544929629, | |
| "grad_norm": 1.6640625, | |
| "learning_rate": 8.10831980827158e-06, | |
| "loss": 2.2423015594482423, | |
| "num_input_tokens_seen": 538656768, | |
| "step": 4110, | |
| "train_runtime": 7917.941, | |
| "train_tokens_per_second": 68029.904 | |
| }, | |
| { | |
| "epoch": 1.486827859978347, | |
| "grad_norm": 1.6953125, | |
| "learning_rate": 8.001992652857912e-06, | |
| "loss": 2.2490259170532227, | |
| "num_input_tokens_seen": 539967488, | |
| "step": 4120, | |
| "train_runtime": 7936.7037, | |
| "train_tokens_per_second": 68034.225 | |
| }, | |
| { | |
| "epoch": 1.4904366654637315, | |
| "grad_norm": 1.7421875, | |
| "learning_rate": 7.896234267784927e-06, | |
| "loss": 2.231982421875, | |
| "num_input_tokens_seen": 541278208, | |
| "step": 4130, | |
| "train_runtime": 7955.4671, | |
| "train_tokens_per_second": 68038.52 | |
| }, | |
| { | |
| "epoch": 1.4940454709491158, | |
| "grad_norm": 1.84375, | |
| "learning_rate": 7.791048191834065e-06, | |
| "loss": 2.2456960678100586, | |
| "num_input_tokens_seen": 542588928, | |
| "step": 4140, | |
| "train_runtime": 7974.2373, | |
| "train_tokens_per_second": 68042.736 | |
| }, | |
| { | |
| "epoch": 1.4976542764345002, | |
| "grad_norm": 1.5546875, | |
| "learning_rate": 7.686437944636699e-06, | |
| "loss": 2.2039539337158205, | |
| "num_input_tokens_seen": 543899648, | |
| "step": 4150, | |
| "train_runtime": 7993.0139, | |
| "train_tokens_per_second": 68046.878 | |
| }, | |
| { | |
| "epoch": 1.5012630819198844, | |
| "grad_norm": 1.546875, | |
| "learning_rate": 7.582407026556423e-06, | |
| "loss": 2.240394401550293, | |
| "num_input_tokens_seen": 545210368, | |
| "step": 4160, | |
| "train_runtime": 8011.786, | |
| "train_tokens_per_second": 68051.04 | |
| }, | |
| { | |
| "epoch": 1.504871887405269, | |
| "grad_norm": 1.71875, | |
| "learning_rate": 7.478958918571899e-06, | |
| "loss": 2.2381542205810545, | |
| "num_input_tokens_seen": 546521088, | |
| "step": 4170, | |
| "train_runtime": 8030.5448, | |
| "train_tokens_per_second": 68055.294 | |
| }, | |
| { | |
| "epoch": 1.5084806928906533, | |
| "grad_norm": 1.7578125, | |
| "learning_rate": 7.376097082160344e-06, | |
| "loss": 2.263725471496582, | |
| "num_input_tokens_seen": 547831808, | |
| "step": 4180, | |
| "train_runtime": 8049.3053, | |
| "train_tokens_per_second": 68059.514 | |
| }, | |
| { | |
| "epoch": 1.5120894983760376, | |
| "grad_norm": 1.640625, | |
| "learning_rate": 7.273824959181805e-06, | |
| "loss": 2.261068916320801, | |
| "num_input_tokens_seen": 549142528, | |
| "step": 4190, | |
| "train_runtime": 8068.0708, | |
| "train_tokens_per_second": 68063.672 | |
| }, | |
| { | |
| "epoch": 1.5156983038614218, | |
| "grad_norm": 1.6328125, | |
| "learning_rate": 7.172145971763858e-06, | |
| "loss": 2.2464086532592775, | |
| "num_input_tokens_seen": 550453248, | |
| "step": 4200, | |
| "train_runtime": 8086.8528, | |
| "train_tokens_per_second": 68067.673 | |
| }, | |
| { | |
| "epoch": 1.5193071093468062, | |
| "grad_norm": 1.7421875, | |
| "learning_rate": 7.071063522187218e-06, | |
| "loss": 2.190806198120117, | |
| "num_input_tokens_seen": 551763968, | |
| "step": 4210, | |
| "train_runtime": 8108.814, | |
| "train_tokens_per_second": 68044.965 | |
| }, | |
| { | |
| "epoch": 1.5229159148321907, | |
| "grad_norm": 1.59375, | |
| "learning_rate": 6.970580992771828e-06, | |
| "loss": 2.264400291442871, | |
| "num_input_tokens_seen": 553074688, | |
| "step": 4220, | |
| "train_runtime": 8127.6062, | |
| "train_tokens_per_second": 68048.903 | |
| }, | |
| { | |
| "epoch": 1.526524720317575, | |
| "grad_norm": 1.609375, | |
| "learning_rate": 6.870701745763708e-06, | |
| "loss": 2.209558868408203, | |
| "num_input_tokens_seen": 554385408, | |
| "step": 4230, | |
| "train_runtime": 8146.3988, | |
| "train_tokens_per_second": 68052.82 | |
| }, | |
| { | |
| "epoch": 1.5301335258029591, | |
| "grad_norm": 1.8203125, | |
| "learning_rate": 6.771429123222433e-06, | |
| "loss": 2.247188377380371, | |
| "num_input_tokens_seen": 555696128, | |
| "step": 4240, | |
| "train_runtime": 8165.1848, | |
| "train_tokens_per_second": 68056.773 | |
| }, | |
| { | |
| "epoch": 1.5337423312883436, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 6.672766446909326e-06, | |
| "loss": 2.1808168411254885, | |
| "num_input_tokens_seen": 557006848, | |
| "step": 4250, | |
| "train_runtime": 8183.9739, | |
| "train_tokens_per_second": 68060.683 | |
| }, | |
| { | |
| "epoch": 1.537351136773728, | |
| "grad_norm": 1.5078125, | |
| "learning_rate": 6.574717018176299e-06, | |
| "loss": 2.2411041259765625, | |
| "num_input_tokens_seen": 558317568, | |
| "step": 4260, | |
| "train_runtime": 8202.7537, | |
| "train_tokens_per_second": 68064.651 | |
| }, | |
| { | |
| "epoch": 1.5409599422591123, | |
| "grad_norm": 1.8671875, | |
| "learning_rate": 6.477284117855381e-06, | |
| "loss": 2.2084012985229493, | |
| "num_input_tokens_seen": 559628288, | |
| "step": 4270, | |
| "train_runtime": 8221.5449, | |
| "train_tokens_per_second": 68068.507 | |
| }, | |
| { | |
| "epoch": 1.5445687477444965, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 6.380471006148953e-06, | |
| "loss": 2.2226863861083985, | |
| "num_input_tokens_seen": 560939008, | |
| "step": 4280, | |
| "train_runtime": 8240.3269, | |
| "train_tokens_per_second": 68072.422 | |
| }, | |
| { | |
| "epoch": 1.548177553229881, | |
| "grad_norm": 1.6015625, | |
| "learning_rate": 6.284280922520644e-06, | |
| "loss": 2.2183189392089844, | |
| "num_input_tokens_seen": 562249728, | |
| "step": 4290, | |
| "train_runtime": 8259.111, | |
| "train_tokens_per_second": 68076.301 | |
| }, | |
| { | |
| "epoch": 1.5517863587152654, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 6.188717085586923e-06, | |
| "loss": 2.2236093521118163, | |
| "num_input_tokens_seen": 563560448, | |
| "step": 4300, | |
| "train_runtime": 8277.9212, | |
| "train_tokens_per_second": 68079.948 | |
| }, | |
| { | |
| "epoch": 1.5553951642006496, | |
| "grad_norm": 1.5234375, | |
| "learning_rate": 6.0937826930094425e-06, | |
| "loss": 2.2661991119384766, | |
| "num_input_tokens_seen": 564871168, | |
| "step": 4310, | |
| "train_runtime": 8301.5548, | |
| "train_tokens_per_second": 68044.021 | |
| }, | |
| { | |
| "epoch": 1.5590039696860338, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 5.999480921388001e-06, | |
| "loss": 2.2453027725219727, | |
| "num_input_tokens_seen": 566181888, | |
| "step": 4320, | |
| "train_runtime": 8320.3497, | |
| "train_tokens_per_second": 68047.847 | |
| }, | |
| { | |
| "epoch": 1.5626127751714183, | |
| "grad_norm": 1.8125, | |
| "learning_rate": 5.90581492615428e-06, | |
| "loss": 2.22461051940918, | |
| "num_input_tokens_seen": 567492608, | |
| "step": 4330, | |
| "train_runtime": 8339.1504, | |
| "train_tokens_per_second": 68051.609 | |
| }, | |
| { | |
| "epoch": 1.5662215806568027, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 5.812787841466233e-06, | |
| "loss": 2.2348844528198244, | |
| "num_input_tokens_seen": 568803328, | |
| "step": 4340, | |
| "train_runtime": 8357.927, | |
| "train_tokens_per_second": 68055.551 | |
| }, | |
| { | |
| "epoch": 1.569830386142187, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 5.7204027801032404e-06, | |
| "loss": 2.2349353790283204, | |
| "num_input_tokens_seen": 570114048, | |
| "step": 4350, | |
| "train_runtime": 8376.7006, | |
| "train_tokens_per_second": 68059.499 | |
| }, | |
| { | |
| "epoch": 1.5734391916275712, | |
| "grad_norm": 1.875, | |
| "learning_rate": 5.6286628333619196e-06, | |
| "loss": 2.2075759887695314, | |
| "num_input_tokens_seen": 571424768, | |
| "step": 4360, | |
| "train_runtime": 8395.4768, | |
| "train_tokens_per_second": 68063.409 | |
| }, | |
| { | |
| "epoch": 1.5770479971129556, | |
| "grad_norm": 1.7890625, | |
| "learning_rate": 5.537571070952727e-06, | |
| "loss": 2.206249809265137, | |
| "num_input_tokens_seen": 572735488, | |
| "step": 4370, | |
| "train_runtime": 8414.2644, | |
| "train_tokens_per_second": 68067.208 | |
| }, | |
| { | |
| "epoch": 1.58065680259834, | |
| "grad_norm": 1.6875, | |
| "learning_rate": 5.4471305408972215e-06, | |
| "loss": 2.2273490905761717, | |
| "num_input_tokens_seen": 574046208, | |
| "step": 4380, | |
| "train_runtime": 8433.0466, | |
| "train_tokens_per_second": 68071.034 | |
| }, | |
| { | |
| "epoch": 1.5842656080837243, | |
| "grad_norm": 1.640625, | |
| "learning_rate": 5.357344269426046e-06, | |
| "loss": 2.2429645538330076, | |
| "num_input_tokens_seen": 575356928, | |
| "step": 4390, | |
| "train_runtime": 8451.8411, | |
| "train_tokens_per_second": 68074.745 | |
| }, | |
| { | |
| "epoch": 1.5878744135691085, | |
| "grad_norm": 1.65625, | |
| "learning_rate": 5.268215260877749e-06, | |
| "loss": 2.268222427368164, | |
| "num_input_tokens_seen": 576667648, | |
| "step": 4400, | |
| "train_runtime": 8470.6315, | |
| "train_tokens_per_second": 68078.472 | |
| }, | |
| { | |
| "epoch": 1.591483219054493, | |
| "grad_norm": 1.609375, | |
| "learning_rate": 5.179746497598154e-06, | |
| "loss": 2.2321073532104494, | |
| "num_input_tokens_seen": 577978368, | |
| "step": 4410, | |
| "train_runtime": 8492.2709, | |
| "train_tokens_per_second": 68059.342 | |
| }, | |
| { | |
| "epoch": 1.5950920245398774, | |
| "grad_norm": 1.6328125, | |
| "learning_rate": 5.091940939840639e-06, | |
| "loss": 2.2371564865112306, | |
| "num_input_tokens_seen": 579289088, | |
| "step": 4420, | |
| "train_runtime": 8511.0351, | |
| "train_tokens_per_second": 68063.295 | |
| }, | |
| { | |
| "epoch": 1.5987008300252616, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 5.004801525667063e-06, | |
| "loss": 2.235270690917969, | |
| "num_input_tokens_seen": 580599808, | |
| "step": 4430, | |
| "train_runtime": 8529.8242, | |
| "train_tokens_per_second": 68067.031 | |
| }, | |
| { | |
| "epoch": 1.6023096355106459, | |
| "grad_norm": 1.5859375, | |
| "learning_rate": 4.918331170849458e-06, | |
| "loss": 2.210706901550293, | |
| "num_input_tokens_seen": 581910528, | |
| "step": 4440, | |
| "train_runtime": 8548.5848, | |
| "train_tokens_per_second": 68070.978 | |
| }, | |
| { | |
| "epoch": 1.6059184409960303, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 4.832532768772427e-06, | |
| "loss": 2.240275573730469, | |
| "num_input_tokens_seen": 583221248, | |
| "step": 4450, | |
| "train_runtime": 8567.3411, | |
| "train_tokens_per_second": 68074.942 | |
| }, | |
| { | |
| "epoch": 1.6095272464814148, | |
| "grad_norm": 1.5546875, | |
| "learning_rate": 4.747409190336419e-06, | |
| "loss": 2.208348274230957, | |
| "num_input_tokens_seen": 584531968, | |
| "step": 4460, | |
| "train_runtime": 8586.1174, | |
| "train_tokens_per_second": 68078.73 | |
| }, | |
| { | |
| "epoch": 1.613136051966799, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 4.662963283861552e-06, | |
| "loss": 2.232676315307617, | |
| "num_input_tokens_seen": 585842688, | |
| "step": 4470, | |
| "train_runtime": 8604.862, | |
| "train_tokens_per_second": 68082.752 | |
| }, | |
| { | |
| "epoch": 1.6167448574521832, | |
| "grad_norm": 1.546875, | |
| "learning_rate": 4.579197874992397e-06, | |
| "loss": 2.217829704284668, | |
| "num_input_tokens_seen": 587153408, | |
| "step": 4480, | |
| "train_runtime": 8623.6217, | |
| "train_tokens_per_second": 68086.638 | |
| }, | |
| { | |
| "epoch": 1.6203536629375677, | |
| "grad_norm": 1.6953125, | |
| "learning_rate": 4.496115766603381e-06, | |
| "loss": 2.230474853515625, | |
| "num_input_tokens_seen": 588464128, | |
| "step": 4490, | |
| "train_runtime": 8642.3776, | |
| "train_tokens_per_second": 68090.537 | |
| }, | |
| { | |
| "epoch": 1.623962468422952, | |
| "grad_norm": 1.6640625, | |
| "learning_rate": 4.413719738705022e-06, | |
| "loss": 2.259794998168945, | |
| "num_input_tokens_seen": 589774848, | |
| "step": 4500, | |
| "train_runtime": 8661.1385, | |
| "train_tokens_per_second": 68094.379 | |
| }, | |
| { | |
| "epoch": 1.6275712739083363, | |
| "grad_norm": 1.4609375, | |
| "learning_rate": 4.332012548350869e-06, | |
| "loss": 2.2199661254882814, | |
| "num_input_tokens_seen": 591085568, | |
| "step": 4510, | |
| "train_runtime": 8683.6098, | |
| "train_tokens_per_second": 68069.107 | |
| }, | |
| { | |
| "epoch": 1.6311800793937206, | |
| "grad_norm": 1.765625, | |
| "learning_rate": 4.250996929545328e-06, | |
| "loss": 2.2052333831787108, | |
| "num_input_tokens_seen": 592396288, | |
| "step": 4520, | |
| "train_runtime": 8702.383, | |
| "train_tokens_per_second": 68072.882 | |
| }, | |
| { | |
| "epoch": 1.634788884879105, | |
| "grad_norm": 1.5859375, | |
| "learning_rate": 4.170675593152084e-06, | |
| "loss": 2.22857780456543, | |
| "num_input_tokens_seen": 593707008, | |
| "step": 4530, | |
| "train_runtime": 8721.1218, | |
| "train_tokens_per_second": 68076.908 | |
| }, | |
| { | |
| "epoch": 1.6383976903644895, | |
| "grad_norm": 1.59375, | |
| "learning_rate": 4.091051226803455e-06, | |
| "loss": 2.2302345275878905, | |
| "num_input_tokens_seen": 595017728, | |
| "step": 4540, | |
| "train_runtime": 8739.8538, | |
| "train_tokens_per_second": 68080.97 | |
| }, | |
| { | |
| "epoch": 1.6420064958498737, | |
| "grad_norm": 1.6171875, | |
| "learning_rate": 4.012126494810442e-06, | |
| "loss": 2.2529813766479494, | |
| "num_input_tokens_seen": 596328448, | |
| "step": 4550, | |
| "train_runtime": 8758.5938, | |
| "train_tokens_per_second": 68084.953 | |
| }, | |
| { | |
| "epoch": 1.645615301335258, | |
| "grad_norm": 1.5703125, | |
| "learning_rate": 3.933904038073591e-06, | |
| "loss": 2.236446571350098, | |
| "num_input_tokens_seen": 597639168, | |
| "step": 4560, | |
| "train_runtime": 8777.3287, | |
| "train_tokens_per_second": 68088.958 | |
| }, | |
| { | |
| "epoch": 1.6492241068206424, | |
| "grad_norm": 1.6953125, | |
| "learning_rate": 3.856386473994586e-06, | |
| "loss": 2.2221988677978515, | |
| "num_input_tokens_seen": 598949888, | |
| "step": 4570, | |
| "train_runtime": 8796.0733, | |
| "train_tokens_per_second": 68092.871 | |
| }, | |
| { | |
| "epoch": 1.6528329123060268, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 3.7795763963887285e-06, | |
| "loss": 2.2259494781494142, | |
| "num_input_tokens_seen": 600260608, | |
| "step": 4580, | |
| "train_runtime": 8814.8099, | |
| "train_tokens_per_second": 68096.829 | |
| }, | |
| { | |
| "epoch": 1.656441717791411, | |
| "grad_norm": 1.71875, | |
| "learning_rate": 3.703476375398102e-06, | |
| "loss": 2.192581367492676, | |
| "num_input_tokens_seen": 601571328, | |
| "step": 4590, | |
| "train_runtime": 8833.5575, | |
| "train_tokens_per_second": 68100.686 | |
| }, | |
| { | |
| "epoch": 1.6600505232767953, | |
| "grad_norm": 1.734375, | |
| "learning_rate": 3.6280889574055705e-06, | |
| "loss": 2.192411422729492, | |
| "num_input_tokens_seen": 602882048, | |
| "step": 4600, | |
| "train_runtime": 8852.2952, | |
| "train_tokens_per_second": 68104.603 | |
| }, | |
| { | |
| "epoch": 1.6636593287621797, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 3.5534166649496214e-06, | |
| "loss": 2.221910095214844, | |
| "num_input_tokens_seen": 604192768, | |
| "step": 4610, | |
| "train_runtime": 8873.4058, | |
| "train_tokens_per_second": 68090.289 | |
| }, | |
| { | |
| "epoch": 1.6672681342475641, | |
| "grad_norm": 1.5, | |
| "learning_rate": 3.4794619966398933e-06, | |
| "loss": 2.2242570877075196, | |
| "num_input_tokens_seen": 605503488, | |
| "step": 4620, | |
| "train_runtime": 8892.1416, | |
| "train_tokens_per_second": 68094.224 | |
| }, | |
| { | |
| "epoch": 1.6708769397329484, | |
| "grad_norm": 2.0, | |
| "learning_rate": 3.4062274270736188e-06, | |
| "loss": 2.250449371337891, | |
| "num_input_tokens_seen": 606814208, | |
| "step": 4630, | |
| "train_runtime": 8910.8743, | |
| "train_tokens_per_second": 68098.167 | |
| }, | |
| { | |
| "epoch": 1.6744857452183326, | |
| "grad_norm": 1.6015625, | |
| "learning_rate": 3.333715406752802e-06, | |
| "loss": 2.212891387939453, | |
| "num_input_tokens_seen": 608124928, | |
| "step": 4640, | |
| "train_runtime": 8929.6138, | |
| "train_tokens_per_second": 68102.042 | |
| }, | |
| { | |
| "epoch": 1.678094550703717, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 3.261928362002237e-06, | |
| "loss": 2.264537239074707, | |
| "num_input_tokens_seen": 609435648, | |
| "step": 4650, | |
| "train_runtime": 8948.3657, | |
| "train_tokens_per_second": 68105.805 | |
| }, | |
| { | |
| "epoch": 1.6817033561891015, | |
| "grad_norm": 1.7734375, | |
| "learning_rate": 3.190868694888277e-06, | |
| "loss": 2.2667461395263673, | |
| "num_input_tokens_seen": 610746368, | |
| "step": 4660, | |
| "train_runtime": 8967.1058, | |
| "train_tokens_per_second": 68109.642 | |
| }, | |
| { | |
| "epoch": 1.6853121616744857, | |
| "grad_norm": 1.6484375, | |
| "learning_rate": 3.120538783138538e-06, | |
| "loss": 2.1905519485473635, | |
| "num_input_tokens_seen": 612057088, | |
| "step": 4670, | |
| "train_runtime": 8985.8457, | |
| "train_tokens_per_second": 68113.465 | |
| }, | |
| { | |
| "epoch": 1.68892096715987, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 3.050940980062253e-06, | |
| "loss": 2.1842899322509766, | |
| "num_input_tokens_seen": 613367808, | |
| "step": 4680, | |
| "train_runtime": 9004.585, | |
| "train_tokens_per_second": 68117.276 | |
| }, | |
| { | |
| "epoch": 1.6925297726452544, | |
| "grad_norm": 1.484375, | |
| "learning_rate": 2.982077614471579e-06, | |
| "loss": 2.238359260559082, | |
| "num_input_tokens_seen": 614678528, | |
| "step": 4690, | |
| "train_runtime": 9023.3179, | |
| "train_tokens_per_second": 68121.121 | |
| }, | |
| { | |
| "epoch": 1.6961385781306388, | |
| "grad_norm": 1.46875, | |
| "learning_rate": 2.913950990603667e-06, | |
| "loss": 2.265069770812988, | |
| "num_input_tokens_seen": 615989248, | |
| "step": 4700, | |
| "train_runtime": 9042.0664, | |
| "train_tokens_per_second": 68124.831 | |
| }, | |
| { | |
| "epoch": 1.699747383616023, | |
| "grad_norm": 1.484375, | |
| "learning_rate": 2.8465633880435465e-06, | |
| "loss": 2.24379825592041, | |
| "num_input_tokens_seen": 617299968, | |
| "step": 4710, | |
| "train_runtime": 9062.9577, | |
| "train_tokens_per_second": 68112.418 | |
| }, | |
| { | |
| "epoch": 1.7033561891014073, | |
| "grad_norm": 1.4921875, | |
| "learning_rate": 2.779917061647841e-06, | |
| "loss": 2.1853158950805662, | |
| "num_input_tokens_seen": 618610688, | |
| "step": 4720, | |
| "train_runtime": 9081.7043, | |
| "train_tokens_per_second": 68116.145 | |
| }, | |
| { | |
| "epoch": 1.7069649945867917, | |
| "grad_norm": 1.5546875, | |
| "learning_rate": 2.714014241469362e-06, | |
| "loss": 2.2281778335571287, | |
| "num_input_tokens_seen": 619921408, | |
| "step": 4730, | |
| "train_runtime": 9100.4405, | |
| "train_tokens_per_second": 68119.934 | |
| }, | |
| { | |
| "epoch": 1.7105738000721762, | |
| "grad_norm": 1.734375, | |
| "learning_rate": 2.6488571326824253e-06, | |
| "loss": 2.202262115478516, | |
| "num_input_tokens_seen": 621232128, | |
| "step": 4740, | |
| "train_runtime": 9119.1797, | |
| "train_tokens_per_second": 68123.685 | |
| }, | |
| { | |
| "epoch": 1.7141826055575604, | |
| "grad_norm": 1.7890625, | |
| "learning_rate": 2.5844479155091194e-06, | |
| "loss": 2.1780315399169923, | |
| "num_input_tokens_seen": 622542848, | |
| "step": 4750, | |
| "train_runtime": 9137.9257, | |
| "train_tokens_per_second": 68127.37 | |
| }, | |
| { | |
| "epoch": 1.7177914110429446, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 2.5207887451463243e-06, | |
| "loss": 2.200862693786621, | |
| "num_input_tokens_seen": 623853568, | |
| "step": 4760, | |
| "train_runtime": 9156.6728, | |
| "train_tokens_per_second": 68131.032 | |
| }, | |
| { | |
| "epoch": 1.721400216528329, | |
| "grad_norm": 1.7890625, | |
| "learning_rate": 2.457881751693608e-06, | |
| "loss": 2.237129974365234, | |
| "num_input_tokens_seen": 625164288, | |
| "step": 4770, | |
| "train_runtime": 9175.4262, | |
| "train_tokens_per_second": 68134.632 | |
| }, | |
| { | |
| "epoch": 1.7250090220137135, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 2.395729040081926e-06, | |
| "loss": 2.252490234375, | |
| "num_input_tokens_seen": 626475008, | |
| "step": 4780, | |
| "train_runtime": 9194.161, | |
| "train_tokens_per_second": 68138.355 | |
| }, | |
| { | |
| "epoch": 1.7286178274990978, | |
| "grad_norm": 1.5546875, | |
| "learning_rate": 2.3343326900032353e-06, | |
| "loss": 2.231769561767578, | |
| "num_input_tokens_seen": 627785728, | |
| "step": 4790, | |
| "train_runtime": 9212.9018, | |
| "train_tokens_per_second": 68142.019 | |
| }, | |
| { | |
| "epoch": 1.732226632984482, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 2.273694755840866e-06, | |
| "loss": 2.228584098815918, | |
| "num_input_tokens_seen": 629096448, | |
| "step": 4800, | |
| "train_runtime": 9231.6555, | |
| "train_tokens_per_second": 68145.572 | |
| }, | |
| { | |
| "epoch": 1.7358354384698664, | |
| "grad_norm": 1.6953125, | |
| "learning_rate": 2.213817266600779e-06, | |
| "loss": 2.1512102127075194, | |
| "num_input_tokens_seen": 630407168, | |
| "step": 4810, | |
| "train_runtime": 9253.1307, | |
| "train_tokens_per_second": 68129.068 | |
| }, | |
| { | |
| "epoch": 1.7394442439552509, | |
| "grad_norm": 1.6796875, | |
| "learning_rate": 2.1547022258437242e-06, | |
| "loss": 2.2559492111206056, | |
| "num_input_tokens_seen": 631717888, | |
| "step": 4820, | |
| "train_runtime": 9271.8937, | |
| "train_tokens_per_second": 68132.564 | |
| }, | |
| { | |
| "epoch": 1.743053049440635, | |
| "grad_norm": 1.703125, | |
| "learning_rate": 2.096351611618122e-06, | |
| "loss": 2.210666465759277, | |
| "num_input_tokens_seen": 633028608, | |
| "step": 4830, | |
| "train_runtime": 9290.6467, | |
| "train_tokens_per_second": 68136.119 | |
| }, | |
| { | |
| "epoch": 1.7466618549260193, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 2.038767376393938e-06, | |
| "loss": 2.2592681884765624, | |
| "num_input_tokens_seen": 634339328, | |
| "step": 4840, | |
| "train_runtime": 9309.4019, | |
| "train_tokens_per_second": 68139.644 | |
| }, | |
| { | |
| "epoch": 1.7502706604114038, | |
| "grad_norm": 1.453125, | |
| "learning_rate": 1.981951446997324e-06, | |
| "loss": 2.220474624633789, | |
| "num_input_tokens_seen": 635650048, | |
| "step": 4850, | |
| "train_runtime": 9328.1684, | |
| "train_tokens_per_second": 68143.072 | |
| }, | |
| { | |
| "epoch": 1.7538794658967882, | |
| "grad_norm": 1.7734375, | |
| "learning_rate": 1.9259057245461538e-06, | |
| "loss": 2.2094629287719725, | |
| "num_input_tokens_seen": 636960768, | |
| "step": 4860, | |
| "train_runtime": 9346.9304, | |
| "train_tokens_per_second": 68146.518 | |
| }, | |
| { | |
| "epoch": 1.7574882713821725, | |
| "grad_norm": 1.4609375, | |
| "learning_rate": 1.8706320843863866e-06, | |
| "loss": 2.202382469177246, | |
| "num_input_tokens_seen": 638271488, | |
| "step": 4870, | |
| "train_runtime": 9365.6906, | |
| "train_tokens_per_second": 68149.966 | |
| }, | |
| { | |
| "epoch": 1.7610970768675567, | |
| "grad_norm": 1.53125, | |
| "learning_rate": 1.8161323760293725e-06, | |
| "loss": 2.229145050048828, | |
| "num_input_tokens_seen": 639582208, | |
| "step": 4880, | |
| "train_runtime": 9384.4542, | |
| "train_tokens_per_second": 68153.373 | |
| }, | |
| { | |
| "epoch": 1.7647058823529411, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 1.7624084230898924e-06, | |
| "loss": 2.223577880859375, | |
| "num_input_tokens_seen": 640892928, | |
| "step": 4890, | |
| "train_runtime": 9403.2096, | |
| "train_tokens_per_second": 68156.826 | |
| }, | |
| { | |
| "epoch": 1.7683146878383256, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 1.7094620232251946e-06, | |
| "loss": 2.228153038024902, | |
| "num_input_tokens_seen": 642203648, | |
| "step": 4900, | |
| "train_runtime": 9421.9676, | |
| "train_tokens_per_second": 68160.248 | |
| }, | |
| { | |
| "epoch": 1.7719234933237098, | |
| "grad_norm": 1.78125, | |
| "learning_rate": 1.6572949480748113e-06, | |
| "loss": 2.235420036315918, | |
| "num_input_tokens_seen": 643514368, | |
| "step": 4910, | |
| "train_runtime": 9443.3216, | |
| "train_tokens_per_second": 68144.917 | |
| }, | |
| { | |
| "epoch": 1.7755322988090942, | |
| "grad_norm": 1.609375, | |
| "learning_rate": 1.6059089432013064e-06, | |
| "loss": 2.2352012634277343, | |
| "num_input_tokens_seen": 644825088, | |
| "step": 4920, | |
| "train_runtime": 9462.075, | |
| "train_tokens_per_second": 68148.381 | |
| }, | |
| { | |
| "epoch": 1.7791411042944785, | |
| "grad_norm": 1.53125, | |
| "learning_rate": 1.5553057280318251e-06, | |
| "loss": 2.2525297164916993, | |
| "num_input_tokens_seen": 646135808, | |
| "step": 4930, | |
| "train_runtime": 9480.8219, | |
| "train_tokens_per_second": 68151.877 | |
| }, | |
| { | |
| "epoch": 1.782749909779863, | |
| "grad_norm": 1.6171875, | |
| "learning_rate": 1.5054869958006174e-06, | |
| "loss": 2.228093910217285, | |
| "num_input_tokens_seen": 647446528, | |
| "step": 4940, | |
| "train_runtime": 9499.558, | |
| "train_tokens_per_second": 68155.437 | |
| }, | |
| { | |
| "epoch": 1.7863587152652474, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 1.456454413492317e-06, | |
| "loss": 2.2367706298828125, | |
| "num_input_tokens_seen": 648757248, | |
| "step": 4950, | |
| "train_runtime": 9518.3108, | |
| "train_tokens_per_second": 68158.863 | |
| }, | |
| { | |
| "epoch": 1.7899675207506316, | |
| "grad_norm": 1.5703125, | |
| "learning_rate": 1.4082096217862162e-06, | |
| "loss": 2.2130949020385744, | |
| "num_input_tokens_seen": 650067968, | |
| "step": 4960, | |
| "train_runtime": 9537.0656, | |
| "train_tokens_per_second": 68162.263 | |
| }, | |
| { | |
| "epoch": 1.7935763262360158, | |
| "grad_norm": 1.8828125, | |
| "learning_rate": 1.360754235001338e-06, | |
| "loss": 2.201351356506348, | |
| "num_input_tokens_seen": 651378688, | |
| "step": 4970, | |
| "train_runtime": 9555.8186, | |
| "train_tokens_per_second": 68165.661 | |
| }, | |
| { | |
| "epoch": 1.7971851317214003, | |
| "grad_norm": 1.9609375, | |
| "learning_rate": 1.314089841042429e-06, | |
| "loss": 2.2226787567138673, | |
| "num_input_tokens_seen": 652689408, | |
| "step": 4980, | |
| "train_runtime": 9574.564, | |
| "train_tokens_per_second": 68169.1 | |
| }, | |
| { | |
| "epoch": 1.8007939372067847, | |
| "grad_norm": 1.5703125, | |
| "learning_rate": 1.268218001346816e-06, | |
| "loss": 2.2285099029541016, | |
| "num_input_tokens_seen": 654000128, | |
| "step": 4990, | |
| "train_runtime": 9593.3228, | |
| "train_tokens_per_second": 68172.43 | |
| }, | |
| { | |
| "epoch": 1.804402742692169, | |
| "grad_norm": 1.546875, | |
| "learning_rate": 1.223140250832172e-06, | |
| "loss": 2.202241134643555, | |
| "num_input_tokens_seen": 655310848, | |
| "step": 5000, | |
| "train_runtime": 9612.0872, | |
| "train_tokens_per_second": 68175.708 | |
| }, | |
| { | |
| "epoch": 1.8080115481775532, | |
| "grad_norm": 1.546875, | |
| "learning_rate": 1.1788580978451563e-06, | |
| "loss": 2.2288558959960936, | |
| "num_input_tokens_seen": 656621568, | |
| "step": 5010, | |
| "train_runtime": 9634.3299, | |
| "train_tokens_per_second": 68154.358 | |
| }, | |
| { | |
| "epoch": 1.8116203536629376, | |
| "grad_norm": 1.5703125, | |
| "learning_rate": 1.1353730241109306e-06, | |
| "loss": 2.193297576904297, | |
| "num_input_tokens_seen": 657932288, | |
| "step": 5020, | |
| "train_runtime": 9653.1015, | |
| "train_tokens_per_second": 68157.606 | |
| }, | |
| { | |
| "epoch": 1.815229159148322, | |
| "grad_norm": 1.734375, | |
| "learning_rate": 1.0926864846835971e-06, | |
| "loss": 2.177206039428711, | |
| "num_input_tokens_seen": 659243008, | |
| "step": 5030, | |
| "train_runtime": 9671.8746, | |
| "train_tokens_per_second": 68160.831 | |
| }, | |
| { | |
| "epoch": 1.8188379646337063, | |
| "grad_norm": 1.6171875, | |
| "learning_rate": 1.0507999078974845e-06, | |
| "loss": 2.1820747375488283, | |
| "num_input_tokens_seen": 660553728, | |
| "step": 5040, | |
| "train_runtime": 9690.6417, | |
| "train_tokens_per_second": 68164.085 | |
| }, | |
| { | |
| "epoch": 1.8224467701190905, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 1.009714695319386e-06, | |
| "loss": 2.227157974243164, | |
| "num_input_tokens_seen": 661864448, | |
| "step": 5050, | |
| "train_runtime": 9709.4146, | |
| "train_tokens_per_second": 68167.286 | |
| }, | |
| { | |
| "epoch": 1.826055575604475, | |
| "grad_norm": 1.6953125, | |
| "learning_rate": 9.694322217016356e-07, | |
| "loss": 2.228900337219238, | |
| "num_input_tokens_seen": 663175168, | |
| "step": 5060, | |
| "train_runtime": 9728.1932, | |
| "train_tokens_per_second": 68170.436 | |
| }, | |
| { | |
| "epoch": 1.8296643810898594, | |
| "grad_norm": 1.6640625, | |
| "learning_rate": 9.299538349361259e-07, | |
| "loss": 2.2359861373901366, | |
| "num_input_tokens_seen": 664485888, | |
| "step": 5070, | |
| "train_runtime": 9746.9578, | |
| "train_tokens_per_second": 68173.671 | |
| }, | |
| { | |
| "epoch": 1.8332731865752436, | |
| "grad_norm": 1.6015625, | |
| "learning_rate": 8.912808560091967e-07, | |
| "loss": 2.2222143173217774, | |
| "num_input_tokens_seen": 665796608, | |
| "step": 5080, | |
| "train_runtime": 9765.7217, | |
| "train_tokens_per_second": 68176.897 | |
| }, | |
| { | |
| "epoch": 1.8368819920606279, | |
| "grad_norm": 1.6484375, | |
| "learning_rate": 8.534145789574371e-07, | |
| "loss": 2.2080410003662108, | |
| "num_input_tokens_seen": 667107328, | |
| "step": 5090, | |
| "train_runtime": 9784.5016, | |
| "train_tokens_per_second": 68180.001 | |
| }, | |
| { | |
| "epoch": 1.8404907975460123, | |
| "grad_norm": 1.8203125, | |
| "learning_rate": 8.163562708243727e-07, | |
| "loss": 2.211821746826172, | |
| "num_input_tokens_seen": 668418048, | |
| "step": 5100, | |
| "train_runtime": 9803.3054, | |
| "train_tokens_per_second": 68182.926 | |
| }, | |
| { | |
| "epoch": 1.8440996030313968, | |
| "grad_norm": 1.734375, | |
| "learning_rate": 7.801071716180942e-07, | |
| "loss": 2.2246419906616213, | |
| "num_input_tokens_seen": 669728768, | |
| "step": 5110, | |
| "train_runtime": 9824.067, | |
| "train_tokens_per_second": 68172.252 | |
| }, | |
| { | |
| "epoch": 1.847708408516781, | |
| "grad_norm": 1.6171875, | |
| "learning_rate": 7.446684942697429e-07, | |
| "loss": 2.250296974182129, | |
| "num_input_tokens_seen": 671039488, | |
| "step": 5120, | |
| "train_runtime": 9842.8864, | |
| "train_tokens_per_second": 68175.072 | |
| }, | |
| { | |
| "epoch": 1.8513172140021652, | |
| "grad_norm": 1.453125, | |
| "learning_rate": 7.100414245929387e-07, | |
| "loss": 2.2182559967041016, | |
| "num_input_tokens_seen": 672350208, | |
| "step": 5130, | |
| "train_runtime": 9861.7076, | |
| "train_tokens_per_second": 68177.869 | |
| }, | |
| { | |
| "epoch": 1.8549260194875496, | |
| "grad_norm": 1.53125, | |
| "learning_rate": 6.762271212440968e-07, | |
| "loss": 2.2014060974121095, | |
| "num_input_tokens_seen": 673660928, | |
| "step": 5140, | |
| "train_runtime": 9880.5279, | |
| "train_tokens_per_second": 68180.662 | |
| }, | |
| { | |
| "epoch": 1.858534824972934, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 6.432267156836536e-07, | |
| "loss": 2.208943176269531, | |
| "num_input_tokens_seen": 674971648, | |
| "step": 5150, | |
| "train_runtime": 9899.3276, | |
| "train_tokens_per_second": 68183.585 | |
| }, | |
| { | |
| "epoch": 1.8621436304583183, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 6.11041312138208e-07, | |
| "loss": 2.259289360046387, | |
| "num_input_tokens_seen": 676282368, | |
| "step": 5160, | |
| "train_runtime": 9918.1504, | |
| "train_tokens_per_second": 68186.339 | |
| }, | |
| { | |
| "epoch": 1.8657524359437025, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 5.79671987563582e-07, | |
| "loss": 2.1752920150756836, | |
| "num_input_tokens_seen": 677593088, | |
| "step": 5170, | |
| "train_runtime": 9936.975, | |
| "train_tokens_per_second": 68189.071 | |
| }, | |
| { | |
| "epoch": 1.869361241429087, | |
| "grad_norm": 1.6796875, | |
| "learning_rate": 5.491197916087793e-07, | |
| "loss": 2.2144365310668945, | |
| "num_input_tokens_seen": 678903808, | |
| "step": 5180, | |
| "train_runtime": 9955.7814, | |
| "train_tokens_per_second": 68191.916 | |
| }, | |
| { | |
| "epoch": 1.8729700469144714, | |
| "grad_norm": 1.6015625, | |
| "learning_rate": 5.193857465808583e-07, | |
| "loss": 2.2590240478515624, | |
| "num_input_tokens_seen": 680214528, | |
| "step": 5190, | |
| "train_runtime": 9974.5773, | |
| "train_tokens_per_second": 68194.822 | |
| }, | |
| { | |
| "epoch": 1.8765788523998557, | |
| "grad_norm": 1.40625, | |
| "learning_rate": 4.904708474107261e-07, | |
| "loss": 2.255119514465332, | |
| "num_input_tokens_seen": 681525248, | |
| "step": 5200, | |
| "train_runtime": 9993.386, | |
| "train_tokens_per_second": 68197.631 | |
| }, | |
| { | |
| "epoch": 1.88018765788524, | |
| "grad_norm": 1.796875, | |
| "learning_rate": 4.623760616198569e-07, | |
| "loss": 2.1574798583984376, | |
| "num_input_tokens_seen": 682835968, | |
| "step": 5210, | |
| "train_runtime": 10014.7601, | |
| "train_tokens_per_second": 68182.958 | |
| }, | |
| { | |
| "epoch": 1.8837964633706243, | |
| "grad_norm": 1.703125, | |
| "learning_rate": 4.3510232928790084e-07, | |
| "loss": 2.2060054779052733, | |
| "num_input_tokens_seen": 684146688, | |
| "step": 5220, | |
| "train_runtime": 10033.5706, | |
| "train_tokens_per_second": 68185.765 | |
| }, | |
| { | |
| "epoch": 1.8874052688560088, | |
| "grad_norm": 1.515625, | |
| "learning_rate": 4.086505630212456e-07, | |
| "loss": 2.207899284362793, | |
| "num_input_tokens_seen": 685457408, | |
| "step": 5230, | |
| "train_runtime": 10052.3542, | |
| "train_tokens_per_second": 68188.744 | |
| }, | |
| { | |
| "epoch": 1.891014074341393, | |
| "grad_norm": 1.625, | |
| "learning_rate": 3.8302164792246853e-07, | |
| "loss": 2.236598587036133, | |
| "num_input_tokens_seen": 686768128, | |
| "step": 5240, | |
| "train_runtime": 10071.1601, | |
| "train_tokens_per_second": 68191.561 | |
| }, | |
| { | |
| "epoch": 1.8946228798267772, | |
| "grad_norm": 1.6015625, | |
| "learning_rate": 3.5821644156071865e-07, | |
| "loss": 2.226085090637207, | |
| "num_input_tokens_seen": 688078848, | |
| "step": 5250, | |
| "train_runtime": 10089.9449, | |
| "train_tokens_per_second": 68194.51 | |
| }, | |
| { | |
| "epoch": 1.8982316853121617, | |
| "grad_norm": 1.515625, | |
| "learning_rate": 3.342357739430396e-07, | |
| "loss": 2.2597679138183593, | |
| "num_input_tokens_seen": 689389568, | |
| "step": 5260, | |
| "train_runtime": 10108.7258, | |
| "train_tokens_per_second": 68197.474 | |
| }, | |
| { | |
| "epoch": 1.9018404907975461, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 3.1108044748656694e-07, | |
| "loss": 2.1886007308959963, | |
| "num_input_tokens_seen": 690700288, | |
| "step": 5270, | |
| "train_runtime": 10127.4997, | |
| "train_tokens_per_second": 68200.475 | |
| }, | |
| { | |
| "epoch": 1.9054492962829304, | |
| "grad_norm": 1.6640625, | |
| "learning_rate": 2.887512369917023e-07, | |
| "loss": 2.2221187591552733, | |
| "num_input_tokens_seen": 692011008, | |
| "step": 5280, | |
| "train_runtime": 10146.266, | |
| "train_tokens_per_second": 68203.515 | |
| }, | |
| { | |
| "epoch": 1.9090581017683146, | |
| "grad_norm": 1.6953125, | |
| "learning_rate": 2.6724888961618397e-07, | |
| "loss": 2.243001174926758, | |
| "num_input_tokens_seen": 693321728, | |
| "step": 5290, | |
| "train_runtime": 10165.0258, | |
| "train_tokens_per_second": 68206.588 | |
| }, | |
| { | |
| "epoch": 1.912666907253699, | |
| "grad_norm": 1.59375, | |
| "learning_rate": 2.4657412485007967e-07, | |
| "loss": 2.205171012878418, | |
| "num_input_tokens_seen": 694632448, | |
| "step": 5300, | |
| "train_runtime": 10183.8138, | |
| "train_tokens_per_second": 68209.461 | |
| }, | |
| { | |
| "epoch": 1.9162757127390835, | |
| "grad_norm": 1.640625, | |
| "learning_rate": 2.2672763449170799e-07, | |
| "loss": 2.2328046798706054, | |
| "num_input_tokens_seen": 695943168, | |
| "step": 5310, | |
| "train_runtime": 10204.819, | |
| "train_tokens_per_second": 68197.502 | |
| }, | |
| { | |
| "epoch": 1.9198845182244677, | |
| "grad_norm": 1.640625, | |
| "learning_rate": 2.0771008262450707e-07, | |
| "loss": 2.2248144149780273, | |
| "num_input_tokens_seen": 697253888, | |
| "step": 5320, | |
| "train_runtime": 10223.5749, | |
| "train_tokens_per_second": 68200.595 | |
| }, | |
| { | |
| "epoch": 1.923493323709852, | |
| "grad_norm": 1.734375, | |
| "learning_rate": 1.8952210559479432e-07, | |
| "loss": 2.2253623962402345, | |
| "num_input_tokens_seen": 698564608, | |
| "step": 5330, | |
| "train_runtime": 10242.3298, | |
| "train_tokens_per_second": 68203.682 | |
| }, | |
| { | |
| "epoch": 1.9271021291952364, | |
| "grad_norm": 1.6640625, | |
| "learning_rate": 1.7216431199049145e-07, | |
| "loss": 2.2415798187255858, | |
| "num_input_tokens_seen": 699875328, | |
| "step": 5340, | |
| "train_runtime": 10261.0809, | |
| "train_tokens_per_second": 68206.784 | |
| }, | |
| { | |
| "epoch": 1.9307109346806208, | |
| "grad_norm": 1.78125, | |
| "learning_rate": 1.556372826207464e-07, | |
| "loss": 2.24045352935791, | |
| "num_input_tokens_seen": 701186048, | |
| "step": 5350, | |
| "train_runtime": 10279.8347, | |
| "train_tokens_per_second": 68209.856 | |
| }, | |
| { | |
| "epoch": 1.934319740166005, | |
| "grad_norm": 1.4765625, | |
| "learning_rate": 1.3994157049650737e-07, | |
| "loss": 2.2292993545532225, | |
| "num_input_tokens_seen": 702496768, | |
| "step": 5360, | |
| "train_runtime": 10298.5974, | |
| "train_tokens_per_second": 68212.859 | |
| }, | |
| { | |
| "epoch": 1.9379285456513893, | |
| "grad_norm": 1.59375, | |
| "learning_rate": 1.2507770081200964e-07, | |
| "loss": 2.2077713012695312, | |
| "num_input_tokens_seen": 703807488, | |
| "step": 5370, | |
| "train_runtime": 10317.363, | |
| "train_tokens_per_second": 68215.831 | |
| }, | |
| { | |
| "epoch": 1.9415373511367737, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 1.1104617092720926e-07, | |
| "loss": 2.202245330810547, | |
| "num_input_tokens_seen": 705118208, | |
| "step": 5380, | |
| "train_runtime": 10336.1259, | |
| "train_tokens_per_second": 68218.81 | |
| }, | |
| { | |
| "epoch": 1.9451461566221582, | |
| "grad_norm": 1.6015625, | |
| "learning_rate": 9.784745035114895e-08, | |
| "loss": 2.1991958618164062, | |
| "num_input_tokens_seen": 706428928, | |
| "step": 5390, | |
| "train_runtime": 10354.8973, | |
| "train_tokens_per_second": 68221.722 | |
| }, | |
| { | |
| "epoch": 1.9487549621075424, | |
| "grad_norm": 2.484375, | |
| "learning_rate": 8.548198072622637e-08, | |
| "loss": 2.215988349914551, | |
| "num_input_tokens_seen": 707739648, | |
| "step": 5400, | |
| "train_runtime": 10373.6656, | |
| "train_tokens_per_second": 68224.644 | |
| }, | |
| { | |
| "epoch": 1.9523637675929266, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 7.395017581343366e-08, | |
| "loss": 2.194872283935547, | |
| "num_input_tokens_seen": 709050368, | |
| "step": 5410, | |
| "train_runtime": 10394.6889, | |
| "train_tokens_per_second": 68212.755 | |
| }, | |
| { | |
| "epoch": 1.955972573078311, | |
| "grad_norm": 1.65625, | |
| "learning_rate": 6.325242147850463e-08, | |
| "loss": 2.2129005432128905, | |
| "num_input_tokens_seen": 710361088, | |
| "step": 5420, | |
| "train_runtime": 10413.4478, | |
| "train_tokens_per_second": 68215.744 | |
| }, | |
| { | |
| "epoch": 1.9595813785636955, | |
| "grad_norm": 1.5859375, | |
| "learning_rate": 5.3389075679011194e-08, | |
| "loss": 2.2185943603515623, | |
| "num_input_tokens_seen": 711671808, | |
| "step": 5430, | |
| "train_runtime": 10432.2116, | |
| "train_tokens_per_second": 68218.69 | |
| }, | |
| { | |
| "epoch": 1.9631901840490797, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 4.436046845237574e-08, | |
| "loss": 2.235332489013672, | |
| "num_input_tokens_seen": 712982528, | |
| "step": 5440, | |
| "train_runtime": 10450.986, | |
| "train_tokens_per_second": 68221.556 | |
| }, | |
| { | |
| "epoch": 1.966798989534464, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 3.616690190482996e-08, | |
| "loss": 2.244569778442383, | |
| "num_input_tokens_seen": 714293248, | |
| "step": 5450, | |
| "train_runtime": 10469.7706, | |
| "train_tokens_per_second": 68224.346 | |
| }, | |
| { | |
| "epoch": 1.9704077950198484, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 2.88086502013174e-08, | |
| "loss": 2.259345817565918, | |
| "num_input_tokens_seen": 715603968, | |
| "step": 5460, | |
| "train_runtime": 10488.5418, | |
| "train_tokens_per_second": 68227.212 | |
| }, | |
| { | |
| "epoch": 1.9740166005052329, | |
| "grad_norm": 1.5703125, | |
| "learning_rate": 2.2285959556303525e-08, | |
| "loss": 2.2066539764404296, | |
| "num_input_tokens_seen": 716914688, | |
| "step": 5470, | |
| "train_runtime": 10507.3044, | |
| "train_tokens_per_second": 68230.124 | |
| }, | |
| { | |
| "epoch": 1.977625405990617, | |
| "grad_norm": 1.4765625, | |
| "learning_rate": 1.6599048225546253e-08, | |
| "loss": 2.25235538482666, | |
| "num_input_tokens_seen": 718225408, | |
| "step": 5480, | |
| "train_runtime": 10526.0756, | |
| "train_tokens_per_second": 68232.971 | |
| }, | |
| { | |
| "epoch": 1.9812342114760013, | |
| "grad_norm": 1.6796875, | |
| "learning_rate": 1.1748106498793433e-08, | |
| "loss": 2.246954345703125, | |
| "num_input_tokens_seen": 719536128, | |
| "step": 5490, | |
| "train_runtime": 10544.842, | |
| "train_tokens_per_second": 68235.838 | |
| }, | |
| { | |
| "epoch": 1.9848430169613858, | |
| "grad_norm": 1.453125, | |
| "learning_rate": 7.733296693407388e-09, | |
| "loss": 2.253096008300781, | |
| "num_input_tokens_seen": 720846848, | |
| "step": 5500, | |
| "train_runtime": 10563.6145, | |
| "train_tokens_per_second": 68238.655 | |
| }, | |
| { | |
| "epoch": 1.9884518224467702, | |
| "grad_norm": 1.453125, | |
| "learning_rate": 4.5547531489442685e-09, | |
| "loss": 2.2080196380615233, | |
| "num_input_tokens_seen": 722157568, | |
| "step": 5510, | |
| "train_runtime": 10586.1595, | |
| "train_tokens_per_second": 68217.144 | |
| }, | |
| { | |
| "epoch": 1.9920606279321544, | |
| "grad_norm": 1.6796875, | |
| "learning_rate": 2.212582222652082e-09, | |
| "loss": 2.1899511337280275, | |
| "num_input_tokens_seen": 723468288, | |
| "step": 5520, | |
| "train_runtime": 10604.922, | |
| "train_tokens_per_second": 68220.048 | |
| }, | |
| { | |
| "epoch": 1.9956694334175387, | |
| "grad_norm": 1.640625, | |
| "learning_rate": 7.068622859179864e-10, | |
| "loss": 2.250523567199707, | |
| "num_input_tokens_seen": 724779008, | |
| "step": 5530, | |
| "train_runtime": 10623.69, | |
| "train_tokens_per_second": 68222.907 | |
| }, | |
| { | |
| "epoch": 1.999278238902923, | |
| "grad_norm": 1.6484375, | |
| "learning_rate": 3.764372163428398e-11, | |
| "loss": 2.2255619049072264, | |
| "num_input_tokens_seen": 726089728, | |
| "step": 5540, | |
| "train_runtime": 10642.4512, | |
| "train_tokens_per_second": 68225.798 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "num_input_tokens_seen": 726302720, | |
| "step": 5542, | |
| "total_flos": 4.372023498453811e+17, | |
| "train_loss": 2.3499925993530812, | |
| "train_runtime": 10647.232, | |
| "train_samples_per_second": 16.654, | |
| "train_steps_per_second": 0.521 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5542, | |
| "num_input_tokens_seen": 726302720, | |
| "num_train_epochs": 2, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.372023498453811e+17, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |