{ "effective_batch_size": 32, "epoch": 2.0, "final_gradient_accumulation_steps": 1, "final_micro_batch_size": 32, "num_input_tokens_seen": 726302720, "peak_cuda_memory_gib": 213.5380449295044, "real_tokens_per_epoch": 363149667, "requested_epochs": 2.0, "total_flos": 4.372023498453811e+17, "total_optimizer_steps_planned": 5542, "train_blocks": 88660, "train_loss": 2.3499925993530812, "train_runtime": 10647.232, "train_samples_per_second": 16.654, "train_steps_per_second": 0.521, "warmup_steps": 111 }