Qwen 3 4B RLM RLVR Collection Everything from my experiments on training RLMs. • 14 items • Updated 21 days ago
Running on CPU Upgrade 280 The Synthetic Data Playbook: Generating Trillions of the Finest Tokens 📝 280 Visualize synthetic‑data experiments as an interactive bookshelf
Qwen 3 4B RLM RLVR Collection Everything from my experiments on training RLMs. • 14 items • Updated 21 days ago
lsteno/Qwen3-4B-Instruct-2507-RLM-RLVR-depth2-recursive-r64-a128-lr1e-5-adapter Reinforcement Learning • Updated Jun 13 • 3
lsteno/Qwen3-4B-Instruct-2507-RLM-RLVR-depth2-recursive-r64-a128-lr1e-5-adapter Reinforcement Learning • Updated Jun 13 • 3
Qwen 3 4B RLM RLVR Collection Everything from my experiments on training RLMs. • 14 items • Updated 21 days ago
lsteno/Qwen3-4B-Instruct-2507-RLM-RLVR-FullFT-lr5e-6-depth1-v1 Text Generation • 4B • Updated May 23 • 18