One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation Paper • 2608.25936 • Published 15 days ago • 13
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation Paper • 2609.02998 • Published 8 days ago • 16
JonusNattapong/Reinforcement-Learning-for-Gold-Trading-Model Reinforcement Learning • Updated Dec 23, 2025 • 64 • 11
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments Paper • 2609.04148 • Published 7 days ago • 291
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement Paper • 2608.31046 • Published 10 days ago • 149
LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation Paper • 2608.30935 • Published 10 days ago • 32