SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning Paper • 2607.14777 • Published 5 days ago • 93
UniVR: Thinking in Visual Space for Unified Visual Reasoning Paper • 2607.12800 • Published 7 days ago • 30
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning Paper • 2606.29526 • Published 23 days ago • 168