PhysVista: Benchmarking Physical Intelligence in VLMs via a Perception-Reasoning-Assessment Loop Paper • 2610.00559 • Published 11 days ago • 42
CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning Paper • 2609.36820 • Published 12 days ago • 41
InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation Paper • 2610.02196 • Published 10 days ago • 62
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 13 days ago • 201