Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Paper • 2607.15330 • Published • 63
None defined yet.
Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It
Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do