Stealing Reasoning Traces from Proprietary LLM APIs Paper • 2608.09867 • Published 14 days ago • 111
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning Paper • 2607.07508 • Published Jul 8 • 31
Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization Paper • 2607.22334 • Published about 1 month ago