Causal Foundation Models with Continuous Treatments
Paper • 2605.15133 • Published • 2
None defined yet.
A Gradient Perspective on RLVR Stability and Winner Advantage Policy Optimization
Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents