Léo Martin
leo-mart
·
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
upvoted a paper about 7 hours ago
Scaling Properties of Same-Family On-Policy Distillation upvoted a paper about 7 hours ago
SoL-Refiner: Speed-of-Light One-Step Refinement for High-Resolution Video liked a dataset 1 day ago
OpenMOSS-Team/hh-rlhf-strength-cleanedOrganizations
None yet