VidaForge: Open Research Infrastructure for Video Pretraining Data Recipes Paper • 2609.06652 • Published 10 days ago • 22
Looped Language Models Improve Compositional Tool Calling Paper • 2608.18171 • Published 30 days ago • 23
UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos Paper • 2608.11752 • Published Aug 13 • 22
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 263
Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence Paper • 2608.10720 • Published Aug 11 • 16
EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal Paper • 2608.05565 • Published Aug 6 • 23
On-Policy Delta Distillation for Multilingual Math Reasoning Paper • 2608.05802 • Published Aug 6 • 33
Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing Paper • 2608.02711 • Published Aug 3 • 94
Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis Paper • 2608.01973 • Published Aug 3 • 17