PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models Paper • 2607.24957 • Published 3 days ago • 7
OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs Paper • 2607.25669 • Published 1 day ago • 3
view post Post 65 The capture stack for collecting high-fidelity egocentric RGB-D data on commodity mobile devices is now open-source.https://x.com/fpv_labs/status/2082098617704436058 See translation Reply
GNM Head: A Generative aNthropometric Model of the human head Paper • 2607.23687 • Published 4 days ago • 3
FilmBench: A Film-Grade Benchmark for Cinematic Video Generation Paper • 2607.24241 • Published 3 days ago • 3
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning Paper • 2607.21653 • Published 8 days ago • 29
Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering Paper • 2607.21848 • Published 7 days ago • 5
Scaling Native Multimodal Pre-Training From Scratch Paper • 2607.22043 • Published 6 days ago • 24
SceneActBench: Can Agents Act on the 3D Scenes They See? Paper • 2607.22393 • Published 6 days ago • 6
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills Paper • 2607.22529 • Published 6 days ago • 40
Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction Paper • 2607.20911 • Published 7 days ago • 25
NVIDIA-labs OO Agents: Native Python Object-Oriented Agents Paper • 2607.20709 • Published 8 days ago • 31
TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation Paper • 2607.21017 • Published 7 days ago • 6
Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers Paper • 2607.21594 • Published 7 days ago • 14
Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models Paper • 2607.19604 • Published 9 days ago • 17