SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published 3 days ago • 58
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation Paper • 2608.17426 • Published 5 days ago • 155
From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs Paper • 2608.09158 • Published 13 days ago • 10