OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published 14 days ago • 252
SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification Paper • 2608.08786 • Published 6 days ago • 6
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent Paper • 2608.03979 • Published 11 days ago • 50
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations Paper • 2607.28956 • Published 15 days ago • 96
Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis Paper • 2608.00440 • Published 14 days ago • 10
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 20 days ago • 105