Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models Paper • 2609.34972 • Published 6 days ago • 30
Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction Paper • 2609.32353 • Published 8 days ago • 8
Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction Paper • 2609.32353 • Published 8 days ago • 8
SlowBA: An efficiency backdoor attack towards VLM-based GUI agents Paper • 2603.08316 • Published Mar 9 • 1 • 3
What Did I Just Say? Self-Listening for Full-Duplex Speech Models Paper • 2609.05592 • Published 30 days ago • 25
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget Paper • 2607.14952 • Published Jul 16 • 92
$δ$-mem: Efficient Online Memory for Large Language Models Paper • 2605.12357 • Published May 12 • 133
SlowBA: An efficiency backdoor attack towards VLM-based GUI agents Paper • 2603.08316 • Published Mar 9 • 1
SlowBA: An efficiency backdoor attack towards VLM-based GUI agents Paper • 2603.08316 • Published Mar 9 • 1
SlowBA: An efficiency backdoor attack towards VLM-based GUI agents Paper • 2603.08316 • Published Mar 9 • 1
PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks Paper • 2602.06663 • Published Feb 6 • 5