DecepEval: A Benchmark for Evaluating Deception in LLM Agents Paper • 2610.07967 • Published 4 days ago • 48
Dynamic Harness Search: Building Multi-Agent Systems Per-Query via Prediction Paper • 2610.04137 • Published 8 days ago • 12
EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents Paper • 2609.17632 • Published 25 days ago • 46
FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation Paper • 2609.11486 • Published 30 days ago • 34
SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions Paper • 2510.08999 • Published Sep 7 • 19
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published Sep 3 • 104