Qwen-AgentWorld: Language World Models for General Agents Paper • 2606.24597 • Published Jun 23 • 157
SWE-bench-java: A GitHub Issue Resolving Benchmark for Java Paper • 2408.14354 • Published Aug 26, 2024 • 41
microsoft/Phi-3-vision-128k-instruct Text Generation • 4B • Updated Dec 10, 2025 • 210k • 973
PanGu-Coder2: Boosting Large Language Models for Code with Ranking Feedback Paper • 2307.14936 • Published Jul 27, 2023 • 42 • 2
PanGu-Coder2: Boosting Large Language Models for Code with Ranking Feedback Paper • 2307.14936 • Published Jul 27, 2023 • 42
Running Agents 1.51k Big Code Models Leaderboard 📈 1.51k Explore code model leaderboard and submit evaluations