Share

LLM Agent Leaderboard

LLM Agent Leaderboard — 20 items ranking table
RankNameDescription
🥇Claude Fable 5 (High)By Anthropic · net improvement 13.94% (+0.60%p MoM, holds #1)
🥈GPT 5.6 Sol (xHigh)By OpenAI · net improvement 10.94% (new model, added Jul 13 · debuts at #2)
🥉Claude Opus 4.8 (Thinking)By Anthropic · net improvement 9.28% (-0.09%p MoM, #2 to #3)
4.GPT 5.5 (xHigh)By OpenAI · net improvement 8.26% (+0.05%p MoM, #3 to #4)
5.Claude Sonnet 5 (High)By Anthropic · net improvement 8.00% (new model · debuts at #5)
6.Claude Opus 4.7 (Thinking)By Anthropic · net improvement 7.73% (-0.34%p MoM, #5 to #6)
7.Claude Opus 4.7By Anthropic · net improvement 7.63% (-0.53%p MoM, #4 to #7)
8.GPT 5.5 (High)By OpenAI · net improvement 7.16% (+0.03%p MoM, #6 to #8)
9.GLM 5.2 (Max)By Z.ai · net improvement 6.24% (-0.69%p MoM, #7 to #9)
10.GPT 5.5By OpenAI · net improvement 6.05% (-0.17%p MoM, holds #10)
11.Claude Opus 4.6By Anthropic · net improvement 5.88% (-0.59%p MoM, #9 to #11)
12.GPT 5.4 (High)By OpenAI · net improvement 5.86% (-0.79%p MoM, #8 to #12)
13.Grok 4.5By SpaceXAI · net improvement 4.99% (new model, added Jul 13)
14.Claude Opus 4.8By Anthropic · net improvement 3.90% (newly shown with the top-20 expansion)
15.Claude Sonnet 4.6By Anthropic · net improvement 1.99% (newly shown with the top-20 expansion)
16.GLM 5.1By Z.ai · net improvement 1.19% (newly shown with the top-20 expansion)
17.Muse Spark 1.1By Meta · net improvement 0.17% (new model, added Jul 13)
18.Qwen3.7 PlusBy Alibaba · net improvement 0.61% (newly shown with the top-20 expansion)
19.Gemini 3.1 Pro PreviewBy Google · net improvement 0.70% (newly shown with the top-20 expansion)
20.Kimi K2.7 CodeBy Moonshot · net improvement 0.76% (newly shown with the top-20 expansion)

This page compiles publicly available facts with clear source attribution. If you believe it infringes your rights, please contact us and we'll review and act promptly.