LMArena · エージェントのタスク成功
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: Agent Arenaのシグナルのうち、「タスク成功の確認」だけを個別に評価したランキングです。エージェントのタスク完了後に、ユーザーが成功・失敗を直接示した結果を使用しています。
スコアの読み方: IPS(τ̂)スコアで、0が基準線となり、高いほどユーザーが成功と示した結果が基準より改善したことを意味します。
注意点: ユーザーが直接示した場合のみ反映されるため、示していないタスクは含まれません。総合ランキングとは順位が異なる場合があります。
今回のランキングから読み取れること
- 1位のClaude Fable 5.1 (Max)と2位のGPT 6.1 Sol (Max)の95%信頼区間は重なっています。この集計だけで2つのモデルの順位を確定するのは困難です。
- 1位と信頼区間が重なるモデルが、ほかに5件あります。小さな順位差は、投票数も踏まえて慎重に解釈してください。
- 上位10モデルのうち、Anthropicのモデルが5モデルで最も多くなっています。
- 1位モデルの観測数は7,868件で、このランキングには50モデルが掲載されています。
エージェントのタスク成功 LMArena
公開日 2026-10-02 · 取得日 2026-10-04
スコアはIPS(τ̂)で、0が基準線となり、高いほど良い結果を示します。線は95%信頼区間です。 グラフには、同じモデルの推論設定(high・maxなど)のうち、スコアが最も高いものだけを表示しています。表には設定ごとの順位をすべて掲載しています。
企業別の最高順位
- AnthropicClaude Fable 5.1 (Max)#1
- OOpenAIGPT 6.1 Sol (Max)#2
- GoogleGemini 4 Argon (High)#3
- DeepSeekDeepseek V4.1 Flash (Max)#8
- Moonshot AIKimi K3 (Max)#9
- TTencentHy4 preview#14
- XiaomiMiMo V2.6 Flash#15
- xxAIGrok 4.7 (xHigh)#16
- ZZ.aiGLM 5.3 (Max)#17
表で見る(上位50件)
| 順位 | モデル | 開発元 | スコア | 95%信頼区間 | 観測数 |
|---|---|---|---|---|---|
| 1 | #1Claude Fable 5.1 (Max) | Anthropic | 0.176 | 0.148–0.205 | 7,868 |
| 2 | #2OGPT 6.1 Sol (Max) | OpenAI | 0.155 | 0.114–0.196 | 2,270 |
| 3 | #3Gemini 4 Argon (High) | 0.154 | 0.125–0.184 | 4,422 | |
| 4 | #4Claude Opus 5.5 (High) | Anthropic | 0.141 | 0.101–0.182 | 3,425 |
| 5 | #5Claude Sonnet 5.5 (Max) | Anthropic | 0.139 | 0.086–0.193 | 1,195 |
| 6 | #6OGPT 6 Astra (Max) | OpenAI | 0.132 | 0.095–0.169 | 5,954 |
| 7 | #7Claude Opus 5 (Max) | Anthropic | 0.095 | 0.064–0.126 | 15,453 |
| 8 | #8Deepseek V4.1 Flash (Max) | DeepSeek | 0.084 | 0.074–0.095 | 60,410 |
| 9 | #9Kimi K3 (Max) | Moonshot AI | 0.076 | 0.064–0.088 | 99,685 |
| 10 | #10Claude Opus 5 (High) | Anthropic | 0.076 | 0.046–0.106 | 20,843 |
| 11 | #11OGPT 6 Sol (Max) | OpenAI | 0.071 | 0.028–0.114 | 3,312 |
| 12 | #12Gemini 3.8 Flash (High) | 0.069 | 0.05–0.087 | 22,497 | |
| 13 | #13Claude Fable 5 (High) | Anthropic | 0.061 | 0.035–0.087 | 33,005 |
| 14 | #14THy4 preview | Tencent | 0.058 | 0.042–0.075 | 24,238 |
| 15 | #15MiMo V2.6 Flash | Xiaomi | 0.056 | 0.03–0.082 | 7,967 |
| 16 | #16xGrok 4.7 (xHigh) | xAI | 0.055 | 0.021–0.089 | 5,906 |
| 17 | #17ZGLM 5.3 (Max) | Z.ai | 0.053 | 0.037–0.068 | 62,886 |
| 18 | #18OGPT 5.6 Sol (xHigh) | OpenAI | 0.05 | 0.024–0.077 | 28,118 |
| 19 | #19Muse Spark 1.3 (Max) | Meta | 0.05 | 0.037–0.064 | 45,563 |
| 20 | #20ZGLM 5.2 (Max) | Z.ai | 0.048 | 0.032–0.063 | 55,555 |
| 21 | #21Qwen3.8 Max | Alibaba | 0.047 | 0.033–0.061 | 35,416 |
| 22 | #22SStep 5 Preview | StepFun | 0.045 | 0.012–0.078 | 4,266 |
| 23 | #23ZGLM 5.3 Flash | Z.ai | 0.044 | 0.032–0.055 | 60,370 |
| 24 | #24Claude Opus 4.8 (High) | Anthropic | 0.042 | 0.016–0.069 | 30,039 |
| 25 | #25Qwen3.8 Flash Next | Alibaba | 0.036 | 0.021–0.051 | 38,898 |
| 26 | #26xGrok 4.5 | xAI | 0.013 | -0.01–0.037 | 29,109 |
| 27 | #27Claude Sonnet 5 (High) | Anthropic | 0.012 | -0.023–0.047 | 22,551 |
| 28 | #28Gemini 3.7 Flash (High) | 0.012 | -0.006–0.029 | 48,036 | |
| 29 | #29Qwen 3.8 27B | Alibaba | 0.01 | -0.005–0.024 | 36,984 |
| 30 | #30OGPT 6 Luna (Max) | OpenAI | -0.001 | -0.025–0.023 | 14,416 |
| 31 | #31xGrok 4.6 (xHigh) | xAI | -0.006 | -0.029–0.018 | 20,463 |
| 32 | #32OGPT 5.5 (xHigh) | OpenAI | -0.009 | -0.031–0.014 | 43,172 |
| 33 | #33DeepSeek V4 Pro (High) (0813) | DeepSeek | -0.017 | -0.057–0.023 | 3,790 |
| 34 | #34OGPT 5.4 (High) | OpenAI | -0.025 | -0.046–-0.004 | 57,450 |
| 35 | #35OGPT 5.6 Luna (xHigh) | OpenAI | -0.033 | -0.049–-0.017 | 33,799 |
| 36 | #36OGPT 5.6 Terra (xHigh) | OpenAI | -0.039 | -0.065–-0.013 | 18,613 |
| 37 | #37Muse Spark 1.1 | Meta | -0.043 | -0.054–-0.031 | 95,130 |
| 38 | #38OGPT 5.5 | OpenAI | -0.047 | -0.068–-0.026 | 64,950 |
| 39 | #39Muse Spark 1.2 (xHigh) | Meta | -0.054 | -0.072–-0.036 | 33,552 |
| 40 | #40Gemini 3.6 Flash (High) | -0.057 | -0.083–-0.031 | 18,029 | |
| 41 | #41Qwen3.7 Max | Alibaba | -0.091 | -0.115–-0.066 | 30,156 |
| 42 | #42Qwen3.7 Plus | Alibaba | -0.093 | -0.126–-0.06 | 15,130 |
| 43 | #43Mimo V2.5 Pro | Xiaomi | -0.096 | -0.119–-0.073 | 29,517 |
| 44 | #44Gemini 3.1 Pro Preview | -0.099 | -0.121–-0.078 | 69,866 | |
| 45 | #45THy3 | Tencent | -0.112 | -0.14–-0.084 | 14,238 |
| 46 | #46Minimax M3 | MiniMax | -0.137 | -0.162–-0.112 | 28,148 |
| 47 | #47Mistral Medium 3.5 | Mistral AI | -0.145 | -0.183–-0.108 | 6,629 |
| 48 | #48TInkling Small | Thinky | -0.201 | -0.244–-0.158 | 7,271 |
| 49 | #49USolar Pro 4 | Upstage | -0.205 | -0.259–-0.152 | 4,788 |
| 50 | #50TInkling | Thinky | -0.207 | -0.237–-0.177 | 24,644 |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings