Artificial Analysis · エージェント指数
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: Artificial Analysisが、ツールを使って複数の段階を進めるエージェント作業の評価をまとめて作成した指数です。
スコアの読み方: 高いほど、ツールの使用・多段階の作業の評価で良い結果を出したことを意味します。
注意点: 評価環境やツール構成によって結果が変わる場合があるため、実際に使うエージェントツールでの性能と同じとは言い切れません。
今回のランキングから読み取れること
- 最高スコアはClaude Fable 5.1 (Max, Default Fallback)の57.9です。
- 1位と5位の差は4.9です。
- 上位10モデルのうち、Anthropicのモデルが3モデルで最も多くなっています。
エージェント指数 Artificial Analysis
公開日 2026-10-05 · 取得日 2026-10-05
グラフには、同じモデルの推論設定(high・maxなど)のうち、スコアが最も高いものだけを表示しています。表には設定ごとの順位をすべて掲載しています。
表で見る(上位60件)
| 順位 | モデル | 開発元 | スコア |
|---|---|---|---|
| 1 | #1Claude Fable 5.1 (Max, Default Fallback) | Anthropic | 57.9 |
| 2 | #2Claude Opus 5 (Max) | Anthropic | 56.5 |
| 3 | #3Qwen3.8 Max (0902) | Alibaba | 56 |
| 4 | #4ZGLM-5.3 (Max) | Z.ai | 53.1 |
| 5 | #5xGrok 4.6 (High) | xAI | 53 |
| 6 | #6OGPT-6 Astra (max) | OpenAI | 51 |
| 7 | #7ZGLM 5.3 Flash | Z.ai | 50.9 |
| 8 | #8Claude Fable 5 (Max, Opus 4.8 Fallback) | Anthropic | 50.7 |
| 9 | #9OGPT-5.6 Sol (Max) | OpenAI | 50.2 |
| 10 | #10Qwen3.8 2.4T A95B | Alibaba | 50.1 |
| 11 | #11Kimi K3 (Max) | Moonshot AI | 50 |
| 12 | #12Qwen3.8 Max | Alibaba | 49.9 |
| 13 | #13Qwen3.8 27B (Xhigh) | Alibaba | 45.8 |
| 14 | #14Claude Sonnet 5 (Max) | Anthropic | 43.6 |
| 15 | #15Muse Spark 1.2 (Xhigh) | Meta | 43.2 |
| 16 | #16OGPT-5.6 Terra (Max) | OpenAI | 43.2 |
| 17 | #17OGPT-5.6 Luna (Max) | OpenAI | 42.1 |
| 18 | #18Claude Opus 4.8 (Max) | Anthropic | 41.9 |
| 19 | #19DeepSeek V4 Pro 0813 (Max) | DeepSeek | 41.3 |
| 20 | #20xGrok 4.5 (High) | xAI | 41.2 |
| 21 | #21DeepSeek V4 Flash 0731 (Max) | DeepSeek | 41 |
| 22 | #22Gemini 3.8 Flash (High) | 40.2 | |
| 23 | #23Claude Opus 4.7 (Max) | Anthropic | 38.6 |
| 24 | #24ZGLM-5.2 (Max) | Z.ai | 38.4 |
| 25 | #25OGPT-5.5 (Xhigh) | OpenAI | 36.4 |
| 26 | #26Gemini 3.7 Flash (High) | 35.2 | |
| 27 | #27Claude Sonnet 4.6 (Max) | Anthropic | 31.8 |
| 28 | #28MiniMax-M3 | MiniMax | 29.5 |
| 29 | #29Gemini 3.6 Flash (High) | 29 | |
| 30 | #30iLing-3.0-flash-VL | inclusionAI | 28.7 |
| 31 | #31iLing-3.0-flash-Fin | inclusionAI | 27.9 |
| 32 | #32DeepSeek V4 Flash 0420 (High) | DeepSeek | 26.3 |
| 33 | #33DeepSeek V4 Pro 0424 (Max) | DeepSeek | 26.3 |
| 34 | #34Gemini 3.5 Flash (High) | 26 | |
| 35 | #35Muse Spark 1.1 (Xhigh) | Meta | 25.8 |
| 36 | #36THy3 | Tencent | 24.1 |
| 37 | #37ZGLM-5.1 (Reasoning) | Z.ai | 23.9 |
| 38 | #38NNex-N2-Pro (Based on Qwen3.5-397B-A17B) | Nex Agi | 23.7 |
| 39 | #39TInkling Small | Thinkingmachines | 23.5 |
| 40 | #40TInkling (Xhigh) | Thinkingmachines | 22.5 |
| 41 | #41Qwen3.7 Max | Alibaba | 22.5 |
| 42 | #42MiMo-V2.5-Pro (Reasoning) | Xiaomi | 21.3 |
| 43 | #43Kimi K2.7 Code | Moonshot AI | 21 |
| 44 | #44Kimi K2.6 (Reasoning) | Moonshot AI | 20.5 |
| 45 | #45Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 20.1 |
| 46 | #46iLing 3.0 Flash | inclusionAI | 19.3 |
| 47 | #47Qwen3.6 27B (Reasoning) | Alibaba | 18.5 |
| 48 | #48OGPT-5.4 mini (Xhigh) | OpenAI | 17.9 |
| 49 | #49Qwen3.7 Plus | Alibaba | 17.5 |
| 50 | #50OGPT-5.4 nano (Xhigh) | OpenAI | 16 |
| 51 | #51Claude 4.5 Sonnet (Reasoning) | Anthropic | 15.8 |
| 52 | #52MiMo-V2.5 | Xiaomi | 15.8 |
| 53 | #53xGrok 4.3 (High) | xAI | 15.5 |
| 54 | #54MiniMax-M2.7 | MiniMax | 15.3 |
| 55 | #55Gemini 3.5 Flash-Lite | 14.3 | |
| 56 | #56MLongCat 2.0 | Meituan | 14 |
| 57 | #57Qwen3.6 35B A3B (Reasoning) | Alibaba | 13.1 |
| 58 | #58iRing-2.6-1T | inclusionAI | 10.7 |
| 59 | #59Qwen3.5 397B A17B (Reasoning) | Alibaba | 8.3 |
| 60 | #60Gemini 3.1 Pro Preview | 8.2 |
Source: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings