LMArena · 英語
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: LMArenaのテキスト会話のうち、英語に分類された質問への投票を使って算出したランキングです。
スコアの読み方: 英語の質問で、投票者がより好んだモデルを示します。質問の言語は、投票者の母語や身元を意味するものではありません。
注意点: 言語やモデルによって投票数や信頼区間の幅が異なります。新しいモデルは、投票数、更新日、集計条件も確認してください。
今回のランキングから読み取れること
- 1位のgemini-4-argon-highと2位のclaude-opus-4-6-highの95%信頼区間は重なっています。この集計だけで2つのモデルの順位を確定するのは困難です。
- 1位と信頼区間が重なるモデルが、ほかに3件あります。小さな順位差は、投票数も踏まえて慎重に解釈してください。
- 上位10モデルのうち、Anthropicのモデルが6モデルで最も多くなっています。
- 1位のモデルが獲得した投票は1,928票で、このランキングには413件のモデルがあります。
英語 LMArena
公開日 2026-10-02 · 取得日 2026-10-04
点はスコア、横線は95%信頼区間です。線が重なる場合、実質的に同程度です。 グラフには、同じモデルの推論設定(high・maxなど)のうち、スコアが最も高いものだけを表示しています。表には設定ごとの順位をすべて掲載しています。 会話・ビジョンのランキングは、LMArenaサイトのデフォルトと同じ「口調・長さ補正(style control)」ランキングです。
企業別の最高順位
- Googlegemini-4-argon-high#1
- Anthropicclaude-opus-4-6-high#2
- Metamuse-spark-1.3-max#8
- OOpenAIgpt-6.1-sol-max#13
- Xiaomimimo-v2.6-pro#14
- Moonshot AIkimi-k3-max#15
- Alibabaqwen3.8-max#18
- ZZ.aiglm-5.3-max#23
- DeepSeekdeepseek-v4.1-flash-max#24
表で見る(上位50件)
| 順位 | モデル | 開発元 | スコア | 95%信頼区間 | 投票数 |
|---|---|---|---|---|---|
| 1 | #1gemini-4-argon-high | 1533 | 1519–1547 | 1,928 | |
| 2 | #2claude-opus-4-6-high | Anthropic | 1514 | 1509–1519 | 34,324 |
| 3 | #3claude-fable-5-high | Anthropic | 1513 | 1508–1519 | 16,474 |
| 4 | #4claude-opus-4-7-high | Anthropic | 1510 | 1505–1515 | 30,082 |
| 5 | #5claude-opus-4-6 | Anthropic | 1507 | 1502–1511 | 36,805 |
| 6 | #6claude-opus-5.5-high | Anthropic | 1506 | 1492–1520 | 1,719 |
| 7 | #7claude-opus-4-7 | Anthropic | 1501 | 1496–1506 | 30,422 |
| 8 | #8muse-spark-1.3-max | Meta | 1499 | 1491–1508 | 4,928 |
| 9 | #9muse-spark-1.2 (xHigh) | Meta | 1498 | 1484–1512 | 1,805 |
| 10 | #10gemini-3.8-flash-high | 1498 | 1491–1505 | 10,363 | |
| 11 | #11claude-fable-5.1-max | Anthropic | 1498 | 1489–1506 | 4,793 |
| 12 | #12muse-spark | Meta | 1497 | 1489–1504 | 6,673 |
| 13 | #13Ogpt-6.1-sol-max | OpenAI | 1496 | 1479–1513 | 1,149 |
| 14 | #14mimo-v2.6-pro | Xiaomi | 1496 | 1481–1511 | 1,487 |
| 15 | #15kimi-k3-max | Moonshot AI | 1495 | 1489–1502 | 10,786 |
| 16 | #16claude-opus-5-high | Anthropic | 1493 | 1488–1498 | 24,266 |
| 17 | #17claude-sonnet-5.5-xhigh | Anthropic | 1492 | 1475–1509 | 1,196 |
| 18 | #18qwen3.8-max | Alibaba | 1492 | 1485–1499 | 9,003 |
| 19 | #19muse-spark-1.1 | Meta | 1491 | 1486–1497 | 15,100 |
| 20 | #20claude-opus-5-max | Anthropic | 1491 | 1484–1497 | 11,702 |
| 21 | #21gemini-3.1-pro-preview | 1490 | 1486–1494 | 53,727 | |
| 22 | #22claude-opus-4-8-high | Anthropic | 1490 | 1485–1495 | 27,922 |
| 23 | #23Zglm-5.3-max | Z.ai | 1490 | 1482–1497 | 7,223 |
| 24 | #24deepseek-v4.1-flash-max | DeepSeek | 1489 | 1479–1500 | 3,237 |
| 25 | #25Ogpt-5.6-sol-xhigh | OpenAI | 1489 | 1483–1495 | 14,827 |
| 26 | #26Ogpt-6-astra-max | OpenAI | 1488 | 1478–1498 | 3,692 |
| 27 | #27gemini-3-pro | 1487 | 1482–1493 | 16,887 | |
| 28 | #28gemini-3.6-flash-high | 1487 | 1481–1493 | 15,114 | |
| 29 | #29gemini-3.7-flash-high | 1485 | 1478–1493 | 8,659 | |
| 30 | #30Ogpt-5.5-high | OpenAI | 1484 | 1480–1489 | 31,442 |
| 31 | #31Ogpt-5.5 | OpenAI | 1483 | 1478–1488 | 32,123 |
| 32 | #32claude-sonnet-4-6 | Anthropic | 1482 | 1478–1487 | 31,850 |
| 33 | #33Zglm-5.2-max | Z.ai | 1482 | 1477–1488 | 18,859 |
| 34 | #34claude-opus-4-5-20251101-high-32k | Anthropic | 1482 | 1477–1488 | 14,837 |
| 35 | #35claude-opus-4-8 | Anthropic | 1482 | 1477–1487 | 28,640 |
| 36 | #36Ogpt-5.2-chat-latest-20260210 | OpenAI | 1481 | 1476–1487 | 15,854 |
| 37 | #37Zglm-5.1 | Z.ai | 1481 | 1477–1486 | 25,210 |
| 38 | #38xgrok-4.20-beta1 | xAI | 1481 | 1475–1487 | 12,733 |
| 39 | #39mimo-v2.5-pro | Xiaomi | 1480 | 1475–1484 | 29,857 |
| 40 | #40claude-opus-4-5-20251101 | Anthropic | 1479 | 1474–1483 | 31,143 |
| 41 | #41gemini-3.5-flash-high | 1479 | 1473–1484 | 20,509 | |
| 42 | #42deepseek-v4-pro-high-20260813 | DeepSeek | 1479 | 1469–1488 | 3,755 |
| 43 | #43ernie-5.1 | Baidu | 1478 | 1473–1484 | 17,926 |
| 44 | #44Zglm-5.3-flash | Z.ai | 1478 | 1471–1485 | 8,546 |
| 45 | #45gemini-3.5-flash-medium | 1478 | 1472–1483 | 19,998 | |
| 46 | #46xgrok-4.20-beta-0309-reasoning | xAI | 1478 | 1473–1483 | 30,381 |
| 47 | #47Ogpt-5.4-high | OpenAI | 1476 | 1471–1481 | 29,222 |
| 48 | #48gemini-3-flash | 1476 | 1470–1482 | 12,474 | |
| 49 | #49xgrok-4.5 | xAI | 1474 | 1468–1480 | 16,121 |
| 50 | #50xgrok-4.20-multi-agent-beta-0309 | xAI | 1474 | 1469–1478 | 29,508 |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings