LMArena · 総合
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: LMArenaでユーザーが名前を伏せた2つのモデルの回答を比較し、投票した結果を集計したランキングです。LMArenaサイトのデフォルトと同じく、回答の長さやマークダウンなどの形式が投票に与える影響を統計的に補正した「口調・長さ補正(style control)」ランキングを使用しています。
スコアの読み方: 投票をBradley–Terryモデルで推定し、Eloに似た尺度で表示した相対スコアです。95%信頼区間は推定の不確実性を示し、重なっているという事実だけで同じ能力だと断定することはできません。
注意点: ユーザーがより好んだ回答を評価するため、正確性だけでなく、口調・長さ・形式などの影響を受ける場合があります。適用されたフィルターや補正設定も確認してください。
今回のランキングから読み取れること
- 1位のgemini-4-argon-highと2位のclaude-opus-4-6-highの95%信頼区間は重なっていません。今回の集計では、1位が上回っている根拠が比較的明確です。
- 上位10モデルのうち、Anthropicのモデルが7モデルで最も多くなっています。
- 1位のモデルが獲得した投票は4,932票で、このランキングには413件のモデルがあります。
総合 LMArena
公開日 2026-10-02 · 取得日 2026-10-04
点はスコア、横線は95%信頼区間です。線が重なる場合、実質的に同程度です。 グラフには、同じモデルの推論設定(high・maxなど)のうち、スコアが最も高いものだけを表示しています。表には設定ごとの順位をすべて掲載しています。 会話・ビジョンのランキングは、LMArenaサイトのデフォルトと同じ「口調・長さ補正(style control)」ランキングです。
企業別の最高順位
- Googlegemini-4-argon-high#1
- Anthropicclaude-opus-4-6-high#2
- Metamuse-spark-1.3-max#9
- Moonshot AIkimi-k3-max#16
- OOpenAIgpt-5.6-sol-xhigh#20
- Alibabaqwen3.8-max#23
- Xiaomimimo-v2.6-pro#26
- ZZ.aiglm-5.3-max#27
- xxAIgrok-4.20-beta1#36
表で見る(上位50件)
| 順位 | モデル | 開発元 | スコア | 95%信頼区間 | 投票数 |
|---|---|---|---|---|---|
| 1 | #1gemini-4-argon-high | 1525 | 1516–1534 | 4,932 | |
| 2 | #2claude-opus-4-6-high | Anthropic | 1505 | 1501–1508 | 77,636 |
| 3 | #3claude-fable-5-high | Anthropic | 1504 | 1500–1509 | 38,387 |
| 4 | #4claude-opus-5.5-high | Anthropic | 1504 | 1495–1513 | 4,552 |
| 5 | #5claude-opus-4-7-high | Anthropic | 1501 | 1498–1505 | 64,946 |
| 6 | #6claude-fable-5.1-max | Anthropic | 1501 | 1495–1508 | 11,800 |
| 7 | #7claude-opus-4-6 | Anthropic | 1497 | 1494–1501 | 82,189 |
| 8 | #8gemini-3.8-flash-high | 1495 | 1490–1500 | 26,298 | |
| 9 | #9muse-spark-1.3-max | Meta | 1494 | 1488–1500 | 12,343 |
| 10 | #10claude-opus-4-7 | Anthropic | 1494 | 1490–1498 | 66,058 |
| 11 | #11muse-spark-1.2 (xHigh) | Meta | 1494 | 1484–1503 | 4,356 |
| 12 | #12muse-spark-1.1 | Meta | 1491 | 1487–1496 | 37,238 |
| 13 | #13claude-opus-5-high | Anthropic | 1490 | 1486–1494 | 59,482 |
| 14 | #14claude-opus-5-max | Anthropic | 1489 | 1485–1494 | 28,937 |
| 15 | #15muse-spark | Meta | 1489 | 1484–1495 | 14,120 |
| 16 | #16kimi-k3-max | Moonshot AI | 1488 | 1484–1493 | 28,280 |
| 17 | #17gemini-3.7-flash-high | 1488 | 1483–1493 | 21,539 | |
| 18 | #18gemini-3.1-pro-preview | 1487 | 1484–1490 | 121,806 | |
| 19 | #19gemini-3-pro | 1485 | 1482–1489 | 41,910 | |
| 20 | #20Ogpt-5.6-sol-xhigh | OpenAI | 1484 | 1479–1488 | 36,656 |
| 21 | #21Ogpt-6.1-sol-max | OpenAI | 1483 | 1473–1494 | 3,071 |
| 22 | #22gemini-3.6-flash-high | 1483 | 1479–1487 | 36,070 | |
| 23 | #23qwen3.8-max | Alibaba | 1482 | 1476–1487 | 23,353 |
| 24 | #24claude-opus-4-8-high | Anthropic | 1482 | 1478–1485 | 63,974 |
| 25 | #25Ogpt-5.5-high | OpenAI | 1481 | 1478–1485 | 69,202 |
| 26 | #26mimo-v2.6-pro | Xiaomi | 1480 | 1471–1489 | 4,056 |
| 27 | #27Zglm-5.3-max | Z.ai | 1478 | 1473–1484 | 17,857 |
| 28 | #28gemini-3.5-flash-high | 1477 | 1473–1481 | 48,420 | |
| 29 | #29Ogpt-6-astra-max | OpenAI | 1477 | 1470–1484 | 9,156 |
| 30 | #30Ogpt-5.5 | OpenAI | 1477 | 1473–1480 | 70,781 |
| 31 | #31gemini-3.5-flash-medium | 1476 | 1472–1480 | 47,187 | |
| 32 | #32Zglm-5.2-max | Z.ai | 1476 | 1471–1480 | 45,399 |
| 33 | #33Ogpt-5.2-chat-latest-20260210 | OpenAI | 1476 | 1472–1480 | 35,937 |
| 34 | #34Ogpt-5.4-high | OpenAI | 1475 | 1471–1479 | 64,642 |
| 35 | #35qwen3.7-max-preview | Alibaba | 1475 | 1465–1485 | 3,920 |
| 36 | #36xgrok-4.20-beta1 | xAI | 1475 | 1470–1479 | 27,827 |
| 37 | #37claude-opus-4-8 | Anthropic | 1475 | 1471–1478 | 65,072 |
| 38 | #38deepseek-v4.1-flash-max | DeepSeek | 1474 | 1468–1481 | 8,728 |
| 39 | #39claude-opus-4-5-20251101-high-32k | Anthropic | 1474 | 1470–1477 | 37,448 |
| 40 | #40Ogpt-5.5-instant | OpenAI | 1473 | 1468–1478 | 27,098 |
| 41 | #41Zglm-5.3-flash | Z.ai | 1473 | 1468–1478 | 22,971 |
| 42 | #42gemini-3-flash | 1473 | 1468–1477 | 31,259 | |
| 43 | #43claude-sonnet-4-6 | Anthropic | 1472 | 1469–1476 | 70,747 |
| 44 | #44xgrok-4.20-beta-0309-reasoning | xAI | 1472 | 1468–1475 | 66,334 |
| 45 | #45claude-sonnet-5.5-xhigh | Anthropic | 1471 | 1461–1481 | 3,145 |
| 46 | #46xgrok-4.20-multi-agent-beta-0309 | xAI | 1471 | 1467–1474 | 64,788 |
| 47 | #47claude-opus-4-5-20251101 | Anthropic | 1470 | 1467–1473 | 72,772 |
| 48 | #48ernie-5.1 | Baidu | 1468 | 1463–1472 | 39,396 |
| 49 | #49mimo-v2.5-pro | Xiaomi | 1468 | 1464–1471 | 70,871 |
| 50 | #50xgrok-4.5 | xAI | 1466 | 1461–1470 | 39,789 |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings