LMArena · 数学
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: LMArenaのテキスト会話のうち、数学の質問に分類された投票を使ったランキングです。
スコアの読み方: 数学関連の回答で、ユーザーがより好んだモデルの相対スコアです。投票数が少ないモデルは、信頼区間が広い場合があります。
注意点: 正答率を直接採点した試験ではなく、選好評価です。数学の正確性は、FrontierMathなどの採点型評価も確認してください。
今回のランキングから読み取れること
- 1位のgemini-4-argon-highと2位のclaude-fable-5-highの95%信頼区間は重なっています。この集計だけで2つのモデルの順位を確定するのは困難です。
- 1位と信頼区間が重なるモデルが、ほかに37件あります。小さな順位差は、投票数も踏まえて慎重に解釈してください。
- 上位10モデルのうち、Anthropicのモデルが7モデルで最も多くなっています。
- 1位のモデルが獲得した投票は255票で、このランキングには396件のモデルがあります。
数学 LMArena
公開日 2026-10-02 · 取得日 2026-10-04
点はスコア、横線は95%信頼区間です。線が重なる場合、実質的に同程度です。 グラフには、同じモデルの推論設定(high・maxなど)のうち、スコアが最も高いものだけを表示しています。表には設定ごとの順位をすべて掲載しています。 会話・ビジョンのランキングは、LMArenaサイトのデフォルトと同じ「口調・長さ補正(style control)」ランキングです。
企業別の最高順位
- Googlegemini-4-argon-high#1
- Anthropicclaude-fable-5-high#2
- Metamuse-spark-1.3-max#9
- ZZ.aiglm-5.3-flash#13
- DeepSeekdeepseek-v4.1-flash-max#14
- Moonshot AIkimi-k3-max#16
- OOpenAIgpt-5.5#17
- Alibabaqwen3.8-max#18
- Xiaomimimo-v2.6-pro#30
表で見る(上位50件)
| 順位 | モデル | 開発元 | スコア | 95%信頼区間 | 投票数 |
|---|---|---|---|---|---|
| 1 | #1gemini-4-argon-high | 1530 | 1494–1566 | 255 | |
| 2 | #2claude-fable-5-high | Anthropic | 1522 | 1509–1536 | 1,889 |
| 3 | #3claude-opus-5-high | Anthropic | 1521 | 1509–1533 | 2,756 |
| 4 | #4claude-fable-5.1-max | Anthropic | 1518 | 1493–1543 | 544 |
| 5 | #5gemini-3.8-flash-high | 1517 | 1501–1534 | 1,274 | |
| 6 | #6claude-opus-4-6-high | Anthropic | 1517 | 1507–1527 | 3,978 |
| 7 | #7claude-opus-5-max | Anthropic | 1516 | 1499–1532 | 1,337 |
| 8 | #8claude-opus-5.5-high | Anthropic | 1510 | 1475–1546 | 235 |
| 9 | #9muse-spark-1.3-max | Meta | 1509 | 1485–1533 | 586 |
| 10 | #10claude-opus-4-6 | Anthropic | 1507 | 1497–1516 | 4,454 |
| 11 | #11claude-opus-4-7-high | Anthropic | 1504 | 1493–1515 | 3,260 |
| 12 | #12gemini-3.7-flash-high | 1503 | 1485–1521 | 1,097 | |
| 13 | #13Zglm-5.3-flash | Z.ai | 1503 | 1485–1521 | 1,131 |
| 14 | #14deepseek-v4.1-flash-max | DeepSeek | 1503 | 1476–1530 | 433 |
| 15 | #15gemini-3.6-flash-high | 1501 | 1487–1516 | 1,736 | |
| 16 | #16kimi-k3-max | Moonshot AI | 1500 | 1483–1517 | 1,218 |
| 17 | #17Ogpt-5.5 | OpenAI | 1500 | 1489–1510 | 3,499 |
| 18 | #18qwen3.8-max | Alibaba | 1498 | 1480–1515 | 1,151 |
| 19 | #19gemini-3.5-flash-high | 1497 | 1485–1510 | 2,361 | |
| 20 | #20Zglm-5.3-max | Z.ai | 1494 | 1473–1515 | 739 |
| 21 | #21claude-opus-4-8-high | Anthropic | 1494 | 1483–1505 | 2,941 |
| 22 | #22Ogpt-5.6-sol-xhigh | OpenAI | 1494 | 1480–1508 | 1,732 |
| 23 | #23Ogpt-5.5-high | OpenAI | 1493 | 1483–1503 | 3,472 |
| 24 | #24muse-spark-1.1 | Meta | 1492 | 1478–1507 | 1,661 |
| 25 | #25Ogpt-5.4-high | OpenAI | 1492 | 1481–1502 | 3,379 |
| 26 | #26claude-opus-4-7 | Anthropic | 1492 | 1481–1502 | 3,371 |
| 27 | #27Ogpt-6-astra-max | OpenAI | 1490 | 1463–1517 | 458 |
| 28 | #28Zglm-5.2-max | Z.ai | 1488 | 1475–1501 | 2,035 |
| 29 | #29gemini-3.1-pro-preview | 1488 | 1480–1496 | 6,301 | |
| 30 | #30mimo-v2.6-pro | Xiaomi | 1487 | 1447–1527 | 213 |
| 31 | #31qwen3.7-max-preview | Alibaba | 1484 | 1446–1523 | 231 |
| 32 | #32gemini-3.5-flash-medium | 1482 | 1469–1495 | 2,196 | |
| 33 | #33mimo-v2.5-pro | Xiaomi | 1481 | 1470–1491 | 3,356 |
| 34 | #34Thy3 | Tencent | 1480 | 1455–1505 | 550 |
| 35 | #35kimi-k2.6 | Moonshot AI | 1480 | 1467–1493 | 2,075 |
| 36 | #36Ogpt-5.6-terra-xhigh | OpenAI | 1478 | 1464–1493 | 1,664 |
| 37 | #37Tinkling | Thinky | 1478 | 1463–1493 | 1,581 |
| 38 | #38ernie-5.1 | Baidu | 1477 | 1464–1491 | 1,980 |
| 39 | #39Ogpt-5.6-luna-xhigh | OpenAI | 1477 | 1463–1491 | 1,780 |
| 40 | #40claude-opus-4-8 | Anthropic | 1477 | 1466–1488 | 3,072 |
| 41 | #41gemini-3-pro | 1477 | 1465–1488 | 2,761 | |
| 42 | #42qwen3.6-max-preview | Alibaba | 1476 | 1447–1505 | 380 |
| 43 | #43Zglm-5.1 | Z.ai | 1475 | 1464–1487 | 2,860 |
| 44 | #44gemini-3-flash | 1474 | 1461–1487 | 2,060 | |
| 45 | #45claude-sonnet-5-high | Anthropic | 1474 | 1460–1487 | 2,061 |
| 46 | #46xgrok-4.5 | xAI | 1473 | 1459–1487 | 1,752 |
| 47 | #47mimo-v2.6-flash | Xiaomi | 1472 | 1441–1503 | 330 |
| 48 | #48claude-opus-4-5-20251101-high-32k | Anthropic | 1472 | 1460–1484 | 2,334 |
| 49 | #49kimi-k2.5-thinking | Moonshot AI | 1471 | 1462–1481 | 4,158 |
| 50 | #50gemma-4-31b | 1469 | 1443–1496 | 432 |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings