AIベンチマークランキング
公開ベンチマークデータ(LMArenaのユーザー投票ランキング、Epoch AIのテストスコア)を定期的に取得して掲載しています。各ランキングの公開日と取得日を表示しています。当サイトが独自に採点したものではありません。
最新モデルを一覧で
過去120日以内に公開されたモデルをリリース日順に並べ、2つの公開データソースのスコアを1行にまとめました。スコアは正答率(%)です。
| モデル | リリース日 | 総合指数 | GPQA Diamond | FrontierMath | HLE | ARC-AGI-2 | SWE-bench Verified | LMArena総合順位 | LMArena 日本語順位 |
|---|---|---|---|---|---|---|---|---|---|
| OGPT-6.1 SolOpenAI | 2026-09-29 | – | 95.4 | 93.7 | – | – | – | #60 | 未掲載 |
| Claude Sonnet 5.5Anthropic | 2026-09-28 | 165.2 | 95.6 | 88.8 | – | – | – | #34 | 未掲載 |
| Claude Opus 5.5Anthropic | 2026-09-22 | 167.4 | – | 91.2 | – | 92.5 | – | #2 | 未掲載 |
| OGPT-6 SolOpenAI | 2026-09-22 | – | 94.3 | 89.8 | – | 89.6 | – | #158 | 未掲載 |
| OGPT-6 LunaOpenAI | 2026-09-22 | – | – | 78.9 | – | 59.3 | – | #163 | #115 |
| DeepSeek V4.1 FlashDeepSeek | 2026-09-09 | 155 | – | – | – | – | – | #37 | 未掲載 |
| OGPT-6 AstraOpenAI | 2026-09-03 | 166.5 | 95.8 | 93.7 | 54.8 | 95 | – | #71 | #92 |
| Gemini 3.8 FlashGoogle | 2026-09-02 | 156.9 | 95.4 | 68.4 | 44.5 | – | – | #8 | #7 |
| Muse Spark 1.3Meta | 2026-09-02 | 156.9 | – | 74.4 | – | – | – | #12 | #13 |
| Claude Fable 5.1Anthropic | 2026-09-01 | 164.8 | – | 90.2 | 46.5 | 90 | – | #3 | #1 |
| Qwen3.8 Max (0902)Alibaba | 2026-09-01 | 155.2 | 92.3 | 65.6 | – | – | – | 未掲載 | 未掲載 |
| ZGLM-5.3-FlashZ.ai | 2026-08-20 | 151.9 | – | – | – | – | – | #30 | #43 |
| ZGLM-5.3Z.ai | 2026-08-14 | 155.8 | 90.9 | 68.8 | – | – | – | #26 | #33 |
| Qwen 3.8 27BAlibaba | 2026-08-14 | 149.4 | – | – | – | – | – | #74 | #78 |
| Gemini 3.7 FlashGoogle | 2026-08-13 | 157.4 | 94.8 | 71.6 | – | 84.6 | – | #13 | #6 |
| DeepSeek V4 Pro 0813DeepSeek | 2026-08-13 | 155.4 | 91.7 | – | – | 61.3 | – | 未掲載 | 未掲載 |
新モデルは十分な投票が集まるとランキング(特に言語別ランキング)に掲載されます。リリース直後は「未掲載」と表示されることがあります。
LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。
日本語 LMArena
公開日 2026-10-02 · 取得日 2026-10-04
14401480152015601600
claude-fable-5.1-max
1551
claude-opus-5-high
1513
gemini-3-pro
1513
claude-opus-5-max
1511
claude-fable-5-high
1510
gemini-3.7-flash-high
1503
gemini-3.8-flash-high
1503
qwen3.5-max-preview
1497
Ogpt-5.5-high
1497
gemini-3.1-pro-preview
1495
kimi-k3-max
1488
gemini-3-flash
1488
muse-spark-1.3-max
1487
gemini-3.5-flash-high
1486
claude-opus-4-6-high
1484
Ogpt-5.4-high
1483
gemini-3.6-flash-high
1476
claude-opus-4-6
1474
Ogpt-5.5
1474
Ogpt-5.6-sol-xhigh
1471
点はスコア、横線は95%信頼区間です。線が重なる場合、実質的に同程度です。
表で見る(上位50件)
| 順位 | モデル | 開発元 | スコア | 95%信頼区間 | 投票数 |
|---|---|---|---|---|---|
| 1 | claude-fable-5.1-max | Anthropic | 1551 | 1506–1596 | 200 |
| 2 | claude-opus-5-high | Anthropic | 1513 | 1491–1536 | 958 |
| 3 | gemini-3-pro | 1513 | 1483–1543 | 471 | |
| 4 | claude-opus-5-max | Anthropic | 1511 | 1482–1541 | 482 |
| 5 | claude-fable-5-high | Anthropic | 1510 | 1482–1537 | 538 |
| 6 | gemini-3.7-flash-high | 1503 | 1470–1537 | 340 | |
| 7 | gemini-3.8-flash-high | 1503 | 1473–1533 | 462 | |
| 8 | qwen3.5-max-preview | Alibaba | 1497 | 1453–1542 | 207 |
| 9 | Ogpt-5.5-high | OpenAI | 1497 | 1475–1519 | 895 |
| 10 | gemini-3.1-pro-preview | 1495 | 1477–1513 | 1,409 | |
| 11 | kimi-k3-max | Moonshot AI | 1488 | 1460–1517 | 508 |
| 12 | gemini-3-flash | 1488 | 1454–1522 | 337 | |
| 13 | muse-spark-1.3-max | Meta | 1487 | 1441–1533 | 188 |
| 14 | gemini-3.5-flash-high | 1486 | 1461–1511 | 672 | |
| 15 | claude-opus-4-6-high | Anthropic | 1484 | 1461–1506 | 845 |
| 16 | Ogpt-5.4-high | OpenAI | 1483 | 1459–1508 | 671 |
| 17 | gemini-3.6-flash-high | 1476 | 1450–1502 | 598 | |
| 18 | claude-opus-4-6 | Anthropic | 1474 | 1452–1496 | 875 |
| 19 | Ogpt-5.5 | OpenAI | 1474 | 1451–1497 | 800 |
| 20 | Ogpt-5.6-sol-xhigh | OpenAI | 1471 | 1443–1498 | 549 |
| 21 | claude-opus-4-7-high | Anthropic | 1470 | 1445–1494 | 705 |
| 22 | qwen3.8-max | Alibaba | 1468 | 1436–1500 | 402 |
| 23 | gemini-3.5-flash-medium | 1463 | 1437–1488 | 668 | |
| 24 | gemini-2.5-pro | 1462 | 1447–1476 | 2,037 | |
| 25 | claude-opus-4-7 | Anthropic | 1461 | 1438–1484 | 797 |
| 26 | Ogpt-5.1-high | OpenAI | 1453 | 1425–1481 | 458 |
| 27 | muse-spark-1.1 | Meta | 1451 | 1426–1476 | 633 |
| 28 | Zglm-5.2-max | Z.ai | 1450 | 1426–1475 | 702 |
| 29 | xgrok-4.20-beta1 | xAI | 1450 | 1410–1490 | 225 |
| 30 | Ogpt-5.4 | OpenAI | 1449 | 1425–1473 | 680 |
| 31 | Ogpt-5.6-terra-xhigh | OpenAI | 1447 | 1420–1474 | 559 |
| 32 | deepseek-v4-pro | DeepSeek | 1447 | 1423–1470 | 715 |
| 33 | Zglm-5.3-max | Z.ai | 1445 | 1411–1480 | 327 |
| 34 | kimi-k2.6 | Moonshot AI | 1442 | 1413–1470 | 497 |
| 35 | Zglm-4.7 | Z.ai | 1439 | 1384–1493 | 123 |
| 36 | claude-opus-4-8 | Anthropic | 1438 | 1416–1460 | 874 |
| 37 | claude-opus-4-8-high | Anthropic | 1438 | 1416–1460 | 881 |
| 38 | Zglm-5.1 | Z.ai | 1434 | 1410–1457 | 754 |
| 39 | qwen3.5-397b-a17b | Alibaba | 1427 | 1407–1447 | 1,032 |
| 40 | gemini-3.5-flash-lite | 1427 | 1400–1454 | 565 | |
| 41 | xgrok-4.5 | xAI | 1427 | 1399–1454 | 522 |
| 42 | Tinkling | Thinky | 1426 | 1399–1454 | 521 |
| 43 | Zglm-5.3-flash | Z.ai | 1425 | 1394–1456 | 408 |
| 44 | Ogpt-5.1 | OpenAI | 1425 | 1396–1453 | 453 |
| 45 | gemini-3-flash (thinking-minimal) | 1423 | 1401–1445 | 847 | |
| 46 | ernie-5.1 | Baidu | 1421 | 1394–1449 | 510 |
| 47 | kimi-k2.5-thinking | Moonshot AI | 1421 | 1399–1443 | 842 |
| 48 | Ogpt-5.2-high | OpenAI | 1421 | 1391–1450 | 443 |
| 49 | claude-sonnet-5-high | Anthropic | 1420 | 1395–1445 | 662 |
| 50 | claude-sonnet-4-6 | Anthropic | 1419 | 1397–1442 | 792 |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarks