AI 基准测试排名
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
最新模型一览
汇总最近 120 天内发布的模型,按发布日期排序,在同一行展示两个公开来源的分数。分数为正确率(%)。
| 模型 | 发布日期 | 综合指数 | GPQA Diamond | FrontierMath | HLE | ARC-AGI-2 | SWE-bench Verified | LMArena 综合排名 | LMArena 中文 排名 |
|---|---|---|---|---|---|---|---|---|---|
| OGPT-6.1 SolOpenAI | 2026-09-29 | – | 95.4 | 93.7 | – | – | – | #21 | #59 |
| Claude Sonnet 5.5Anthropic | 2026-09-28 | 165.2 | 95.6 | 88.8 | – | – | – | #45 | #16 |
| Claude Opus 5.5Anthropic | 2026-09-22 | 167.4 | – | 91.2 | – | 92.5 | – | #4 | #2 |
| OGPT-6 SolOpenAI | 2026-09-22 | – | 94.3 | 89.8 | – | 89.6 | – | #64 | #94 |
| OGPT-6 LunaOpenAI | 2026-09-22 | – | – | 78.9 | – | 59.3 | – | #90 | #84 |
| DeepSeek V4.1 FlashDeepSeek | 2026-09-09 | 155 | – | – | – | – | – | #38 | #29 |
| OGPT-6 AstraOpenAI | 2026-09-03 | 166.5 | 95.8 | 93.7 | 54.8 | 95 | – | #29 | #43 |
| Gemini 3.8 FlashGoogle | 2026-09-02 | 156.9 | 95.4 | 68.4 | 44.5 | – | – | #8 | #14 |
| Muse Spark 1.3Meta | 2026-09-02 | 156.9 | – | 74.4 | – | – | – | #9 | #18 |
| Claude Fable 5.1Anthropic | 2026-09-01 | 164.8 | – | 90.2 | 46.5 | 90 | – | #6 | #3 |
| Qwen3.8 Max (0902)Alibaba | 2026-09-01 | 155.2 | 92.3 | 65.6 | – | – | – | 暂无 | 暂无 |
| ZGLM-5.3-FlashZ.ai | 2026-08-20 | 151.9 | – | – | – | – | – | #41 | #21 |
| ZGLM-5.3Z.ai | 2026-08-14 | 155.8 | 90.9 | 68.8 | – | – | – | #27 | #19 |
| Qwen 3.8 27BAlibaba | 2026-08-14 | 149.4 | – | – | – | – | – | #99 | #58 |
| Gemini 3.7 FlashGoogle | 2026-08-13 | 157.4 | 94.8 | 71.6 | – | 84.6 | – | #17 | #8 |
| DeepSeek V4 Pro 0813DeepSeek | 2026-08-13 | 155.4 | 91.7 | – | – | 61.3 | – | 暂无 | 暂无 |
新模型需积累足够的投票才能上榜,尤其是分语言榜单。刚发布时可能显示“暂无”。
LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。
中文 LMArena
发布日期:2026-10-02 · 获取日期:2026-10-04
14801520156016001640
gemini-4-argon-high
1587
claude-opus-5.5-high
1571
claude-fable-5.1-max
1570
claude-fable-5-high
1555
claude-opus-4-6-high
1551
claude-opus-5-max
1548
gemini-3.7-flash-high
1546
kimi-k3-max
1540
qwen3.8-max
1538
Ogpt-5.6-sol-xhigh
1538
claude-opus-4-7-high
1537
gemini-3.8-flash-high
1536
claude-sonnet-5.5-xhigh
1533
muse-spark-1.1
1531
muse-spark-1.3-max
1531
Zglm-5.3-max
1531
gemini-3.6-flash-high
1530
Zglm-5.3-flash
1529
gemini-3.1-pro-preview
1529
muse-spark-1.2 (xHigh)
1528
圆点表示得分,横线表示 95% 置信区间。横线重叠意味着水平基本相近。 图表仅显示同一模型各推理设置(high、max 等)中排名最高的一项。表格列出所有设置各自的排名。 对话与视觉排名采用与 LMArena 网站默认设置相同的“语气与长度校正(style control)”排名。
各公司最高排名
- Googlegemini-4-argon-high#1
- Anthropicclaude-opus-5.5-high#2
- Moonshot AIkimi-k3-max#10
- Alibabaqwen3.8-max#11
- OOpenAIgpt-5.6-sol-xhigh#12
- Metamuse-spark-1.1#17
- ZZ.aiglm-5.3-max#19
- DeepSeekdeepseek-v4.1-flash-max#29
- Xiaomimimo-v2.5-pro#39
查看表格(前 50 名)
| 排名 | 模型 | 开发方 | 分数 | 95% 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 | #1gemini-4-argon-high | 1587 | 1555–1619 | 352 | |
| 2 | #2claude-opus-5.5-high | Anthropic | 1571 | 1542–1601 | 402 |
| 3 | #3claude-fable-5.1-max | Anthropic | 1570 | 1549–1591 | 874 |
| 4 | #4claude-fable-5-high | Anthropic | 1555 | 1544–1567 | 2,852 |
| 5 | #5claude-opus-4-6-high | Anthropic | 1551 | 1542–1560 | 5,342 |
| 6 | #6claude-opus-5-max | Anthropic | 1548 | 1535–1562 | 2,274 |
| 7 | #7claude-opus-5-high | Anthropic | 1548 | 1538–1558 | 4,718 |
| 8 | #8gemini-3.7-flash-high | 1546 | 1532–1561 | 1,681 | |
| 9 | #9claude-opus-4-6 | Anthropic | 1544 | 1535–1553 | 5,582 |
| 10 | #10kimi-k3-max | Moonshot AI | 1540 | 1527–1554 | 2,051 |
| 11 | #11qwen3.8-max | Alibaba | 1538 | 1523–1553 | 1,712 |
| 12 | #12Ogpt-5.6-sol-xhigh | OpenAI | 1538 | 1526–1550 | 2,823 |
| 13 | #13claude-opus-4-7-high | Anthropic | 1537 | 1528–1547 | 4,149 |
| 14 | #14gemini-3.8-flash-high | 1536 | 1522–1550 | 2,061 | |
| 15 | #15claude-opus-4-7 | Anthropic | 1534 | 1524–1544 | 4,133 |
| 16 | #16claude-sonnet-5.5-xhigh | Anthropic | 1533 | 1497–1568 | 244 |
| 17 | #17muse-spark-1.1 | Meta | 1531 | 1519–1542 | 2,943 |
| 18 | #18muse-spark-1.3-max | Meta | 1531 | 1511–1550 | 939 |
| 19 | #19Zglm-5.3-max | Z.ai | 1531 | 1514–1547 | 1,328 |
| 20 | #20gemini-3.6-flash-high | 1530 | 1518–1542 | 2,712 | |
| 21 | #21Zglm-5.3-flash | Z.ai | 1529 | 1513–1544 | 1,648 |
| 22 | #22gemini-3.1-pro-preview | 1529 | 1521–1536 | 8,287 | |
| 23 | #23muse-spark-1.2 (xHigh) | Meta | 1528 | 1497–1559 | 382 |
| 24 | #24qwen3.7-max-preview | Alibaba | 1527 | 1491–1562 | 309 |
| 25 | #25Ogpt-5.5 | OpenAI | 1526 | 1517–1536 | 4,451 |
| 26 | #26claude-opus-4-8 | Anthropic | 1526 | 1516–1536 | 4,394 |
| 27 | #27claude-opus-4-8-high | Anthropic | 1526 | 1516–1535 | 4,356 |
| 28 | #28muse-spark | Meta | 1525 | 1505–1545 | 965 |
| 29 | #29deepseek-v4.1-flash-max | DeepSeek | 1523 | 1500–1546 | 672 |
| 30 | #30Zglm-5.2-max | Z.ai | 1520 | 1510–1531 | 3,261 |
| 31 | #31gemini-3-pro | 1520 | 1510–1531 | 3,444 | |
| 32 | #32gemini-3.5-flash-medium | 1517 | 1507–1528 | 3,451 | |
| 33 | #33Ogpt-5.5-high | OpenAI | 1517 | 1507–1527 | 4,469 |
| 34 | #34qwen3.5-max-preview | Alibaba | 1516 | 1501–1532 | 1,575 |
| 35 | #35Ogpt-5.6-terra-xhigh | OpenAI | 1516 | 1505–1528 | 2,949 |
| 36 | #36gemini-3-flash | 1516 | 1504–1529 | 2,466 | |
| 37 | #37Zglm-5 | Z.ai | 1516 | 1503–1530 | 2,001 |
| 38 | #38kimi-k2.6 | Moonshot AI | 1516 | 1503–1529 | 2,326 |
| 39 | #39mimo-v2.5-pro | Xiaomi | 1515 | 1505–1524 | 4,455 |
| 40 | #40gemini-3.5-flash-high | 1515 | 1504–1525 | 3,640 | |
| 41 | #41Zglm-5.1 | Z.ai | 1514 | 1504–1524 | 4,041 |
| 42 | #42mimo-v2.6-pro | Xiaomi | 1511 | 1478–1543 | 297 |
| 43 | #43Ogpt-6-astra-max | OpenAI | 1510 | 1488–1532 | 674 |
| 44 | #44xgrok-4.20-beta1 | xAI | 1510 | 1495–1525 | 1,726 |
| 45 | #45Thy3 | Tencent | 1509 | 1489–1530 | 779 |
| 46 | #46claude-sonnet-4-6 | Anthropic | 1509 | 1500–1519 | 4,501 |
| 47 | #47xgrok-4.7-xhigh | xAI | 1507 | 1482–1532 | 531 |
| 48 | #48Ogpt-5.4-high | OpenAI | 1507 | 1497–1517 | 4,132 |
| 49 | #49Ogpt-5.5-instant | OpenAI | 1506 | 1490–1521 | 1,693 |
| 50 | #50xgrok-4.5 | xAI | 1504 | 1493–1516 | 3,061 |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings