LMArena · 文档理解
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。
如何解读此排行榜
衡量什么: 这是 LMArena 用户上传文档(PDF 等)并提问后,比较两个模型的回答并投票得出的排名。
如何解读分数: 这是通过 Bradley–Terry 方法估计的相对分数。如果 95% 置信区间较宽,请谨慎解读排名差异。
注意事项: 更新周期可能比其他榜单更长,请查看发布日期。结果可能因文档类型和语言而异。
本次排名的解读要点
- 第 1 名 claude-opus-5-high 与第 2 名 claude-fable-5.1-max 的 95% 置信区间重叠。仅凭本次统计难以确定两个模型的先后顺序。
- 还有 3 个模型的置信区间与第 1 名重叠。解读细微排名差异时,请结合投票数量保持谨慎。
- 前 10 个模型中,Anthropic 的模型有 7 个,数量最多。
- 第 1 名模型获得了 8,794 票,此排行榜包含 44 个模型。
文档理解 LMArena
发布日期:2026-09-13 · 获取日期:2026-10-04
1440147015001530
claude-opus-5-high
1516
claude-fable-5.1-max
1513
claude-opus-4-6-high
1507
claude-fable-5
1496
claude-opus-4-7
1495
Ogpt-5.5
1486
Ogpt-5.6-sol-xhigh
1483
claude-sonnet-4-6
1482
claude-opus-4-8-high
1475
Ogpt-5.6-terra-xhigh
1472
Ogpt-5.4
1471
muse-spark-1.3-max
1471
Ogpt-6-astra-max
1468
claude-sonnet-5-high
1466
muse-spark-1.1
1465
gemini-3.5-flash-medium
1463
claude-opus-4-5-20251101
1462
Ogpt-5.6-luna-xhigh
1457
gemini-3.6-flash-high
1456
xgrok-4.6-high
1452
圆点表示得分,横线表示 95% 置信区间。横线重叠意味着水平基本相近。 图表仅显示同一模型各推理设置(high、max 等)中排名最高的一项。表格列出所有设置各自的排名。
各公司最高排名
- Anthropicclaude-opus-5-high#1
- OOpenAIgpt-5.5#8
- Metamuse-spark-1.3-max#15
- Googlegemini-3.5-flash-medium#20
- xxAIgrok-4.6-high#25
- Moonshot AIkimi-k2.6#27
- Alibabaqwen3.7-plus#30
- MiniMaxminimax-m3#32
- ZZ.aiglm-5v-turbo#39
查看表格(前 50 名)
| 排名 | 模型 | 开发方 | 分数 | 95% 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 | #1claude-opus-5-high | Anthropic | 1516 | 1509–1523 | 8,794 |
| 2 | #2claude-fable-5.1-max | Anthropic | 1513 | 1497–1528 | 1,403 |
| 3 | #3claude-opus-4-6-high | Anthropic | 1507 | 1501–1514 | 27,929 |
| 4 | #4claude-opus-4-6 | Anthropic | 1507 | 1501–1513 | 41,260 |
| 5 | #5claude-fable-5 | Anthropic | 1496 | 1488–1504 | 8,497 |
| 6 | #6claude-opus-4-7 | Anthropic | 1495 | 1489–1501 | 22,192 |
| 7 | #7claude-opus-4-7-high | Anthropic | 1495 | 1488–1501 | 21,957 |
| 8 | #8Ogpt-5.5 | OpenAI | 1486 | 1479–1492 | 21,279 |
| 9 | #9Ogpt-5.5-high | OpenAI | 1484 | 1478–1491 | 20,944 |
| 10 | #10Ogpt-5.6-sol-xhigh | OpenAI | 1483 | 1474–1492 | 4,818 |
| 11 | #11claude-sonnet-4-6 | Anthropic | 1482 | 1476–1488 | 57,813 |
| 12 | #12claude-opus-4-8-high | Anthropic | 1475 | 1468–1482 | 11,551 |
| 13 | #13Ogpt-5.6-terra-xhigh | OpenAI | 1472 | 1463–1480 | 5,787 |
| 14 | #14Ogpt-5.4 | OpenAI | 1471 | 1465–1477 | 33,331 |
| 15 | #15muse-spark-1.3-max | Meta | 1471 | 1452–1489 | 1,006 |
| 16 | #16Ogpt-6-astra-max | OpenAI | 1468 | 1453–1482 | 1,621 |
| 17 | #17claude-sonnet-5-high | Anthropic | 1466 | 1458–1474 | 7,411 |
| 18 | #18muse-spark-1.1 | Meta | 1465 | 1456–1474 | 4,885 |
| 19 | #19claude-opus-4-8 | Anthropic | 1464 | 1457–1471 | 12,128 |
| 20 | #20gemini-3.5-flash-medium | 1463 | 1455–1471 | 6,500 | |
| 21 | #21claude-opus-4-5-20251101 | Anthropic | 1462 | 1452–1473 | 7,981 |
| 22 | #22gemini-3.5-flash-high | 1461 | 1452–1471 | 4,061 | |
| 23 | #23Ogpt-5.6-luna-xhigh | OpenAI | 1457 | 1449–1465 | 5,766 |
| 24 | #24gemini-3.6-flash-high | 1456 | 1445–1467 | 2,975 | |
| 25 | #25xgrok-4.6-high | xAI | 1452 | 1440–1464 | 2,258 |
| 26 | #26xgrok-4.5 | xAI | 1452 | 1443–1461 | 4,965 |
| 27 | #27kimi-k2.6 | Moonshot AI | 1451 | 1443–1458 | 11,291 |
| 28 | #28claude-sonnet-4-5-20250929 | Anthropic | 1450 | 1444–1456 | 31,455 |
| 29 | #29muse-spark | Meta | 1444 | 1426–1462 | 1,084 |
| 30 | #30qwen3.7-plus | Alibaba | 1444 | 1435–1453 | 4,591 |
| 31 | #31gemini-3.1-pro-preview | 1444 | 1439–1449 | 49,457 | |
| 32 | #32minimax-m3 | MiniMax | 1435 | 1427–1443 | 6,314 |
| 33 | #33gemini-3-pro | 1434 | 1425–1443 | 10,769 | |
| 34 | #34kimi-k2.5-thinking | Moonshot AI | 1430 | 1423–1437 | 21,569 |
| 35 | #35gemma-4-31b | 1425 | 1417–1432 | 12,326 | |
| 36 | #36gemini-2.5-pro | 1421 | 1415–1427 | 25,110 | |
| 37 | #37claude-haiku-4-5-20251001 | Anthropic | 1420 | 1414–1426 | 34,677 |
| 38 | #38xgrok-4.20-beta-0309-reasoning | xAI | 1416 | 1409–1423 | 20,948 |
| 39 | #39Zglm-5v-turbo | Z.ai | 1416 | 1407–1424 | 6,995 |
| 40 | #40gemini-3-flash | 1413 | 1404–1422 | 7,158 | |
| 41 | #41Ogpt-5.2-high | OpenAI | 1405 | 1395–1414 | 7,108 |
| 42 | #42Ogpt-5.1 | OpenAI | 1403 | 1394–1413 | 8,244 |
| 43 | #43Ogpt-5.5-instant | OpenAI | 1403 | 1395–1411 | 8,497 |
| 44 | #44Ogpt-5.2 | OpenAI | 1401 | 1395–1407 | 28,212 |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings