LMArena · 编程
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
如何解读此排行榜
衡量什么: 根据 LMArena 文本对话中被归类为编程相关问题的投票计算的排名。
如何解读分数: 这是用户在编程相关回答中更偏好的模型的相对分数。解读细微分数差异时,请同时查看置信区间和投票数量。
注意事项: 这是编程对话的偏好评估,请与实际修改仓库并运行测试的智能体评估区分。请同时查看 SWE-bench、Terminal-Bench 及公开的实测结果。
本次排名的解读要点
- 第 1 名 gemini-4-argon-high 与第 2 名 claude-fable-5-high 的 95% 置信区间重叠。仅凭本次统计难以确定两个模型的先后顺序。
- 还有 14 个模型的置信区间与第 1 名重叠。解读细微排名差异时,请结合投票数量保持谨慎。
- 前 10 个模型中,Anthropic 的模型有 5 个,数量最多。
- 第 1 名模型获得了 1,230 票,此排行榜包含 408 个模型。
编程 LMArena
发布日期:2026-10-02 · 获取日期:2026-10-04
圆点表示得分,横线表示 95% 置信区间。横线重叠意味着水平基本相近。 图表仅显示同一模型各推理设置(high、max 等)中排名最高的一项。表格列出所有设置各自的排名。 对话与视觉排名采用与 LMArena 网站默认设置相同的“语气与长度校正(style control)”排名。
各公司最高排名
- Googlegemini-4-argon-high#1
- Anthropicclaude-fable-5-high#2
- OOpenAIgpt-6-astra-max#7
- Moonshot AIkimi-k3-max#9
- Xiaomimimo-v2.6-pro#10
- Metamuse-spark-1.3-max#11
- DeepSeekdeepseek-v4.1-flash-max#26
- Alibabaqwen3.7-max-preview#27
- ZZ.aiglm-5.3-flash#29
查看表格(前 50 名)
| 排名 | 模型 | 开发方 | 分数 | 95% 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 | #1gemini-4-argon-high | 1560 | 1543–1577 | 1,230 | |
| 2 | #2claude-fable-5-high | Anthropic | 1552 | 1545–1559 | 10,038 |
| 3 | #3claude-opus-4-6-high | Anthropic | 1551 | 1546–1557 | 20,235 |
| 4 | #4claude-opus-4-7-high | Anthropic | 1551 | 1545–1556 | 18,521 |
| 5 | #5claude-opus-4-6 | Anthropic | 1548 | 1542–1553 | 22,901 |
| 6 | #6claude-opus-4-7 | Anthropic | 1546 | 1541–1552 | 18,728 |
| 7 | #7Ogpt-6-astra-max | OpenAI | 1543 | 1530–1556 | 2,135 |
| 8 | #8Ogpt-6.1-sol-max | OpenAI | 1542 | 1518–1566 | 609 |
| 9 | #9kimi-k3-max | Moonshot AI | 1541 | 1533–1549 | 7,285 |
| 10 | #10mimo-v2.6-pro | Xiaomi | 1540 | 1522–1558 | 1,103 |
| 11 | #11muse-spark-1.3-max | Meta | 1539 | 1528–1549 | 3,307 |
| 12 | #12claude-opus-5.5-high | Anthropic | 1538 | 1521–1556 | 1,060 |
| 13 | #13claude-sonnet-5.5-xhigh | Anthropic | 1536 | 1515–1558 | 779 |
| 14 | #14Ogpt-5.6-sol-xhigh | OpenAI | 1534 | 1527–1541 | 9,943 |
| 15 | #15claude-opus-5-high | Anthropic | 1533 | 1527–1540 | 15,559 |
| 16 | #16claude-opus-4-8-high | Anthropic | 1533 | 1527–1539 | 17,395 |
| 17 | #17muse-spark-1.1 | Meta | 1533 | 1526–1539 | 10,537 |
| 18 | #18muse-spark-1.2 (xHigh) | Meta | 1531 | 1514–1549 | 1,222 |
| 19 | #19claude-fable-5.1-max | Anthropic | 1531 | 1519–1544 | 2,358 |
| 20 | #20claude-opus-4-5-20251101-high-32k | Anthropic | 1530 | 1523–1538 | 7,793 |
| 21 | #21claude-opus-5-max | Anthropic | 1530 | 1522–1538 | 7,382 |
| 22 | #22gemini-3.8-flash-high | 1530 | 1522–1538 | 7,067 | |
| 23 | #23claude-opus-4-8 | Anthropic | 1530 | 1524–1535 | 18,024 |
| 24 | #24muse-spark | Meta | 1530 | 1520–1540 | 3,930 |
| 25 | #25claude-sonnet-4-6 | Anthropic | 1529 | 1523–1534 | 19,686 |
| 26 | #26deepseek-v4.1-flash-max | DeepSeek | 1528 | 1516–1540 | 2,469 |
| 27 | #27qwen3.7-max-preview | Alibaba | 1524 | 1506–1542 | 1,165 |
| 28 | #28qwen3.8-max | Alibaba | 1524 | 1516–1532 | 6,611 |
| 29 | #29Zglm-5.3-flash | Z.ai | 1523 | 1515–1532 | 6,157 |
| 30 | #30claude-opus-4-5-20251101 | Anthropic | 1523 | 1518–1528 | 17,962 |
| 31 | #31gemini-3.1-pro-preview | 1522 | 1517–1526 | 33,581 | |
| 32 | #32mimo-v2.5-pro | Xiaomi | 1522 | 1516–1527 | 19,324 |
| 33 | #33mimo-v2.6-flash | Xiaomi | 1521 | 1506–1537 | 1,508 |
| 34 | #34Zglm-5.3-max | Z.ai | 1521 | 1511–1530 | 4,424 |
| 35 | #35Ogpt-5.4-high | OpenAI | 1521 | 1515–1527 | 17,566 |
| 36 | #36Ogpt-6-sol-max | OpenAI | 1520 | 1507–1534 | 2,071 |
| 37 | #37claude-sonnet-4-5-20250929-high-32k | Anthropic | 1519 | 1514–1524 | 19,905 |
| 38 | #38gemini-3.6-flash-high | 1519 | 1512–1526 | 10,350 | |
| 39 | #39claude-sonnet-5-high | Anthropic | 1519 | 1512–1525 | 12,377 |
| 40 | #40Ogpt-5.5-high | OpenAI | 1519 | 1513–1524 | 19,110 |
| 41 | #41gemini-3.7-flash-high | 1518 | 1510–1526 | 6,041 | |
| 42 | #42gemini-3-pro | 1518 | 1511–1525 | 8,787 | |
| 43 | #43kimi-k2.6 | Moonshot AI | 1516 | 1509–1523 | 11,062 |
| 44 | #44Ogpt-5.6-terra-xhigh | OpenAI | 1515 | 1508–1522 | 10,166 |
| 45 | #45Ogpt-5.2-chat-latest-20260210 | OpenAI | 1515 | 1508–1522 | 9,629 |
| 46 | #46xgrok-4.5 | xAI | 1514 | 1507–1521 | 11,055 |
| 47 | #47dola-seed-2.0-pro | ByteDance | 1514 | 1509–1519 | 21,996 |
| 48 | #48qwen3.5-max-preview | Alibaba | 1514 | 1506–1522 | 6,358 |
| 49 | #49Ogpt-5.5-instant | OpenAI | 1513 | 1506–1521 | 7,909 |
| 50 | #50Zglm-5.1 | Z.ai | 1513 | 1507–1518 | 16,060 |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings