Valumigo

AI 基准测试排名

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

最新模型一览

汇总最近 120 天内发布的模型,按发布日期排序,在同一行展示两个公开来源的分数。分数为正确率(%)。

模型发布日期综合指数GPQA DiamondFrontierMathHLEARC-AGI-2SWE-bench VerifiedLMArena 综合排名LMArena 中文 排名
OGPT-6.1 SolOpenAI2026-09-29–95.493.7–––#21#59
AnthropicClaude Sonnet 5.5Anthropic2026-09-28165.295.688.8–––#45#16
AnthropicClaude Opus 5.5Anthropic2026-09-22167.4–91.2–92.5–#4#2
OGPT-6 SolOpenAI2026-09-22–94.389.8–89.6–#64#94
OGPT-6 LunaOpenAI2026-09-22––78.9–59.3–#90#84
DeepSeekDeepSeek V4.1 FlashDeepSeek2026-09-09155–––––#38#29
OGPT-6 AstraOpenAI2026-09-03166.595.893.754.895–#29#43
GoogleGemini 3.8 FlashGoogle2026-09-02156.995.468.444.5––#8#14
MetaMuse Spark 1.3Meta2026-09-02156.9–74.4–––#9#18
AnthropicClaude Fable 5.1Anthropic2026-09-01164.8–90.246.590–#6#3
AlibabaQwen3.8 Max (0902)Alibaba2026-09-01155.292.365.6–––暂无暂无
ZGLM-5.3-FlashZ.ai2026-08-20151.9–––––#41#21
ZGLM-5.3Z.ai2026-08-14155.890.968.8–––#27#19
AlibabaQwen 3.8 27BAlibaba2026-08-14149.4–––––#99#58
GoogleGemini 3.7 FlashGoogle2026-08-13157.494.871.6–84.6–#17#8
DeepSeekDeepSeek V4 Pro 0813DeepSeek2026-08-13155.491.7––61.3–暂无暂无

新模型需积累足够的投票才能上榜,尤其是分语言榜单。刚发布时可能显示“暂无”。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

中文 LMArena

发布日期:2026-10-02 · 获取日期:2026-10-04

14801520156016001640
Googlegemini-4-argon-high
1587
Anthropicclaude-opus-5.5-high
1571
Anthropicclaude-fable-5.1-max
1570
Anthropicclaude-fable-5-high
1555
Anthropicclaude-opus-4-6-high
1551
Anthropicclaude-opus-5-max
1548
Googlegemini-3.7-flash-high
1546
Moonshot AIkimi-k3-max
1540
Alibabaqwen3.8-max
1538
Ogpt-5.6-sol-xhigh
1538
Anthropicclaude-opus-4-7-high
1537
Googlegemini-3.8-flash-high
1536
Anthropicclaude-sonnet-5.5-xhigh
1533
Metamuse-spark-1.1
1531
Metamuse-spark-1.3-max
1531
Zglm-5.3-max
1531
Googlegemini-3.6-flash-high
1530
Zglm-5.3-flash
1529
Googlegemini-3.1-pro-preview
1529
Metamuse-spark-1.2 (xHigh)
1528

圆点表示得分,横线表示 95% 置信区间。横线重叠意味着水平基本相近。 图表仅显示同一模型各推理设置(high、max 等)中排名最高的一项。表格列出所有设置各自的排名。 对话与视觉排名采用与 LMArena 网站默认设置相同的“语气与长度校正(style control)”排名。

各公司最高排名

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-opus-5.5-high#2
  • Moonshot AIMoonshot AIkimi-k3-max#10
  • AlibabaAlibabaqwen3.8-max#11
  • OOpenAIgpt-5.6-sol-xhigh#12
  • MetaMetamuse-spark-1.1#17
  • ZZ.aiglm-5.3-max#19
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#29
  • XiaomiXiaomimimo-v2.5-pro#39
查看表格(前 50 名)
排名模型开发方分数95% 置信区间投票数
1#1Googlegemini-4-argon-highGoogle15871555–1619352
2#2Anthropicclaude-opus-5.5-highAnthropic15711542–1601402
3#3Anthropicclaude-fable-5.1-maxAnthropic15701549–1591874
4#4Anthropicclaude-fable-5-highAnthropic15551544–15672,852
5#5Anthropicclaude-opus-4-6-highAnthropic15511542–15605,342
6#6Anthropicclaude-opus-5-maxAnthropic15481535–15622,274
7#7Anthropicclaude-opus-5-highAnthropic15481538–15584,718
8#8Googlegemini-3.7-flash-highGoogle15461532–15611,681
9#9Anthropicclaude-opus-4-6Anthropic15441535–15535,582
10#10Moonshot AIkimi-k3-maxMoonshot AI15401527–15542,051
11#11Alibabaqwen3.8-maxAlibaba15381523–15531,712
12#12Ogpt-5.6-sol-xhighOpenAI15381526–15502,823
13#13Anthropicclaude-opus-4-7-highAnthropic15371528–15474,149
14#14Googlegemini-3.8-flash-highGoogle15361522–15502,061
15#15Anthropicclaude-opus-4-7Anthropic15341524–15444,133
16#16Anthropicclaude-sonnet-5.5-xhighAnthropic15331497–1568244
17#17Metamuse-spark-1.1Meta15311519–15422,943
18#18Metamuse-spark-1.3-maxMeta15311511–1550939
19#19Zglm-5.3-maxZ.ai15311514–15471,328
20#20Googlegemini-3.6-flash-highGoogle15301518–15422,712
21#21Zglm-5.3-flashZ.ai15291513–15441,648
22#22Googlegemini-3.1-pro-previewGoogle15291521–15368,287
23#23Metamuse-spark-1.2 (xHigh)Meta15281497–1559382
24#24Alibabaqwen3.7-max-previewAlibaba15271491–1562309
25#25Ogpt-5.5OpenAI15261517–15364,451
26#26Anthropicclaude-opus-4-8Anthropic15261516–15364,394
27#27Anthropicclaude-opus-4-8-highAnthropic15261516–15354,356
28#28Metamuse-sparkMeta15251505–1545965
29#29DeepSeekdeepseek-v4.1-flash-maxDeepSeek15231500–1546672
30#30Zglm-5.2-maxZ.ai15201510–15313,261
31#31Googlegemini-3-proGoogle15201510–15313,444
32#32Googlegemini-3.5-flash-mediumGoogle15171507–15283,451
33#33Ogpt-5.5-highOpenAI15171507–15274,469
34#34Alibabaqwen3.5-max-previewAlibaba15161501–15321,575
35#35Ogpt-5.6-terra-xhighOpenAI15161505–15282,949
36#36Googlegemini-3-flashGoogle15161504–15292,466
37#37Zglm-5Z.ai15161503–15302,001
38#38Moonshot AIkimi-k2.6Moonshot AI15161503–15292,326
39#39Xiaomimimo-v2.5-proXiaomi15151505–15244,455
40#40Googlegemini-3.5-flash-highGoogle15151504–15253,640
41#41Zglm-5.1Z.ai15141504–15244,041
42#42Xiaomimimo-v2.6-proXiaomi15111478–1543297
43#43Ogpt-6-astra-maxOpenAI15101488–1532674
44#44xgrok-4.20-beta1xAI15101495–15251,726
45#45Thy3Tencent15091489–1530779
46#46Anthropicclaude-sonnet-4-6Anthropic15091500–15194,501
47#47xgrok-4.7-xhighxAI15071482–1532531
48#48Ogpt-5.4-highOpenAI15071497–15174,132
49#49Ogpt-5.5-instantOpenAI15061490–15211,693
50#50xgrok-4.5xAI15041493–15163,061

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings