Valumigo

LMArena · 智能体综合

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: 该排名基于 LMArena 的 Agent Arena 中,用户以智能体模式委托实际工作(软件开发、财务分析等)的记录。智能体直接使用 bash、网页搜索、文件操作等工具。

如何解读分数: 分数采用名为 IPS(τ̂) 的因果估计值,以 0 为基线,越高表示使用该模型后结果改善越多。它综合了五种信号:用户确认成功、表扬与不满、落实修改指令、从 bash 错误中恢复,以及避免工具幻觉。

注意事项: 其评分尺度与对话排名(Bradley–Terry 方法)不同,无法直接比较。观测数较少的模型,置信区间较宽。

本次排名的解读要点

  • 第 1 名 Claude Fable 5.1 (Max) 与第 2 名 Claude Opus 5.5 (High) 的 95% 置信区间重叠。仅凭本次统计难以确定两个模型的先后顺序。
  • 还有 4 个模型的置信区间与第 1 名重叠。解读细微排名差异时,请结合投票数量保持谨慎。
  • 前 10 个模型中,Anthropic 的模型有 6 个,数量最多。
  • 排名第 1 的模型有 1,683,381 条观测记录,此榜单包含 50 个模型。

智能体综合 LMArena

发布日期:2026-10-02 · 获取日期:2026-10-04

00.040.080.120.160.2
AnthropicClaude Fable 5.1 (Max)
0.143
AnthropicClaude Opus 5.5 (High)
0.138
AnthropicClaude Sonnet 5.5 (Max)
0.125
OGPT 6 Astra (Max)
0.123
OGPT 6.1 Sol (Max)
0.112
OGPT 6 Sol (Max)
0.097
AnthropicClaude Opus 5 (High)
0.087
AnthropicClaude Fable 5 (High)
0.082
GoogleGemini 4 Argon (High)
0.076
AnthropicClaude Opus 4.8 (High)
0.066
OGPT 5.6 Sol (xHigh)
0.065
AnthropicClaude Sonnet 5 (High)
0.044
Moonshot AIKimi K3 (Max)
0.042
OGPT 5.5 (xHigh)
0.042
xGrok 4.7 (xHigh)
0.04
DeepSeekDeepseek V4.1 Flash (Max)
0.04
MetaMuse Spark 1.3 (Max)
0.04
THy4 preview
0.04
ZGLM 5.2 (Max)
0.035
GoogleGemini 3.8 Flash (High)
0.03

分数采用 IPS(τ̂),以 0 为基线,越高越好。线段表示 95% 置信区间。 图表仅显示同一模型各推理设置(high、max 等)中排名最高的一项。表格列出所有设置各自的排名。

各公司最高排名

  • AnthropicAnthropicClaude Fable 5.1 (Max)#1
  • OOpenAIGPT 6 Astra (Max)#4
  • GoogleGoogleGemini 4 Argon (High)#10
  • Moonshot AIMoonshot AIKimi K3 (Max)#14
  • xxAIGrok 4.7 (xHigh)#16
  • DeepSeekDeepSeekDeepseek V4.1 Flash (Max)#17
  • MetaMetaMuse Spark 1.3 (Max)#18
  • TTencentHy4 preview#19
  • ZZ.aiGLM 5.2 (Max)#20
查看表格(前 50 名)
排名模型开发方分数95% 置信区间观测数
1#1AnthropicClaude Fable 5.1 (Max)Anthropic0.1430.124–0.1621,683,381
2#2AnthropicClaude Opus 5.5 (High)Anthropic0.1380.116–0.16754,031
3#3AnthropicClaude Sonnet 5.5 (Max)Anthropic0.1250.094–0.156483,211
4#4OGPT 6 Astra (Max)OpenAI0.1230.1–0.145888,641
5#5OGPT 6.1 Sol (Max)OpenAI0.1120.085–0.14379,372
6#6OGPT 6 Sol (Max)OpenAI0.0970.073–0.121994,367
7#7AnthropicClaude Opus 5 (High)Anthropic0.0870.073–0.1013,531,760
8#8AnthropicClaude Fable 5 (High)Anthropic0.0820.07–0.0942,603,067
9#9AnthropicClaude Opus 5 (Max)Anthropic0.0790.064–0.0943,006,257
10#10GoogleGemini 4 Argon (High)Google0.0760.056–0.095587,353
11#11AnthropicClaude Opus 4.8 (High)Anthropic0.0660.053–0.082,431,185
12#12OGPT 5.6 Sol (xHigh)OpenAI0.0650.052–0.0774,348,715
13#13AnthropicClaude Sonnet 5 (High)Anthropic0.0440.028–0.063,612,898
14#14Moonshot AIKimi K3 (Max)Moonshot AI0.0420.036–0.04712,305,667
15#15OGPT 5.5 (xHigh)OpenAI0.0420.031–0.0523,060,353
16#16xGrok 4.7 (xHigh)xAI0.040.024–0.0561,656,641
17#17DeepSeekDeepseek V4.1 Flash (Max)DeepSeek0.040.036–0.04516,932,092
18#18MetaMuse Spark 1.3 (Max)Meta0.040.034–0.0466,139,426
19#19THy4 previewTencent0.040.032–0.0475,108,255
20#20ZGLM 5.2 (Max)Z.ai0.0350.028–0.0426,684,620
21#21GoogleGemini 3.8 Flash (High)Google0.030.021–0.0384,279,699
22#22AlibabaQwen3.8 MaxAlibaba0.0250.019–0.0314,577,924
23#23ZGLM 5.3 (Max)Z.ai0.0240.017–0.039,155,315
24#24OGPT 6 Luna (Max)OpenAI0.0140.003–0.0243,443,780
25#25xGrok 4.6 (xHigh)xAI0.0130.003–0.0233,131,725
26#26xGrok 4.5xAI0.0120.002–0.0222,418,629
27#27DeepSeekDeepSeek V4 Pro (High) (0813)DeepSeek0.012-0.005–0.028797,284
28#28OGPT 5.4 (High)OpenAI0.0110.001–0.024,332,904
29#29OGPT 5.5OpenAI0.010.001–0.022,659,460
30#30SStep 5 PreviewStepFun0.005-0.01–0.021,125,598
31#31OGPT 5.6 Terra (xHigh)OpenAI0.004-0.008–0.0161,686,712
32#32ZGLM 5.3 FlashZ.ai-0.004-0.009–09,533,773
33#33XiaomiMiMo V2.6 FlashXiaomi-0.006-0.019–0.0071,562,757
34#34AlibabaQwen3.8 Flash NextAlibaba-0.007-0.014–-0.00111,249,221
35#35OGPT 5.6 Luna (xHigh)OpenAI-0.012-0.018–-0.0054,028,029
36#36GoogleGemini 3.7 Flash (High)Google-0.015-0.022–-0.0075,048,920
37#37AlibabaQwen 3.8 27BAlibaba-0.017-0.023–-0.0116,972,838
38#38MetaMuse Spark 1.2 (xHigh)Meta-0.033-0.039–-0.0262,884,900
39#39MetaMuse Spark 1.1Meta-0.049-0.053–-0.0447,612,456
40#40AlibabaQwen3.7 MaxAlibaba-0.051-0.061–-0.0422,207,521
41#41THy3Tencent-0.054-0.066–-0.0421,171,568
42#42MiniMaxMinimax M3MiniMax-0.069-0.078–-0.063,338,791
43#43AlibabaQwen3.7 PlusAlibaba-0.072-0.086–-0.0571,144,063
44#44XiaomiMimo V2.5 ProXiaomi-0.075-0.084–-0.0662,309,389
45#45GoogleGemini 3.6 Flash (High)Google-0.077-0.087–-0.0661,523,777
46#46GoogleGemini 3.1 Pro PreviewGoogle-0.077-0.087–-0.0673,446,977
47#47TInkling SmallThinky-0.103-0.117–-0.089503,653
48#48TInklingThinky-0.109-0.119–-0.0981,798,990
49#49Mistral AIMistral Medium 3.5Mistral AI-0.124-0.139–-0.109437,621
50#50USolar Pro 4Upstage-0.159-0.178–-0.141427,705

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings