Valumigo

LMArena · AI 搜索

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: 通过比较使用网页搜索的 AI 系统的回答并投票得出的排名。涵盖包括最新信息问题在内的多种搜索相关请求。

如何解读分数: 这是用户更偏好的搜索回答的相对分数。请区分基础偏好分数与额外考虑事实准确性的 Factuality 校正指标。

注意事项: 请查看更新日期、搜索工具及运行条件。请勿将此分数解读为实际服务中所有搜索回答的准确率。

本次排名的解读要点

  • 第 1 名 gpt-5.6-sol-xhigh 与第 2 名 claude-opus-4-6-search 的 95% 置信区间重叠。仅凭本次统计难以确定两个模型的先后顺序。
  • 前 10 个模型中,Anthropic 的模型有 4 个,数量最多。
  • 第 1 名模型获得了 29,663 票,此排行榜包含 34 个模型。

AI 搜索 LMArena

发布日期:2026-08-24 · 获取日期:2026-10-04

114011701200123012601290
Ogpt-5.6-sol-xhigh
1257
Anthropicclaude-opus-4-6-search
1253
Ogpt-5.5-search
1242
Anthropicclaude-opus-4-7
1233
Anthropicclaude-fable-5
1230
Baiduernie-5.1
1227
Anthropicclaude-sonnet-4-6-search
1221
xgrok-4.5
1213
Googlegemini-3.1-pro-grounding
1210
Googlegemini-3-pro-grounding
1207
Ogpt-5.2-search
1207
Anthropicclaude-opus-4-8
1204
xgrok-4.20-multi-agent-beta-0309
1204
Ogpt-5.1-search
1199
Googlegemini-3-flash-grounding
1198
Ogpt-5.4-search
1197
Anthropicclaude-sonnet-5-search
1194
xgrok-4.20-beta1
1189
Anthropicclaude-opus-4-5-search
1180
Ogpt-5.2-search-non-reasoning
1172

圆点表示得分,横线表示 95% 置信区间。横线重叠意味着水平基本相近。 图表仅显示同一模型各推理设置(high、max 等)中排名最高的一项。表格列出所有设置各自的排名。

各公司最高排名

  • OOpenAIgpt-5.6-sol-xhigh#1
  • AnthropicAnthropicclaude-opus-4-6-search#2
  • BaiduBaiduernie-5.1#6
  • xxAIgrok-4.5#8
  • GoogleGooglegemini-3.1-pro-grounding#9
  • PerplexityPerplexityppl-sonar-reasoning-pro-high#29
  • DDiffbotdiffbot-small-xl#33
查看表格(前 50 名)
排名模型开发方分数95% 置信区间投票数
1#1Ogpt-5.6-sol-xhighOpenAI12571250–126529,663
2#2Anthropicclaude-opus-4-6-searchAnthropic12531248–1258134,699
3#3Ogpt-5.5-searchOpenAI12421237–124789,873
4#4Anthropicclaude-opus-4-7Anthropic12331228–123991,394
5#5Anthropicclaude-fable-5Anthropic12301222–123841,795
6#6Baiduernie-5.1Baidu12271217–12373,788
7#7Anthropicclaude-sonnet-4-6-searchAnthropic12211216–1226134,905
8#8xgrok-4.5xAI12131206–122031,505
9#9Googlegemini-3.1-pro-groundingGoogle12101205–1216113,282
10#10Googlegemini-3-pro-groundingGoogle12071202–121337,024
11#11Ogpt-5.2-searchOpenAI12071201–121352,712
12#12Anthropicclaude-opus-4-8Anthropic12041198–121170,998
13#13xgrok-4.20-multi-agent-beta-0309xAI12041199–1209109,553
14#14Ogpt-5.1-searchOpenAI11991194–120559,909
15#15Googlegemini-3-flash-groundingGoogle11981193–1203149,334
16#16Ogpt-5.4-searchOpenAI11971192–1203110,116
17#17Anthropicclaude-sonnet-5-searchAnthropic11941187–120140,230
18#18xgrok-4.20-beta1xAI11891183–119553,921
19#19Anthropicclaude-opus-4-5-searchAnthropic11801174–118561,573
20#20Ogpt-5.2-search-non-reasoningOpenAI11721167–117875,658
21#21xgrok-4-1-fast-searchxAI11711166–117681,507
22#22xgrok-4-fast-searchxAI11711166–117541,794
23#23xgrok-4.3xAI11651160–117091,483
24#24Anthropicclaude-sonnet-4-5-searchAnthropic11581153–1163127,378
25#25Anthropicclaude-opus-4-1-searchAnthropic11481143–115376,933
26#26Oo3-searchOpenAI11441139–115020,644
27#27Googlegemini-2.5-pro-groundingGoogle11421137–114683,404
28#28xgrok-4-searchxAI11421136–114719,108
29#29Perplexityppl-sonar-reasoning-pro-highPerplexity11391133–114429,055
30#30Ogpt-5-searchOpenAI11331127–113920,781
31#31Perplexityppl-sonar-pro-highPerplexity11301124–113628,519
32#32Anthropicclaude-opus-4-searchAnthropic11261121–113231,037
33#33Ddiffbot-small-xlDiffbot10231014–10316,388
34#34Oapi-gpt-4o-searchOpenAI1006995–10173,411

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings