Valumigo

LMArena · 图像理解(视觉)

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: 通过比较两个模型对包含图片的问题的回答并投票得出的图像理解排名。

如何解读分数: 这是用户更偏好的回答的相对分数,并非解读照片、图表或截图的客观正确率。

注意事项: 文档小字或 Korean (Hangul) 字符识别等所需条件下的准确率需另行确认。

本次排名的解读要点

  • 第 1 名 claude-fable-5-high 与第 2 名 qwen3.8-max 的 95% 置信区间重叠。仅凭本次统计难以确定两个模型的先后顺序。
  • 还有 11 个模型的置信区间与第 1 名重叠。解读细微排名差异时,请结合投票数量保持谨慎。
  • 前 10 个模型中,Anthropic 的模型有 5 个,数量最多。
  • 第 1 名模型获得了 13,709 票,此排行榜包含 50 个模型。

图像理解(视觉) LMArena

发布日期:2026-10-02 · 获取日期:2026-10-04

1260128013001320
Anthropicclaude-fable-5-high
1309
Alibabaqwen3.8-max
1301
Anthropicclaude-opus-4-6-high
1299
Anthropicclaude-opus-4-7
1298
Googlegemini-3.7-flash-high
1296
Metamuse-spark
1294
Metamuse-spark-1.2 (xHigh)
1293
Ogpt-6.1-sol-max
1291
Googlegemini-3.8-flash-high
1290
Metamuse-spark-1.3-max
1290
Googlegemini-3-pro
1289
Anthropicclaude-opus-5-high
1289
Anthropicclaude-fable-5.1-max
1288
Ogpt-5.5
1287
Anthropicclaude-opus-4-8-high
1286
Ogpt-5.6-sol-xhigh
1285
Googlegemini-3.5-flash-medium
1284
Ogpt-6-astra-max
1284
Ogpt-5.4-high
1284
Metamuse-spark-1.1
1281

圆点表示得分,横线表示 95% 置信区间。横线重叠意味着水平基本相近。 图表仅显示同一模型各推理设置(high、max 等)中排名最高的一项。表格列出所有设置各自的排名。 对话与视觉排名采用与 LMArena 网站默认设置相同的“语气与长度校正(style control)”排名。

各公司最高排名

  • AnthropicAnthropicclaude-fable-5-high#1
  • AlibabaAlibabaqwen3.8-max#2
  • GoogleGooglegemini-3.7-flash-high#6
  • MetaMetamuse-spark#8
  • OOpenAIgpt-6.1-sol-max#10
  • xxAIgrok-4.5#28
  • ZZ.aiglm-5.3-flash#30
  • Moonshot AIMoonshot AIkimi-k2.6#38
  • SStepFunStep 5 Preview#45
查看表格(前 50 名)
排名模型开发方分数95% 置信区间投票数
1#1Anthropicclaude-fable-5-highAnthropic13091301–131613,709
2#2Alibabaqwen3.8-maxAlibaba13011294–130910,040
3#3Anthropicclaude-opus-4-6-highAnthropic12991293–130622,328
4#4Anthropicclaude-opus-4-7Anthropic12981292–130523,169
5#5Anthropicclaude-opus-4-7-highAnthropic12981291–130422,755
6#6Googlegemini-3.7-flash-highGoogle12961286–13063,814
7#7Anthropicclaude-opus-4-6Anthropic12941288–130126,869
8#8Metamuse-sparkMeta12941284–13035,868
9#9Metamuse-spark-1.2 (xHigh)Meta12931279–13071,951
10#10Ogpt-6.1-sol-maxOpenAI12911275–13071,408
11#11Googlegemini-3.8-flash-highGoogle12901279–13023,086
12#12Metamuse-spark-1.3-maxMeta12901280–13013,843
13#13Googlegemini-3-proGoogle12891282–129713,620
14#14Anthropicclaude-opus-5-highAnthropic12891282–129615,900
15#15Anthropicclaude-fable-5.1-maxAnthropic12881278–12984,312
16#16Ogpt-5.5OpenAI12871281–129227,223
17#17Anthropicclaude-opus-4-8-highAnthropic12861280–129318,350
18#18Ogpt-5.6-sol-xhighOpenAI12851277–129210,421
19#19Googlegemini-3.5-flash-mediumGoogle12841277–129112,467
20#20Ogpt-6-astra-maxOpenAI12841273–12963,175
21#21Googlegemini-3.5-flash-highGoogle12841277–129112,336
22#22Ogpt-5.4-highOpenAI12841278–129029,177
23#23Metamuse-spark-1.1Meta12811274–128811,255
24#24Ogpt-5.5-highOpenAI12811275–128725,488
25#25Googlegemini-3.6-flash-highGoogle12801271–12887,392
26#26Anthropicclaude-opus-4-8Anthropic12791273–128618,857
27#27Googlegemini-3.1-pro-previewGoogle12791274–128545,558
28#28xgrok-4.5xAI12791272–128611,039
29#29Ogpt-5.4OpenAI12791272–128522,828
30#30Zglm-5.3-flashZ.ai12781269–12885,479
31#31Ogpt-5.2-chat-latest-20260210OpenAI12781271–128516,480
32#32Ogpt-5.5-instantOpenAI12761267–12857,605
33#33Anthropicclaude-sonnet-4-6Anthropic12751269–128127,429
34#34Googlegemini-3-flashGoogle12731268–127839,142
35#35Anthropicclaude-sonnet-5.5-xhighAnthropic12681253–12841,608
36#36Ogpt-5.6-terra-xhighOpenAI12681261–127610,292
37#37Alibabaqwen3.7-plusAlibaba12651259–127213,065
38#38Moonshot AIkimi-k2.6Moonshot AI12651258–127216,387
39#39Anthropicclaude-sonnet-5-highAnthropic12641257–127113,029
40#40Googlegemini-3.5-flash-liteGoogle12641256–12737,579
41#41xgrok-4.6-highxAI12631254–12735,736
42#42Googlegemma-4-31bGoogle12621256–126839,111
43#43Googlegemini-3-flash (thinking-minimal)Google12601254–126537,184
44#44Ogpt-5.6-luna-xhighOpenAI12601252–126710,446
45#45SStep 5 PreviewStepFun12601235–1284604
46#46ByteDancedola-seed-2.0-proByteDance12571249–126410,981
47#47xgrok-4.20-beta-0309-reasoningxAI12551249–126226,832
48#48Moonshot AIkimi-k2.5-thinkingMoonshot AI12521246–125828,326
49#49Ogpt-5.1-highOpenAI12511244–12599,842
50#50Ogpt-5.4-mini-highOpenAI12511244–125725,734

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings