Valumigo

LMArena · Comprensión de imágenes (visión)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Es una clasificación de comprensión de imágenes basada en votos que comparan las respuestas de dos modelos a preguntas que incluyen imágenes.

Cómo interpretar la puntuación: Es una puntuación relativa de las respuestas preferidas por los usuarios. No es una tasa objetiva de aciertos al interpretar fotografías, gráficos o capturas de pantalla.

Precauciones: Comprueba por separado la precisión en las condiciones que necesitas, como leer texto pequeño en documentos o reconocer caracteres coreanos (Hangul).

Claves para interpretar esta clasificación

  • Los intervalos de confianza del 95% de claude-fable-5-high, en 1.º lugar, y qwen3.8-max, en 2.º, se solapan. Esta agregación por sí sola no permite establecer con certeza el orden de ambos modelos.
  • Hay otros 11 modelos cuyos intervalos de confianza se solapan con el del 1.º. Interpreta con cautela las diferencias pequeñas de posición, teniendo en cuenta el número de votos.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 5 modelos.
  • El modelo en 1.º lugar recibió 13,709 votos y esta clasificación incluye 50 modelos.

Comprensión de imágenes (visión) LMArena

Publicado el 2026-10-02 · Obtenido el 2026-10-04

1260128013001320
Anthropicclaude-fable-5-high
1309
Alibabaqwen3.8-max
1301
Anthropicclaude-opus-4-6-high
1299
Anthropicclaude-opus-4-7
1298
Googlegemini-3.7-flash-high
1296
Metamuse-spark
1294
Metamuse-spark-1.2 (xHigh)
1293
Ogpt-6.1-sol-max
1291
Googlegemini-3.8-flash-high
1290
Metamuse-spark-1.3-max
1290
Googlegemini-3-pro
1289
Anthropicclaude-opus-5-high
1289
Anthropicclaude-fable-5.1-max
1288
Ogpt-5.5
1287
Anthropicclaude-opus-4-8-high
1286
Ogpt-5.6-sol-xhigh
1285
Googlegemini-3.5-flash-medium
1284
Ogpt-6-astra-max
1284
Ogpt-5.4-high
1284
Metamuse-spark-1.1
1281

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones. Las clasificaciones de conversación y visión usan el ajuste de tono y longitud (style control), igual que la opción predeterminada del sitio de LMArena.

Mejor posición por empresa

  • AnthropicAnthropicclaude-fable-5-high#1
  • AlibabaAlibabaqwen3.8-max#2
  • GoogleGooglegemini-3.7-flash-high#6
  • MetaMetamuse-spark#8
  • OOpenAIgpt-6.1-sol-max#10
  • xxAIgrok-4.5#28
  • ZZ.aiglm-5.3-flash#30
  • Moonshot AIMoonshot AIkimi-k2.6#38
  • SStepFunStep 5 Preview#45
Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1#1Anthropicclaude-fable-5-highAnthropic13091301–131613,709
2#2Alibabaqwen3.8-maxAlibaba13011294–130910,040
3#3Anthropicclaude-opus-4-6-highAnthropic12991293–130622,328
4#4Anthropicclaude-opus-4-7Anthropic12981292–130523,169
5#5Anthropicclaude-opus-4-7-highAnthropic12981291–130422,755
6#6Googlegemini-3.7-flash-highGoogle12961286–13063,814
7#7Anthropicclaude-opus-4-6Anthropic12941288–130126,869
8#8Metamuse-sparkMeta12941284–13035,868
9#9Metamuse-spark-1.2 (xHigh)Meta12931279–13071,951
10#10Ogpt-6.1-sol-maxOpenAI12911275–13071,408
11#11Googlegemini-3.8-flash-highGoogle12901279–13023,086
12#12Metamuse-spark-1.3-maxMeta12901280–13013,843
13#13Googlegemini-3-proGoogle12891282–129713,620
14#14Anthropicclaude-opus-5-highAnthropic12891282–129615,900
15#15Anthropicclaude-fable-5.1-maxAnthropic12881278–12984,312
16#16Ogpt-5.5OpenAI12871281–129227,223
17#17Anthropicclaude-opus-4-8-highAnthropic12861280–129318,350
18#18Ogpt-5.6-sol-xhighOpenAI12851277–129210,421
19#19Googlegemini-3.5-flash-mediumGoogle12841277–129112,467
20#20Ogpt-6-astra-maxOpenAI12841273–12963,175
21#21Googlegemini-3.5-flash-highGoogle12841277–129112,336
22#22Ogpt-5.4-highOpenAI12841278–129029,177
23#23Metamuse-spark-1.1Meta12811274–128811,255
24#24Ogpt-5.5-highOpenAI12811275–128725,488
25#25Googlegemini-3.6-flash-highGoogle12801271–12887,392
26#26Anthropicclaude-opus-4-8Anthropic12791273–128618,857
27#27Googlegemini-3.1-pro-previewGoogle12791274–128545,558
28#28xgrok-4.5xAI12791272–128611,039
29#29Ogpt-5.4OpenAI12791272–128522,828
30#30Zglm-5.3-flashZ.ai12781269–12885,479
31#31Ogpt-5.2-chat-latest-20260210OpenAI12781271–128516,480
32#32Ogpt-5.5-instantOpenAI12761267–12857,605
33#33Anthropicclaude-sonnet-4-6Anthropic12751269–128127,429
34#34Googlegemini-3-flashGoogle12731268–127839,142
35#35Anthropicclaude-sonnet-5.5-xhighAnthropic12681253–12841,608
36#36Ogpt-5.6-terra-xhighOpenAI12681261–127610,292
37#37Alibabaqwen3.7-plusAlibaba12651259–127213,065
38#38Moonshot AIkimi-k2.6Moonshot AI12651258–127216,387
39#39Anthropicclaude-sonnet-5-highAnthropic12641257–127113,029
40#40Googlegemini-3.5-flash-liteGoogle12641256–12737,579
41#41xgrok-4.6-highxAI12631254–12735,736
42#42Googlegemma-4-31bGoogle12621256–126839,111
43#43Googlegemini-3-flash (thinking-minimal)Google12601254–126537,184
44#44Ogpt-5.6-luna-xhighOpenAI12601252–126710,446
45#45SStep 5 PreviewStepFun12601235–1284604
46#46ByteDancedola-seed-2.0-proByteDance12571249–126410,981
47#47xgrok-4.20-beta-0309-reasoningxAI12551249–126226,832
48#48Moonshot AIkimi-k2.5-thinkingMoonshot AI12521246–125828,326
49#49Ogpt-5.1-highOpenAI12511244–12599,842
50#50Ogpt-5.4-mini-highOpenAI12511244–125725,734

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings