Valumigo

LMArena · Comprensión de documentos

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Esta clasificación de LMArena recoge votos que comparan las respuestas de dos modelos a preguntas sobre documentos subidos (PDF, etc.).

Cómo interpretar la puntuación: Es una puntuación relativa estimada mediante el método Bradley–Terry. Si el intervalo de confianza del 95% es amplio, interprete con cautela las diferencias de posición.

Precauciones: El intervalo entre publicaciones puede ser mayor que en otras clasificaciones, así que consulte la fecha de publicación. Los resultados pueden variar según el tipo y el idioma del documento.

Claves para interpretar esta clasificación

  • Los intervalos de confianza del 95% de claude-opus-5-high, en 1.º lugar, y claude-fable-5.1-max, en 2.º, se solapan. Esta agregación por sí sola no permite establecer con certeza el orden de ambos modelos.
  • Hay otros 3 modelos cuyos intervalos de confianza se solapan con el del 1.º. Interpreta con cautela las diferencias pequeñas de posición, teniendo en cuenta el número de votos.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 7 modelos.
  • El modelo en 1.º lugar recibió 8,794 votos y esta clasificación incluye 44 modelos.

Comprensión de documentos LMArena

Publicado el 2026-09-13 · Obtenido el 2026-10-04

1440147015001530
Anthropicclaude-opus-5-high
1516
Anthropicclaude-fable-5.1-max
1513
Anthropicclaude-opus-4-6-high
1507
Anthropicclaude-fable-5
1496
Anthropicclaude-opus-4-7
1495
Ogpt-5.5
1486
Ogpt-5.6-sol-xhigh
1483
Anthropicclaude-sonnet-4-6
1482
Anthropicclaude-opus-4-8-high
1475
Ogpt-5.6-terra-xhigh
1472
Ogpt-5.4
1471
Metamuse-spark-1.3-max
1471
Ogpt-6-astra-max
1468
Anthropicclaude-sonnet-5-high
1466
Metamuse-spark-1.1
1465
Googlegemini-3.5-flash-medium
1463
Anthropicclaude-opus-4-5-20251101
1462
Ogpt-5.6-luna-xhigh
1457
Googlegemini-3.6-flash-high
1456
xgrok-4.6-high
1452

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones.

Mejor posición por empresa

  • AnthropicAnthropicclaude-opus-5-high#1
  • OOpenAIgpt-5.5#8
  • MetaMetamuse-spark-1.3-max#15
  • GoogleGooglegemini-3.5-flash-medium#20
  • xxAIgrok-4.6-high#25
  • Moonshot AIMoonshot AIkimi-k2.6#27
  • AlibabaAlibabaqwen3.7-plus#30
  • MiniMaxMiniMaxminimax-m3#32
  • ZZ.aiglm-5v-turbo#39
Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1#1Anthropicclaude-opus-5-highAnthropic15161509–15238,794
2#2Anthropicclaude-fable-5.1-maxAnthropic15131497–15281,403
3#3Anthropicclaude-opus-4-6-highAnthropic15071501–151427,929
4#4Anthropicclaude-opus-4-6Anthropic15071501–151341,260
5#5Anthropicclaude-fable-5Anthropic14961488–15048,497
6#6Anthropicclaude-opus-4-7Anthropic14951489–150122,192
7#7Anthropicclaude-opus-4-7-highAnthropic14951488–150121,957
8#8Ogpt-5.5OpenAI14861479–149221,279
9#9Ogpt-5.5-highOpenAI14841478–149120,944
10#10Ogpt-5.6-sol-xhighOpenAI14831474–14924,818
11#11Anthropicclaude-sonnet-4-6Anthropic14821476–148857,813
12#12Anthropicclaude-opus-4-8-highAnthropic14751468–148211,551
13#13Ogpt-5.6-terra-xhighOpenAI14721463–14805,787
14#14Ogpt-5.4OpenAI14711465–147733,331
15#15Metamuse-spark-1.3-maxMeta14711452–14891,006
16#16Ogpt-6-astra-maxOpenAI14681453–14821,621
17#17Anthropicclaude-sonnet-5-highAnthropic14661458–14747,411
18#18Metamuse-spark-1.1Meta14651456–14744,885
19#19Anthropicclaude-opus-4-8Anthropic14641457–147112,128
20#20Googlegemini-3.5-flash-mediumGoogle14631455–14716,500
21#21Anthropicclaude-opus-4-5-20251101Anthropic14621452–14737,981
22#22Googlegemini-3.5-flash-highGoogle14611452–14714,061
23#23Ogpt-5.6-luna-xhighOpenAI14571449–14655,766
24#24Googlegemini-3.6-flash-highGoogle14561445–14672,975
25#25xgrok-4.6-highxAI14521440–14642,258
26#26xgrok-4.5xAI14521443–14614,965
27#27Moonshot AIkimi-k2.6Moonshot AI14511443–145811,291
28#28Anthropicclaude-sonnet-4-5-20250929Anthropic14501444–145631,455
29#29Metamuse-sparkMeta14441426–14621,084
30#30Alibabaqwen3.7-plusAlibaba14441435–14534,591
31#31Googlegemini-3.1-pro-previewGoogle14441439–144949,457
32#32MiniMaxminimax-m3MiniMax14351427–14436,314
33#33Googlegemini-3-proGoogle14341425–144310,769
34#34Moonshot AIkimi-k2.5-thinkingMoonshot AI14301423–143721,569
35#35Googlegemma-4-31bGoogle14251417–143212,326
36#36Googlegemini-2.5-proGoogle14211415–142725,110
37#37Anthropicclaude-haiku-4-5-20251001Anthropic14201414–142634,677
38#38xgrok-4.20-beta-0309-reasoningxAI14161409–142320,948
39#39Zglm-5v-turboZ.ai14161407–14246,995
40#40Googlegemini-3-flashGoogle14131404–14227,158
41#41Ogpt-5.2-highOpenAI14051395–14147,108
42#42Ogpt-5.1OpenAI14031394–14138,244
43#43Ogpt-5.5-instantOpenAI14031395–14118,497
44#44Ogpt-5.2OpenAI14011395–140728,212

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings