LMArena · Comprensión de documentos
Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.
Cómo interpretar esta clasificación
Qué mide: Esta clasificación de LMArena recoge votos que comparan las respuestas de dos modelos a preguntas sobre documentos subidos (PDF, etc.).
Cómo interpretar la puntuación: Es una puntuación relativa estimada mediante el método Bradley–Terry. Si el intervalo de confianza del 95% es amplio, interprete con cautela las diferencias de posición.
Precauciones: El intervalo entre publicaciones puede ser mayor que en otras clasificaciones, así que consulte la fecha de publicación. Los resultados pueden variar según el tipo y el idioma del documento.
Claves para interpretar esta clasificación
- Los intervalos de confianza del 95% de claude-opus-5-high, en 1.º lugar, y claude-fable-5.1-max, en 2.º, se solapan. Esta agregación por sí sola no permite establecer con certeza el orden de ambos modelos.
- Hay otros 3 modelos cuyos intervalos de confianza se solapan con el del 1.º. Interpreta con cautela las diferencias pequeñas de posición, teniendo en cuenta el número de votos.
- Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 7 modelos.
- El modelo en 1.º lugar recibió 8,794 votos y esta clasificación incluye 44 modelos.
Comprensión de documentos LMArena
Publicado el 2026-09-13 · Obtenido el 2026-10-04
Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones.
Mejor posición por empresa
- Anthropicclaude-opus-5-high#1
- OOpenAIgpt-5.5#8
- Metamuse-spark-1.3-max#15
- Googlegemini-3.5-flash-medium#20
- xxAIgrok-4.6-high#25
- Moonshot AIkimi-k2.6#27
- Alibabaqwen3.7-plus#30
- MiniMaxminimax-m3#32
- ZZ.aiglm-5v-turbo#39
Ver tabla (los 50 mejores)
| Puesto | Modelo | Desarrollador | Puntuación | Intervalo de confianza del 95% | Votos |
|---|---|---|---|---|---|
| 1 | #1claude-opus-5-high | Anthropic | 1516 | 1509–1523 | 8,794 |
| 2 | #2claude-fable-5.1-max | Anthropic | 1513 | 1497–1528 | 1,403 |
| 3 | #3claude-opus-4-6-high | Anthropic | 1507 | 1501–1514 | 27,929 |
| 4 | #4claude-opus-4-6 | Anthropic | 1507 | 1501–1513 | 41,260 |
| 5 | #5claude-fable-5 | Anthropic | 1496 | 1488–1504 | 8,497 |
| 6 | #6claude-opus-4-7 | Anthropic | 1495 | 1489–1501 | 22,192 |
| 7 | #7claude-opus-4-7-high | Anthropic | 1495 | 1488–1501 | 21,957 |
| 8 | #8Ogpt-5.5 | OpenAI | 1486 | 1479–1492 | 21,279 |
| 9 | #9Ogpt-5.5-high | OpenAI | 1484 | 1478–1491 | 20,944 |
| 10 | #10Ogpt-5.6-sol-xhigh | OpenAI | 1483 | 1474–1492 | 4,818 |
| 11 | #11claude-sonnet-4-6 | Anthropic | 1482 | 1476–1488 | 57,813 |
| 12 | #12claude-opus-4-8-high | Anthropic | 1475 | 1468–1482 | 11,551 |
| 13 | #13Ogpt-5.6-terra-xhigh | OpenAI | 1472 | 1463–1480 | 5,787 |
| 14 | #14Ogpt-5.4 | OpenAI | 1471 | 1465–1477 | 33,331 |
| 15 | #15muse-spark-1.3-max | Meta | 1471 | 1452–1489 | 1,006 |
| 16 | #16Ogpt-6-astra-max | OpenAI | 1468 | 1453–1482 | 1,621 |
| 17 | #17claude-sonnet-5-high | Anthropic | 1466 | 1458–1474 | 7,411 |
| 18 | #18muse-spark-1.1 | Meta | 1465 | 1456–1474 | 4,885 |
| 19 | #19claude-opus-4-8 | Anthropic | 1464 | 1457–1471 | 12,128 |
| 20 | #20gemini-3.5-flash-medium | 1463 | 1455–1471 | 6,500 | |
| 21 | #21claude-opus-4-5-20251101 | Anthropic | 1462 | 1452–1473 | 7,981 |
| 22 | #22gemini-3.5-flash-high | 1461 | 1452–1471 | 4,061 | |
| 23 | #23Ogpt-5.6-luna-xhigh | OpenAI | 1457 | 1449–1465 | 5,766 |
| 24 | #24gemini-3.6-flash-high | 1456 | 1445–1467 | 2,975 | |
| 25 | #25xgrok-4.6-high | xAI | 1452 | 1440–1464 | 2,258 |
| 26 | #26xgrok-4.5 | xAI | 1452 | 1443–1461 | 4,965 |
| 27 | #27kimi-k2.6 | Moonshot AI | 1451 | 1443–1458 | 11,291 |
| 28 | #28claude-sonnet-4-5-20250929 | Anthropic | 1450 | 1444–1456 | 31,455 |
| 29 | #29muse-spark | Meta | 1444 | 1426–1462 | 1,084 |
| 30 | #30qwen3.7-plus | Alibaba | 1444 | 1435–1453 | 4,591 |
| 31 | #31gemini-3.1-pro-preview | 1444 | 1439–1449 | 49,457 | |
| 32 | #32minimax-m3 | MiniMax | 1435 | 1427–1443 | 6,314 |
| 33 | #33gemini-3-pro | 1434 | 1425–1443 | 10,769 | |
| 34 | #34kimi-k2.5-thinking | Moonshot AI | 1430 | 1423–1437 | 21,569 |
| 35 | #35gemma-4-31b | 1425 | 1417–1432 | 12,326 | |
| 36 | #36gemini-2.5-pro | 1421 | 1415–1427 | 25,110 | |
| 37 | #37claude-haiku-4-5-20251001 | Anthropic | 1420 | 1414–1426 | 34,677 |
| 38 | #38xgrok-4.20-beta-0309-reasoning | xAI | 1416 | 1409–1423 | 20,948 |
| 39 | #39Zglm-5v-turbo | Z.ai | 1416 | 1407–1424 | 6,995 |
| 40 | #40gemini-3-flash | 1413 | 1404–1422 | 7,158 | |
| 41 | #41Ogpt-5.2-high | OpenAI | 1405 | 1395–1414 | 7,108 |
| 42 | #42Ogpt-5.1 | OpenAI | 1403 | 1394–1413 | 8,244 |
| 43 | #43Ogpt-5.5-instant | OpenAI | 1403 | 1395–1411 | 8,497 |
| 44 | #44Ogpt-5.2 | OpenAI | 1401 | 1395–1407 | 28,212 |
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings