LMArena · General
Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.
Cómo interpretar esta clasificación
Qué mide: Esta clasificación reúne los votos de usuarios de LMArena que comparan respuestas de dos modelos cuyos nombres están ocultos. Al igual que la opción predeterminada del sitio de LMArena, usa el ajuste de tono y longitud (style control), que corrige estadísticamente la influencia de la longitud de las respuestas y de formatos como Markdown en los votos.
Cómo interpretar la puntuación: Es una puntuación relativa estimada a partir de los votos mediante el modelo Bradley–Terry y expresada en una escala similar a Elo. Los intervalos de confianza del 95% indican la incertidumbre de la estimación; que se solapen no basta para concluir que las capacidades son iguales.
Precauciones: Evalúa las respuestas preferidas por los usuarios, por lo que pueden influir el tono, la longitud y el formato, además de la precisión. Comprueba también los filtros y ajustes aplicados.
Claves para interpretar esta clasificación
- Los intervalos de confianza del 95% de gemini-4-argon-high, en 1.º lugar, y claude-opus-4-6-high, en 2.º, no se solapan. En esta agregación, la evidencia de que el 1.º lleva ventaja es relativamente clara.
- Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 7 modelos.
- El modelo en 1.º lugar recibió 4,932 votos y esta clasificación incluye 413 modelos.
General LMArena
Publicado el 2026-10-02 · Obtenido el 2026-10-04
Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones. Las clasificaciones de conversación y visión usan el ajuste de tono y longitud (style control), igual que la opción predeterminada del sitio de LMArena.
Mejor posición por empresa
- Googlegemini-4-argon-high#1
- Anthropicclaude-opus-4-6-high#2
- Metamuse-spark-1.3-max#9
- Moonshot AIkimi-k3-max#16
- OOpenAIgpt-5.6-sol-xhigh#20
- Alibabaqwen3.8-max#23
- Xiaomimimo-v2.6-pro#26
- ZZ.aiglm-5.3-max#27
- xxAIgrok-4.20-beta1#36
Ver tabla (los 50 mejores)
| Puesto | Modelo | Desarrollador | Puntuación | Intervalo de confianza del 95% | Votos |
|---|---|---|---|---|---|
| 1 | #1gemini-4-argon-high | 1525 | 1516–1534 | 4,932 | |
| 2 | #2claude-opus-4-6-high | Anthropic | 1505 | 1501–1508 | 77,636 |
| 3 | #3claude-fable-5-high | Anthropic | 1504 | 1500–1509 | 38,387 |
| 4 | #4claude-opus-5.5-high | Anthropic | 1504 | 1495–1513 | 4,552 |
| 5 | #5claude-opus-4-7-high | Anthropic | 1501 | 1498–1505 | 64,946 |
| 6 | #6claude-fable-5.1-max | Anthropic | 1501 | 1495–1508 | 11,800 |
| 7 | #7claude-opus-4-6 | Anthropic | 1497 | 1494–1501 | 82,189 |
| 8 | #8gemini-3.8-flash-high | 1495 | 1490–1500 | 26,298 | |
| 9 | #9muse-spark-1.3-max | Meta | 1494 | 1488–1500 | 12,343 |
| 10 | #10claude-opus-4-7 | Anthropic | 1494 | 1490–1498 | 66,058 |
| 11 | #11muse-spark-1.2 (xHigh) | Meta | 1494 | 1484–1503 | 4,356 |
| 12 | #12muse-spark-1.1 | Meta | 1491 | 1487–1496 | 37,238 |
| 13 | #13claude-opus-5-high | Anthropic | 1490 | 1486–1494 | 59,482 |
| 14 | #14claude-opus-5-max | Anthropic | 1489 | 1485–1494 | 28,937 |
| 15 | #15muse-spark | Meta | 1489 | 1484–1495 | 14,120 |
| 16 | #16kimi-k3-max | Moonshot AI | 1488 | 1484–1493 | 28,280 |
| 17 | #17gemini-3.7-flash-high | 1488 | 1483–1493 | 21,539 | |
| 18 | #18gemini-3.1-pro-preview | 1487 | 1484–1490 | 121,806 | |
| 19 | #19gemini-3-pro | 1485 | 1482–1489 | 41,910 | |
| 20 | #20Ogpt-5.6-sol-xhigh | OpenAI | 1484 | 1479–1488 | 36,656 |
| 21 | #21Ogpt-6.1-sol-max | OpenAI | 1483 | 1473–1494 | 3,071 |
| 22 | #22gemini-3.6-flash-high | 1483 | 1479–1487 | 36,070 | |
| 23 | #23qwen3.8-max | Alibaba | 1482 | 1476–1487 | 23,353 |
| 24 | #24claude-opus-4-8-high | Anthropic | 1482 | 1478–1485 | 63,974 |
| 25 | #25Ogpt-5.5-high | OpenAI | 1481 | 1478–1485 | 69,202 |
| 26 | #26mimo-v2.6-pro | Xiaomi | 1480 | 1471–1489 | 4,056 |
| 27 | #27Zglm-5.3-max | Z.ai | 1478 | 1473–1484 | 17,857 |
| 28 | #28gemini-3.5-flash-high | 1477 | 1473–1481 | 48,420 | |
| 29 | #29Ogpt-6-astra-max | OpenAI | 1477 | 1470–1484 | 9,156 |
| 30 | #30Ogpt-5.5 | OpenAI | 1477 | 1473–1480 | 70,781 |
| 31 | #31gemini-3.5-flash-medium | 1476 | 1472–1480 | 47,187 | |
| 32 | #32Zglm-5.2-max | Z.ai | 1476 | 1471–1480 | 45,399 |
| 33 | #33Ogpt-5.2-chat-latest-20260210 | OpenAI | 1476 | 1472–1480 | 35,937 |
| 34 | #34Ogpt-5.4-high | OpenAI | 1475 | 1471–1479 | 64,642 |
| 35 | #35qwen3.7-max-preview | Alibaba | 1475 | 1465–1485 | 3,920 |
| 36 | #36xgrok-4.20-beta1 | xAI | 1475 | 1470–1479 | 27,827 |
| 37 | #37claude-opus-4-8 | Anthropic | 1475 | 1471–1478 | 65,072 |
| 38 | #38deepseek-v4.1-flash-max | DeepSeek | 1474 | 1468–1481 | 8,728 |
| 39 | #39claude-opus-4-5-20251101-high-32k | Anthropic | 1474 | 1470–1477 | 37,448 |
| 40 | #40Ogpt-5.5-instant | OpenAI | 1473 | 1468–1478 | 27,098 |
| 41 | #41Zglm-5.3-flash | Z.ai | 1473 | 1468–1478 | 22,971 |
| 42 | #42gemini-3-flash | 1473 | 1468–1477 | 31,259 | |
| 43 | #43claude-sonnet-4-6 | Anthropic | 1472 | 1469–1476 | 70,747 |
| 44 | #44xgrok-4.20-beta-0309-reasoning | xAI | 1472 | 1468–1475 | 66,334 |
| 45 | #45claude-sonnet-5.5-xhigh | Anthropic | 1471 | 1461–1481 | 3,145 |
| 46 | #46xgrok-4.20-multi-agent-beta-0309 | xAI | 1471 | 1467–1474 | 64,788 |
| 47 | #47claude-opus-4-5-20251101 | Anthropic | 1470 | 1467–1473 | 72,772 |
| 48 | #48ernie-5.1 | Baidu | 1468 | 1463–1472 | 39,396 |
| 49 | #49mimo-v2.5-pro | Xiaomi | 1468 | 1464–1471 | 70,871 |
| 50 | #50xgrok-4.5 | xAI | 1466 | 1461–1470 | 39,789 |
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings