Clasificación de benchmarks de IA
Actualizamos periódicamente los datos públicos de benchmarks: rankings por votos de usuarios de LMArena y puntuaciones de pruebas de Epoch AI. Cada ranking muestra la fecha de publicación y la de obtención de los datos. Las puntuaciones no las calcula este sitio.
Modelos recientes de un vistazo
Modelos lanzados en los últimos 120 días, ordenados por fecha de lanzamiento, con las puntuaciones de ambas fuentes públicas en una sola fila. Las puntuaciones indican el porcentaje de respuestas correctas.
| Modelo | Fecha de lanzamiento | Índice general | GPQA Diamond | FrontierMath | HLE | ARC-AGI-2 | SWE-bench Verified | Clasificación general de LMArena | Clasificación de LMArena en Español |
|---|---|---|---|---|---|---|---|---|---|
| OGPT-6.1 SolOpenAI | 2026-09-29 | – | 95.4 | 93.7 | – | – | – | #60 | Aún sin datos |
| Claude Sonnet 5.5Anthropic | 2026-09-28 | 165.2 | 95.6 | 88.8 | – | – | – | #34 | Aún sin datos |
| Claude Opus 5.5Anthropic | 2026-09-22 | 167.4 | – | 91.2 | – | 92.5 | – | #2 | Aún sin datos |
| OGPT-6 SolOpenAI | 2026-09-22 | – | 94.3 | 89.8 | – | 89.6 | – | #158 | #159 |
| OGPT-6 LunaOpenAI | 2026-09-22 | – | – | 78.9 | – | 59.3 | – | #163 | #115 |
| DeepSeek V4.1 FlashDeepSeek | 2026-09-09 | 155 | – | – | – | – | – | #37 | #18 |
| OGPT-6 AstraOpenAI | 2026-09-03 | 166.5 | 95.8 | 93.7 | 54.8 | 95 | – | #71 | #125 |
| Gemini 3.8 FlashGoogle | 2026-09-02 | 156.9 | 95.4 | 68.4 | 44.5 | – | – | #8 | #12 |
| Muse Spark 1.3Meta | 2026-09-02 | 156.9 | – | 74.4 | – | – | – | #12 | #11 |
| Claude Fable 5.1Anthropic | 2026-09-01 | 164.8 | – | 90.2 | 46.5 | 90 | – | #3 | #3 |
| Qwen3.8 Max (0902)Alibaba | 2026-09-01 | 155.2 | 92.3 | 65.6 | – | – | – | Aún sin datos | Aún sin datos |
| ZGLM-5.3-FlashZ.ai | 2026-08-20 | 151.9 | – | – | – | – | – | #30 | #28 |
| ZGLM-5.3Z.ai | 2026-08-14 | 155.8 | 90.9 | 68.8 | – | – | – | #26 | #28 |
| Qwen 3.8 27BAlibaba | 2026-08-14 | 149.4 | – | – | – | – | – | #74 | #57 |
| Gemini 3.7 FlashGoogle | 2026-08-13 | 157.4 | 94.8 | 71.6 | – | 84.6 | – | #13 | #8 |
| DeepSeek V4 Pro 0813DeepSeek | 2026-08-13 | 155.4 | 91.7 | – | – | 61.3 | – | Aún sin datos | Aún sin datos |
Los modelos nuevos necesitan suficientes votos para aparecer en las clasificaciones, especialmente las de cada idioma. Poco después del lanzamiento pueden figurar como 'Aún sin datos'.
Español LMArena
Publicado el 2026-10-02 · Obtenido el 2026-10-04
Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes.
Ver tabla (los 50 mejores)
| Puesto | Modelo | Desarrollador | Puntuación | Intervalo de confianza del 95% | Votos |
|---|---|---|---|---|---|
| 1 | claude-opus-5-max | Anthropic | 1517 | 1496–1539 | 803 |
| 2 | claude-opus-4-6 | Anthropic | 1510 | 1498–1523 | 2,707 |
| 3 | claude-fable-5.1-max | Anthropic | 1508 | 1478–1538 | 375 |
| 4 | claude-opus-4-6-high | Anthropic | 1504 | 1491–1517 | 2,627 |
| 5 | claude-opus-5-high | Anthropic | 1504 | 1488–1519 | 1,676 |
| 6 | gemini-4-argon-high | 1503 | 1462–1544 | 201 | |
| 7 | claude-fable-5-high | Anthropic | 1500 | 1482–1518 | 1,167 |
| 8 | gemini-3.7-flash-high | 1499 | 1475–1523 | 639 | |
| 9 | qwen3.8-max | Alibaba | 1497 | 1473–1520 | 689 |
| 10 | claude-opus-4-7-high | Anthropic | 1495 | 1481–1510 | 2,043 |
| 11 | muse-spark-1.3-max | Meta | 1487 | 1455–1518 | 365 |
| 12 | gemini-3.8-flash-high | 1485 | 1464–1505 | 848 | |
| 13 | gemini-3.5-flash-high | 1479 | 1462–1496 | 1,410 | |
| 14 | gemini-3.1-pro-preview | 1479 | 1468–1489 | 3,868 | |
| 15 | Zglm-5.2-max | Z.ai | 1477 | 1460–1494 | 1,314 |
| 16 | kimi-k3-max | Moonshot AI | 1477 | 1456–1497 | 843 |
| 17 | gemini-3.6-flash-high | 1476 | 1456–1497 | 914 | |
| 18 | deepseek-v4.1-flash-max | DeepSeek | 1475 | 1440–1510 | 274 |
| 19 | mimo-v2.5-pro | Xiaomi | 1474 | 1460–1488 | 2,126 |
| 20 | gemini-3.5-flash-medium | 1474 | 1457–1492 | 1,274 | |
| 21 | gemini-2.5-pro | 1474 | 1463–1485 | 3,439 | |
| 22 | ernie-5.1 | Baidu | 1473 | 1455–1491 | 1,292 |
| 23 | ernie-5.0-preview-1203 | Baidu | 1473 | 1436–1510 | 238 |
| 24 | claude-opus-4-7 | Anthropic | 1473 | 1459–1487 | 2,099 |
| 25 | muse-spark | Meta | 1471 | 1445–1497 | 518 |
| 26 | qwen3.5-max-preview | Alibaba | 1470 | 1449–1491 | 804 |
| 27 | gemini-3-flash | 1470 | 1451–1488 | 999 | |
| 28 | Zglm-5.3-flash | Z.ai | 1469 | 1448–1490 | 792 |
| 29 | Zglm-5.1 | Z.ai | 1468 | 1453–1482 | 1,897 |
| 30 | gemini-3-pro | 1468 | 1450–1485 | 1,215 | |
| 31 | Ogpt-5.5-high | OpenAI | 1468 | 1453–1482 | 1,937 |
| 32 | claude-opus-4-8-high | Anthropic | 1466 | 1451–1481 | 1,840 |
| 33 | muse-spark-1.1 | Meta | 1466 | 1447–1484 | 1,106 |
| 34 | kimi-k2.6 | Moonshot AI | 1464 | 1447–1480 | 1,371 |
| 35 | claude-sonnet-4-6 | Anthropic | 1464 | 1450–1477 | 2,177 |
| 36 | qwen3-max-preview | Alibaba | 1462 | 1442–1483 | 844 |
| 37 | dola-seed-2.0-pro | ByteDance | 1461 | 1448–1473 | 2,565 |
| 38 | deepseek-v4-pro | DeepSeek | 1458 | 1442–1473 | 1,726 |
| 39 | claude-opus-4-5-20251101-high-32k | Anthropic | 1457 | 1439–1475 | 1,137 |
| 40 | mimo-v2-pro | Xiaomi | 1457 | 1436–1478 | 850 |
| 41 | qwen3.7-plus | Alibaba | 1457 | 1439–1475 | 1,234 |
| 42 | Ogpt-5.5 | OpenAI | 1457 | 1443–1471 | 2,033 |
| 43 | claude-sonnet-4-5-20250929 | Anthropic | 1456 | 1444–1469 | 2,487 |
| 44 | nvidia-nemotron-3-ultra-550b-a55b-nvfp4 | NVIDIA | 1455 | 1426–1483 | 453 |
| 45 | Ogpt-5.4-high | OpenAI | 1454 | 1440–1468 | 2,062 |
| 46 | Zglm-4.5 | Z.ai | 1454 | 1430–1477 | 676 |
| 47 | Zglm-5 | Z.ai | 1453 | 1435–1471 | 1,134 |
| 48 | claude-opus-4-5-20251101 | Anthropic | 1453 | 1439–1466 | 2,156 |
| 49 | Thy3 | Tencent | 1453 | 1423–1483 | 371 |
| 50 | qwen3.6-max-preview | Alibaba | 1452 | 1416–1489 | 253 |
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarks