Epoch AI · Preguntas de máxima dificultad en diversas áreas (HLE)
Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.
Cómo interpretar esta clasificación
Qué mide: Humanity's Last Exam fue creado por Center for AI Safety y Scale AI. Consta de 2,500 preguntas públicas redactadas por expertos de distintas áreas y se desarrolló en respuesta a la saturación de los benchmarks existentes.
Cómo interpretar la puntuación: Es la tasa de aciertos (%). Evalúa conocimientos y razonamiento de alta dificultad, y la puntuación varía según el modelo y las condiciones de uso de herramientas.
Precauciones: Se han señalado errores en las preguntas, las respuestas correctas y la evaluación. Interpreta las diferencias pequeñas de puntuación teniendo en cuenta los defectos de las preguntas, las condiciones de evaluación y la incertidumbre estadística.
Claves para interpretar esta clasificación
- La puntuación más alta es 54.8%, obtenida por GPT-6 Astra.
- La diferencia entre el 1.º y el 5.º puesto es de 10.5%p.
- Entre los 10 modelos mejor clasificados, OpenAI tiene la mayor cantidad, con 3 modelos.
- Hay 30 modelos con resultados publicados para esta prueba.
Preguntas de máxima dificultad en diversas áreas (HLE) Epoch AI
Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04
Las barras indican el porcentaje de aciertos y parten del 0%.
Ver tabla (los 30 mejores)
| Puesto | Modelo | Desarrollador | Fecha de lanzamiento | Puntuación |
|---|---|---|---|---|
| 1 | #1OGPT-6 Astra(unknown thinking) | OpenAI | 2026-09-03 | 54.8% |
| 2 | #2Claude Fable 5.1(xhigh) | Anthropic | 2026-09-01 | 46.5% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 46.4% | |
| 4 | #4Gemini 3.8 Flash(unknown) | 2026-09-02 | 44.5% | |
| 5 | #5OGPT-5.4 Pro | OpenAI | 2026-03-05 | 44.3% |
| 6 | #6Muse Spark | Meta | 2026-04-08 | 40.6% |
| 7 | #7Gemini 3 Pro Preview | 2025-11-18 | 37.5% | |
| 8 | #8OGPT-5.4(xhigh) | OpenAI | 2026-03-05 | 36.2% |
| 9 | #9Claude Opus 4.7(unknown) | Anthropic | 2026-04-16 | 36.2% |
| 10 | #10Claude Opus 4.6(max) | Anthropic | 2026-02-05 | 34.4% |
| 11 | #11OGPT-5 Pro | OpenAI | 2025-10-07 | 31.6% |
| 12 | #12OGPT-5.2(unknown thinking) | OpenAI | 2025-12-11 | 27.8% |
| 13 | #13OGPT-5(high) | OpenAI | 2025-08-07 | 25.3% |
| 14 | #14Claude Opus 4.5(unknown thinking) | Anthropic | 2025-11-24 | 25.2% |
| 15 | #15Kimi K2.5 | Moonshot AI | 2026-01-27 | 24.4% |
| 16 | #16OGPT-5.1(unknown thinking) | OpenAI | 2025-11-13 | 23.7% |
| 17 | #17Gemini 2.5 Pro Preview(Jun 2025) | 2025-06-05 | 21.6% | |
| 18 | #18Oo3(high) | OpenAI | 2025-04-16 | 20.3% |
| 19 | #19OGPT-5 mini(unknown thinking) | OpenAI | 2025-08-07 | 19.4% |
| 20 | #20Gemini 2.5 Pro Exp(Mar 2025) | 2025-03-25 | 18.2% | |
| 21 | #21Oo4-mini(high) | OpenAI | 2025-04-16 | 18.1% |
| 22 | #22Claude Sonnet 4.5(unknown thinking) | Anthropic | 2025-09-29 | 13.7% |
| 23 | #23Gemini 2.5 Flash Preview(Apr 2025) | 2025-04-17 | 12.1% | |
| 24 | #24Claude Opus 4.1(unknown thinking) | Anthropic | 2025-08-05 | 11.5% |
| 25 | #25gemini-2.5-flash-preview-05-20 | 2025-05-20 | 11.0% | |
| 26 | #26Claude Opus 4 | Anthropic | 2025-05-22 | 10.7% |
| 27 | #27Gemini 3.1 Flash-Lite | 2026-03-03 | 8.6% | |
| 28 | #28Zglm-4.5 | Z.ai | 2025-08-03 | 8.3% |
| 29 | #29ZGLM-4.5-Air | Z.ai | 2025-07-20 | 8.1% |
| 30 | #30Oo1 Pro | OpenAI | 2025-03-19 | 8.1% |
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings