Epoch AI · Matemáticas de máxima dificultad (FrontierMath)
Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.
Cómo interpretar esta clasificación
Qué mide: Es el conjunto privado de evaluación de los Tiers 1~3 de FrontierMath, creado por Epoch AI junto con matemáticos profesionales. Abarca desde un nivel universitario avanzado hasta el de investigadores principiantes y mantiene privados los problemas de evaluación para intentar reducir el riesgo de contaminación de los datos de entrenamiento.
Cómo interpretar la puntuación: Es la tasa de aciertos (%). Las respuestas se envían como objetos de Python en un formato establecido y se comprueba su corrección mediante evaluación automática.
Precauciones: Utiliza criterios distintos de los necesarios para cálculos habituales o ayuda con tareas escolares. Que sea privado no elimina por completo el riesgo de contaminación; al comparar, comprueba la versión del conjunto de datos y las condiciones de evaluación.
Claves para interpretar esta clasificación
- La puntuación más alta es 93.7%, obtenida por GPT-6.1 Sol.
- La diferencia entre el 1.º y el 5.º puesto es de 3.9%p.
- Entre los 10 modelos mejor clasificados, OpenAI tiene la mayor cantidad, con 6 modelos.
- Hay 30 modelos con resultados publicados para esta prueba.
Matemáticas de máxima dificultad (FrontierMath) Epoch AI
Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04
Las barras indican el porcentaje de aciertos y parten del 0%.
Ver tabla (los 30 mejores)
| Puesto | Modelo | Desarrollador | Fecha de lanzamiento | Puntuación |
|---|---|---|---|---|
| 1 | #1OGPT-6.1 Sol(max) | OpenAI | 2026-09-29 | 93.7% |
| 2 | #2OGPT-6 Astra(max) | OpenAI | 2026-09-03 | 93.7% |
| 3 | #3Claude Opus 5.5(max) | Anthropic | 2026-09-22 | 91.2% |
| 4 | #4Claude Fable 5.1(max) | Anthropic | 2026-09-01 | 90.2% |
| 5 | #5OGPT-6 Sol(max) | OpenAI | 2026-09-22 | 89.8% |
| 6 | #6OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 89.1% |
| 7 | #7Claude Sonnet 5.5(max) | Anthropic | 2026-09-28 | 88.8% |
| 8 | #8OGPT-5.5 Pro(xhigh) | OpenAI | 2026-04-23 | 87.7% |
| 9 | #9Claude Fable 5(max) | Anthropic | 2026-06-09 | 87.0% |
| 10 | #10OGPT-5.6 Terra(max) | OpenAI | 2026-07-09 | 86.0% |
| 11 | #11Claude Opus 5(max) | Anthropic | 2026-07-24 | 85.6% |
| 12 | #12OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 85.3% |
| 13 | #13OGPT-5.4 Pro(xhigh) | OpenAI | 2026-03-05 | 82.5% |
| 14 | #14OGPT-5.6 Luna(max) | OpenAI | 2026-07-09 | 82.1% |
| 15 | #15Claude Opus 4.8 | Anthropic | 2026-05-28 | 80.0% |
| 16 | #16OGPT-6 Luna(max) | OpenAI | 2026-09-22 | 78.9% |
| 17 | #17OGPT-5.4(xhigh) | OpenAI | 2026-03-05 | 78.6% |
| 18 | #18Qwen3.8 Max(xhigh) | Alibaba | 2026-08-02 | 74.7% |
| 19 | #19Muse Spark 1.3(xhigh) | Meta | 2026-09-02 | 74.4% |
| 20 | #20OGPT-5.2 Pro | OpenAI | 2025-12-11 | 74.0% |
| 21 | #21Kimi K3(max) | Moonshot AI | 2026-07-16 | 72.2% |
| 22 | #22Gemini 3.7 Flash(high) | 2026-08-13 | 71.6% | |
| 23 | #23Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 70.2% |
| 24 | #24ZGLM-5.3(max) | Z.ai | 2026-08-14 | 68.8% |
| 25 | #25Gemini 3.8 Flash(high) | 2026-09-02 | 68.4% | |
| 26 | #26OGPT-5.2(xhigh) | OpenAI | 2025-12-11 | 67.4% |
| 27 | #27xGrok 4.6(xhigh) | xAI | 2026-08-12 | 66.0% |
| 28 | #28Claude Opus 4.6(max) | Anthropic | 2026-02-05 | 66.0% |
| 29 | #29Qwen3.8 Max (0902)(xhigh) | Alibaba | 2026-09-01 | 65.6% |
| 30 | #30Claude Sonnet 5(max) | Anthropic | 2026-06-30 | 65.6% |
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings