Epoch AI · Resultados de tareas profesionales reales (GDPval)
Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.
Cómo interpretar esta clasificación
Qué mide: GDPval, creado por OpenAI, pide a los modelos que produzcan resultados de tareas de distintas profesiones. Expertos del sector comparan de forma anónima los resultados de los modelos y los de expertos humanos.
Cómo interpretar la puntuación: La tasa de victorias es el porcentaje (%) de resultados del modelo considerados mejores que los de un experto humano. La tasa de victorias+empates es el porcentaje considerado igual o mejor. Actualmente, el gráfico predeterminado de Epoch utiliza la tasa de victorias.
Precauciones: La evaluación se basa en el criterio de expertos y en tareas seleccionadas. Los resultados pueden variar según la tarea, por lo que debes comprobar si la métrica mostrada es la tasa de victorias o la de victorias+empates.
Claves para interpretar esta clasificación
- La puntuación más alta es 49.7%, obtenida por GPT-5.2.
- La diferencia entre el 1.º y el 5.º puesto es de 9.4%p.
- Entre los 10 modelos mejor clasificados, OpenAI tiene la mayor cantidad, con 4 modelos.
- Hay 11 modelos con resultados publicados para esta prueba.
Resultados de tareas profesionales reales (GDPval) Epoch AI
Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04
Las barras indican el porcentaje de aciertos y parten del 0%.
Ver tabla (los 11 mejores)
| Puesto | Modelo | Desarrollador | Fecha de lanzamiento | Puntuación |
|---|---|---|---|---|
| 1 | #1OGPT-5.2(none) | OpenAI | 2025-12-11 | 49.7% |
| 2 | #2Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 45.5% |
| 3 | #3claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 43.6% |
| 4 | #4Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 42.5% |
| 5 | #5Gemini 3 Pro Preview | 2025-11-18 | 40.3% | |
| 6 | #6OGPT-5(medium) | OpenAI | 2025-08-07 | 34.8% |
| 7 | #7Oo3(medium) | OpenAI | 2025-04-16 | 30.8% |
| 8 | #8Oo4-mini(high) | OpenAI | 2025-04-16 | 25.3% |
| 9 | #9gemini-2.5-pro | 2025-06-05 | 23.3% | |
| 10 | #10xgrok-4-0709_high | xAI | 2025-07-09 | 21.1% |
| 11 | #11OGPT-4o(Nov 2024) | OpenAI | 2024-11-20 | 9.9% |
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings