Valumigo

Epoch AI · Resultados de tareas profesionales reales (GDPval)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: GDPval, creado por OpenAI, pide a los modelos que produzcan resultados de tareas de distintas profesiones. Expertos del sector comparan de forma anónima los resultados de los modelos y los de expertos humanos.

Cómo interpretar la puntuación: La tasa de victorias es el porcentaje (%) de resultados del modelo considerados mejores que los de un experto humano. La tasa de victorias+empates es el porcentaje considerado igual o mejor. Actualmente, el gráfico predeterminado de Epoch utiliza la tasa de victorias.

Precauciones: La evaluación se basa en el criterio de expertos y en tareas seleccionadas. Los resultados pueden variar según la tarea, por lo que debes comprobar si la métrica mostrada es la tasa de victorias o la de victorias+empates.

Claves para interpretar esta clasificación

  • La puntuación más alta es 49.7%, obtenida por GPT-5.2.
  • La diferencia entre el 1.º y el 5.º puesto es de 9.4%p.
  • Entre los 10 modelos mejor clasificados, OpenAI tiene la mayor cantidad, con 4 modelos.
  • Hay 11 modelos con resultados publicados para esta prueba.

Resultados de tareas profesionales reales (GDPval) Epoch AI

Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04

OGPT-5.2
49.7%
AnthropicClaude Opus 4.5
45.5%
Anthropicclaude-opus-4-1-20250805
43.6%
AnthropicClaude Sonnet 4.5
42.5%
GoogleGemini 3 Pro Preview
40.3%
OGPT-5
34.8%
Oo3
30.8%
Oo4-mini
25.3%
Googlegemini-2.5-pro
23.3%
xgrok-4-0709_high
21.1%
OGPT-4o
9.9%

Las barras indican el porcentaje de aciertos y parten del 0%.

Ver tabla (los 11 mejores)
PuestoModeloDesarrolladorFecha de lanzamientoPuntuación
1#1OGPT-5.2(none)OpenAI2025-12-1149.7%
2#2AnthropicClaude Opus 4.5(no thinking)Anthropic2025-11-2445.5%
3#3Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0543.6%
4#4AnthropicClaude Sonnet 4.5(no thinking)Anthropic2025-09-2942.5%
5#5GoogleGemini 3 Pro PreviewGoogle2025-11-1840.3%
6#6OGPT-5(medium)OpenAI2025-08-0734.8%
7#7Oo3(medium)OpenAI2025-04-1630.8%
8#8Oo4-mini(high)OpenAI2025-04-1625.3%
9#9Googlegemini-2.5-proGoogle2025-06-0523.3%
10#10xgrok-4-0709_highxAI2025-07-0921.1%
11#11OGPT-4o(Nov 2024)OpenAI2024-11-209.9%

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings