Valumigo

Epoch AI · Preguntas científicas de nivel doctoral (GPQA Diamond)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: GPQA Diamond consta de 198 preguntas de opción múltiple de nivel de posgrado en biología, química y física. Expertos de cada área las redactaron y revisaron, y están diseñadas para ser difíciles de resolver por personas no expertas, incluso con acceso a internet.

Cómo interpretar la puntuación: Es la tasa de aciertos (%). Si se elige al azar entre 4 opciones con la misma probabilidad, la tasa de aciertos esperada es del 25%.

Precauciones: A medida que las puntuaciones de los mejores modelos se acercan al máximo, puede resultar difícil distinguir sus capacidades solo con esta prueba. Evalúa conocimientos científicos y razonamiento, por lo que puede diferir de la capacidad para tareas cotidianas.

Claves para interpretar esta clasificación

  • La puntuación más alta es 95.8%, obtenida por GPT-6 Astra.
  • La diferencia entre el 1.º y el 5.º puesto es de 1.0%p.
  • Entre los 10 modelos mejor clasificados, OpenAI tiene la mayor cantidad, con 4 modelos.
  • Hay 30 modelos con resultados publicados para esta prueba.

Preguntas científicas de nivel doctoral (GPQA Diamond) Epoch AI

Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04

OGPT-6 Astra
95.8%
AnthropicClaude Sonnet 5.5
95.6%
OGPT-6.1 Sol
95.4%
GoogleGemini 3.8 Flash
95.4%
GoogleGemini 3.7 Flash
94.8%
OGPT-5.4 Pro
94.6%
GoogleGemini 3.1 Pro Preview
94.4%
OGPT-6 Sol
94.3%
GoogleGemini 3.6 Flash
94.1%
xGrok 4.6
94.0%
OGPT-5.5
94.0%
OGPT-5.5 Pro
93.9%
AnthropicClaude Opus 5
93.9%
OGPT-5.6 Sol
93.5%
xGrok 4.5
93.4%
OGPT-5.6 Terra
93.3%
OGPT-5.4
93.3%
Moonshot AIKimi K3
93.1%
GoogleGemini 3.5 Flash
92.8%
xGrok 4.7
92.7%

Las barras indican el porcentaje de aciertos y parten del 0%.

Ver tabla (los 30 mejores)
PuestoModeloDesarrolladorFecha de lanzamientoPuntuación
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.8%
2#2AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2895.6%
3#3OGPT-6.1 Sol(max)OpenAI2026-09-2995.4%
4#4GoogleGemini 3.8 Flash(high)Google2026-09-0295.4%
5#5GoogleGemini 3.7 Flash(high)Google2026-08-1394.8%
6#6OGPT-5.4 Pro(xhigh)OpenAI2026-03-0594.6%
7#7GoogleGemini 3.1 Pro PreviewGoogle2026-02-1994.4%
8#8OGPT-6 Sol(max)OpenAI2026-09-2294.3%
9#9GoogleGemini 3.6 FlashGoogle2026-07-2194.1%
10#10xGrok 4.6(high)xAI2026-08-1294.0%
11#11OGPT-5.5(xhigh)OpenAI2026-04-2394.0%
12#12OGPT-5.5 Pro(xhigh)OpenAI2026-04-2393.9%
13#13AnthropicClaude Opus 5(max)Anthropic2026-07-2493.9%
14#14OGPT-5.6 Sol(max)OpenAI2026-07-0993.5%
15#15xGrok 4.5(high)xAI2026-07-0893.4%
16#16OGPT-5.6 Terra(max)OpenAI2026-07-0993.3%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0593.3%
18#18Moonshot AIKimi K3(max)Moonshot AI2026-07-1693.1%
19#19GoogleGemini 3.5 FlashGoogle2026-05-1992.8%
20#20xGrok 4.7(xhigh)xAI2026-09-2192.7%
21#21AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0292.7%
22#22GoogleGemini 3 Pro PreviewGoogle2025-11-1892.6%
23#23AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0192.3%
24#24ZGLM-5.2Z.ai2026-06-1691.9%
25#25DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1391.7%
26#26OGPT-5.6 Luna(max)OpenAI2026-07-0991.6%
27#27OGPT-5.2(xhigh)OpenAI2025-12-1191.4%
28#28AnthropicClaude Opus 4.8Anthropic2026-05-2891.0%
29#29DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3191.0%
30#30ZGLM-5.3(max)Z.ai2026-08-1490.9%

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings