Valumigo

OpenRouter · Preguntas de ciencias de nivel de posgrado (GPQA Diamond)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Es el porcentaje de respuestas correctas en GPQA Diamond (preguntas de opción múltiple de biología, química y física de nivel de posgrado), ejecutado por OpenRouter. También publica el costo medio por pregunta.

Cómo interpretar la puntuación: Cuanto mayor sea el porcentaje de respuestas correctas (%), mejor. El 'costo medio por pregunta' es el importe medio que cuesta resolver una pregunta con las tarifas de OpenRouter, lo que permite comparar el costo en relación con el rendimiento.

Precauciones: Las condiciones de ejecución difieren de las de las puntuaciones de GPQA de Epoch AI, por lo que las cifras pueden ser distintas. Los costos se basan en las tarifas de OpenRouter.

Claves para interpretar esta clasificación

  • La puntuación más alta es 95.6%, obtenida por Gemini 3.8 Flash.
  • La diferencia entre el 1.º y el 5.º puesto es de 1.2%p.
  • Entre los 10 modelos mejor clasificados, OpenAI tiene la mayor cantidad, con 5 modelos.
  • Entre los 10 primeros, el modelo con el menor costo medio por pregunta es Jev Router ($0.0159, puntuación 93.9%).

Preguntas de ciencias de nivel de posgrado (GPQA Diamond) OpenRouter

Publicado el 2026-10-04 · Obtenido el 2026-10-05

GoogleGemini 3.8 Flash
95.6%
OGPT-6 Astra Pro
95.5%
SFugu Ultra
94.6%
GoogleGemini 3.1 Pro Preview
94.5%
OGPT-6 Astra
94.4%
OGPT-6.1 Sol
94.4%
TJev Router
93.9%
OGPT-5.6 Sol Pro
93.9%
GoogleGemini 3.7 Flash
93.9%
OGPT-5.5
93.7%
SFugu Ultra V2
93.3%
xGrok 4.6
92.8%
GoogleGemini 3.6 Flash
92.6%
GoogleGemini 3.5 Flash
92.6%
UPareto
92.4%
OGPT-5.6 Sol
92.1%
AnthropicClaude Sonnet 5.5
92.1%
OGPT-6 Sol
91.9%
Moonshot AIKimi K3
91.9%
NVIDIASwitchyard
91.4%

El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones.

Ver tabla (los 60 mejores)
PuestoModeloDesarrolladorPuntuaciónCosto medio por pregunta
1#1GoogleGemini 3.8 FlashGoogle95.6%$0.0682
2#2OGPT-6 Astra ProOpenAI95.5%$0.3326
3#3SFugu UltraSakana94.6%$1.1487
4#4GoogleGemini 3.1 Pro PreviewGoogle94.5%$0.202
5#5OGPT-6 AstraOpenAI94.4%$0.1133
6#6OGPT-6.1 SolOpenAI94.4%$0.0214
7#7TJev RouterTypesafe93.9%$0.0159
8#8OGPT-5.6 Sol ProOpenAI93.9%$0.2979
9#9GoogleGemini 3.7 FlashGoogle93.9%$0.0293
10#10OGPT-5.5OpenAI93.7%$0.3093
11#11SFugu Ultra V2Sakana93.3%$0.5026
12#12xGrok 4.6xAI92.8%$0.1233
13#13GoogleGemini 3.6 FlashGoogle92.6%$0.0596
14#14GoogleGemini 3.5 FlashGoogle92.6%$0.1413
15#15UParetoUnbiased92.4%$0.0338
16#16OGPT-5.6 SolOpenAI92.1%$0.0604
17#17AnthropicClaude Sonnet 5.5Anthropic92.1%$0.0253
18#18OGPT-6 SolOpenAI91.9%$0.0253
19#19Moonshot AIKimi K3Moonshot AI91.9%$0.1323
20#20NVIDIASwitchyardNVIDIA91.4%$0.0179
21#21ZGLM 5.3 FlashZ.ai90.9%$0.0054
22#22AlibabaQwen3.7 MaxAlibaba90.9%$0.2222
23#23MiniMaxMiniMax M3MiniMax90.3%$0.0348
24#24OGPT-5.4OpenAI90.3%$0.1467
25#25AnthropicClaude Opus 5.5Anthropic90.2%$0.0542
26#26OGPT-5.6 Luna ProOpenAI90%$0.0412
27#27AnthropicClaude Fable 5.1Anthropic89.9%$0.1305
28#28DeepSeekDeepSeek V4 Pro 0813DeepSeek89.8%$0.1143
29#29AnthropicClaude Opus 4.8Anthropic89.7%$0.2016
30#30AnthropicClaude Opus 4.7Anthropic89.4%$0.2239
31#31THy4 previewTencent89.1%$0.1253
32#32ANova Micro 1.0Amazon89%$0.2165
33#33DeepSeekDeepSeek V4.1 FlashDeepSeek88.9%$0.0244
34#34OGPT-5.6 TerraOpenAI88.8%$0.0344
35#35XiaomiMiMo-V2.6-ProXiaomi88.6%$0.0319
36#36SFugu MaxSakana88.6%$0.0756
37#37AlibabaQwen3.8 FlashAlibaba88.6%$0.0215
38#38GoogleGemini 3 Flash PreviewGoogle88.4%$0.1318
39#39OGPT-6 Luna ProOpenAI88.4%$0.0083
40#40DeepSeekDeepSeek V4 Flash Vision ExpDeepSeek88%$0.0228
41#41OAuto RouterOpenrouter88%$0.0892
42#42OGPT-5.2OpenAI87.9%$0.1333
43#43AlibabaQwen3.7 PlusAlibaba87.9%$0.044
44#44OGPT-5.6 LunaOpenAI87.9%$0.0079
45#45AnthropicClaude Opus 5Anthropic87.5%$0.1306
46#46OGPT-6 LunaOpenAI87.4%$0.003
47#47Moonshot AIKimi K2 ThinkingMoonshot AI87.3%$0.1062
48#48AlibabaQwen3.8 2.4T A95BAlibaba86.9%$0.0824
49#49TInkling SmallThinkingmachines86.6%$0.0253
50#50OGPT-5.1OpenAI86.4%$0.2213
51#51DeepSeekDeepSeek V4 Flash 0731DeepSeek86.3%$0.008
52#52MiniMaxMiniMax M2.1MiniMax86.2%$0.0403
53#53AnthropicClaude Opus 4.5Anthropic86.2%$0.8454
54#54DeepSeekDeepSeek V4 Pro 0423DeepSeek86.2%$0.0544
55#55AnthropicClaude Opus 4.6Anthropic86%$0.7469
56#56DeepSeekDeepSeek V4 Flash 0423DeepSeek85.8%$0.0062
57#57ZGLM 5.3 FlashZ.ai85.7%$0.0123
58#58OGPT-5OpenAI85.7%$0.2099
59#59AnthropicClaude Fable 5Anthropic85.5%$0.1754
60#60ZGLM 5.3Z.ai85.4%$0.0925

Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings