Valumigo

OpenRouter · Questions scientifiques de niveau master et doctorat (GPQA Diamond)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Il s’agit du taux de bonnes réponses à GPQA Diamond, exécuté par OpenRouter : des questions à choix multiples de niveau master et doctorat en biologie, chimie et physique. Le coût moyen par problème est également publié.

Comment lire le score : Plus le taux de bonnes réponses (%) est élevé, mieux c’est. Le « coût moyen par problème » correspond au montant moyen dépensé pour résoudre un problème aux tarifs d’OpenRouter, ce qui permet de comparer le rapport entre performances et coût.

Points à surveiller : Les conditions d’exécution diffèrent de celles des scores GPQA d’Epoch AI, ce qui peut expliquer des écarts. Les coûts sont calculés aux tarifs d’OpenRouter.

Ce que révèle ce classement

  • Le meilleur score est de 95.6%, obtenu par Gemini 3.8 Flash.
  • L’écart entre la 1re et la 5e place est de 1.2%p.
  • Parmi les 10 premiers, les modèles de OpenAI sont les plus nombreux, avec 5 modèles.
  • Parmi les 10 premiers, le modèle au coût moyen par problème le plus bas est Jev Router ($0.0159, score : 93.9%).

Questions scientifiques de niveau master et doctorat (GPQA Diamond) OpenRouter

Publié le 2026-10-04 · Récupéré le 2026-10-05

GoogleGemini 3.8 Flash
95.6%
OGPT-6 Astra Pro
95.5%
SFugu Ultra
94.6%
GoogleGemini 3.1 Pro Preview
94.5%
OGPT-6 Astra
94.4%
OGPT-6.1 Sol
94.4%
TJev Router
93.9%
OGPT-5.6 Sol Pro
93.9%
GoogleGemini 3.7 Flash
93.9%
OGPT-5.5
93.7%
SFugu Ultra V2
93.3%
xGrok 4.6
92.8%
GoogleGemini 3.6 Flash
92.6%
GoogleGemini 3.5 Flash
92.6%
UPareto
92.4%
OGPT-5.6 Sol
92.1%
AnthropicClaude Sonnet 5.5
92.1%
OGPT-6 Sol
91.9%
Moonshot AIKimi K3
91.9%
NVIDIASwitchyard
91.4%

Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.

Voir le tableau (top 60)
RangModèleDéveloppeurScoreCoût moyen par problème
1#1GoogleGemini 3.8 FlashGoogle95.6%$0.0682
2#2OGPT-6 Astra ProOpenAI95.5%$0.3326
3#3SFugu UltraSakana94.6%$1.1487
4#4GoogleGemini 3.1 Pro PreviewGoogle94.5%$0.202
5#5OGPT-6 AstraOpenAI94.4%$0.1133
6#6OGPT-6.1 SolOpenAI94.4%$0.0214
7#7TJev RouterTypesafe93.9%$0.0159
8#8OGPT-5.6 Sol ProOpenAI93.9%$0.2979
9#9GoogleGemini 3.7 FlashGoogle93.9%$0.0293
10#10OGPT-5.5OpenAI93.7%$0.3093
11#11SFugu Ultra V2Sakana93.3%$0.5026
12#12xGrok 4.6xAI92.8%$0.1233
13#13GoogleGemini 3.6 FlashGoogle92.6%$0.0596
14#14GoogleGemini 3.5 FlashGoogle92.6%$0.1413
15#15UParetoUnbiased92.4%$0.0338
16#16OGPT-5.6 SolOpenAI92.1%$0.0604
17#17AnthropicClaude Sonnet 5.5Anthropic92.1%$0.0253
18#18OGPT-6 SolOpenAI91.9%$0.0253
19#19Moonshot AIKimi K3Moonshot AI91.9%$0.1323
20#20NVIDIASwitchyardNVIDIA91.4%$0.0179
21#21ZGLM 5.3 FlashZ.ai90.9%$0.0054
22#22AlibabaQwen3.7 MaxAlibaba90.9%$0.2222
23#23MiniMaxMiniMax M3MiniMax90.3%$0.0348
24#24OGPT-5.4OpenAI90.3%$0.1467
25#25AnthropicClaude Opus 5.5Anthropic90.2%$0.0542
26#26OGPT-5.6 Luna ProOpenAI90%$0.0412
27#27AnthropicClaude Fable 5.1Anthropic89.9%$0.1305
28#28DeepSeekDeepSeek V4 Pro 0813DeepSeek89.8%$0.1143
29#29AnthropicClaude Opus 4.8Anthropic89.7%$0.2016
30#30AnthropicClaude Opus 4.7Anthropic89.4%$0.2239
31#31THy4 previewTencent89.1%$0.1253
32#32ANova Micro 1.0Amazon89%$0.2165
33#33DeepSeekDeepSeek V4.1 FlashDeepSeek88.9%$0.0244
34#34OGPT-5.6 TerraOpenAI88.8%$0.0344
35#35XiaomiMiMo-V2.6-ProXiaomi88.6%$0.0319
36#36SFugu MaxSakana88.6%$0.0756
37#37AlibabaQwen3.8 FlashAlibaba88.6%$0.0215
38#38GoogleGemini 3 Flash PreviewGoogle88.4%$0.1318
39#39OGPT-6 Luna ProOpenAI88.4%$0.0083
40#40DeepSeekDeepSeek V4 Flash Vision ExpDeepSeek88%$0.0228
41#41OAuto RouterOpenrouter88%$0.0892
42#42OGPT-5.2OpenAI87.9%$0.1333
43#43AlibabaQwen3.7 PlusAlibaba87.9%$0.044
44#44OGPT-5.6 LunaOpenAI87.9%$0.0079
45#45AnthropicClaude Opus 5Anthropic87.5%$0.1306
46#46OGPT-6 LunaOpenAI87.4%$0.003
47#47Moonshot AIKimi K2 ThinkingMoonshot AI87.3%$0.1062
48#48AlibabaQwen3.8 2.4T A95BAlibaba86.9%$0.0824
49#49TInkling SmallThinkingmachines86.6%$0.0253
50#50OGPT-5.1OpenAI86.4%$0.2213
51#51DeepSeekDeepSeek V4 Flash 0731DeepSeek86.3%$0.008
52#52MiniMaxMiniMax M2.1MiniMax86.2%$0.0403
53#53AnthropicClaude Opus 4.5Anthropic86.2%$0.8454
54#54DeepSeekDeepSeek V4 Pro 0423DeepSeek86.2%$0.0544
55#55AnthropicClaude Opus 4.6Anthropic86%$0.7469
56#56DeepSeekDeepSeek V4 Flash 0423DeepSeek85.8%$0.0062
57#57ZGLM 5.3 FlashZ.ai85.7%$0.0123
58#58OGPT-5OpenAI85.7%$0.2099
59#59AnthropicClaude Fable 5Anthropic85.5%$0.1754
60#60ZGLM 5.3Z.ai85.4%$0.0925

Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings