Valumigo

Epoch AI · Questions scientifiques de niveau doctoral (GPQA Diamond)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : GPQA Diamond comprend 198 questions à choix multiple de niveau master et doctorat en biologie, chimie et physique. Rédigées et vérifiées par des experts, elles sont conçues pour être difficiles à résoudre par des non-spécialistes, même avec Internet.

Comment lire le score : Il s’agit du taux de bonnes réponses (%). Un choix aléatoire uniforme parmi les 4 réponses proposées donne un taux attendu de 25%.

Points à surveiller : Lorsque les meilleurs modèles approchent du score maximal, ce test seul peut moins bien distinguer leurs capacités. Il évalue les connaissances et le raisonnement scientifiques, qui peuvent différer des capacités utiles aux tâches quotidiennes.

Ce que révèle ce classement

  • Le meilleur score est de 95.8%, obtenu par GPT-6 Astra.
  • L’écart entre la 1re et la 5e place est de 1.0%p.
  • Parmi les 10 premiers, les modèles de OpenAI sont les plus nombreux, avec 4 modèles.
  • Les résultats de ce test sont publics pour 30 modèles.

Questions scientifiques de niveau doctoral (GPQA Diamond) Epoch AI

Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04

OGPT-6 Astra
95.8%
AnthropicClaude Sonnet 5.5
95.6%
OGPT-6.1 Sol
95.4%
GoogleGemini 3.8 Flash
95.4%
GoogleGemini 3.7 Flash
94.8%
OGPT-5.4 Pro
94.6%
GoogleGemini 3.1 Pro Preview
94.4%
OGPT-6 Sol
94.3%
GoogleGemini 3.6 Flash
94.1%
xGrok 4.6
94.0%
OGPT-5.5
94.0%
OGPT-5.5 Pro
93.9%
AnthropicClaude Opus 5
93.9%
OGPT-5.6 Sol
93.5%
xGrok 4.5
93.4%
OGPT-5.6 Terra
93.3%
OGPT-5.4
93.3%
Moonshot AIKimi K3
93.1%
GoogleGemini 3.5 Flash
92.8%
xGrok 4.7
92.7%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Voir le tableau (top 30)
RangModèleDéveloppeurDate de sortieScore
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.8%
2#2AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2895.6%
3#3OGPT-6.1 Sol(max)OpenAI2026-09-2995.4%
4#4GoogleGemini 3.8 Flash(high)Google2026-09-0295.4%
5#5GoogleGemini 3.7 Flash(high)Google2026-08-1394.8%
6#6OGPT-5.4 Pro(xhigh)OpenAI2026-03-0594.6%
7#7GoogleGemini 3.1 Pro PreviewGoogle2026-02-1994.4%
8#8OGPT-6 Sol(max)OpenAI2026-09-2294.3%
9#9GoogleGemini 3.6 FlashGoogle2026-07-2194.1%
10#10xGrok 4.6(high)xAI2026-08-1294.0%
11#11OGPT-5.5(xhigh)OpenAI2026-04-2394.0%
12#12OGPT-5.5 Pro(xhigh)OpenAI2026-04-2393.9%
13#13AnthropicClaude Opus 5(max)Anthropic2026-07-2493.9%
14#14OGPT-5.6 Sol(max)OpenAI2026-07-0993.5%
15#15xGrok 4.5(high)xAI2026-07-0893.4%
16#16OGPT-5.6 Terra(max)OpenAI2026-07-0993.3%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0593.3%
18#18Moonshot AIKimi K3(max)Moonshot AI2026-07-1693.1%
19#19GoogleGemini 3.5 FlashGoogle2026-05-1992.8%
20#20xGrok 4.7(xhigh)xAI2026-09-2192.7%
21#21AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0292.7%
22#22GoogleGemini 3 Pro PreviewGoogle2025-11-1892.6%
23#23AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0192.3%
24#24ZGLM-5.2Z.ai2026-06-1691.9%
25#25DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1391.7%
26#26OGPT-5.6 Luna(max)OpenAI2026-07-0991.6%
27#27OGPT-5.2(xhigh)OpenAI2025-12-1191.4%
28#28AnthropicClaude Opus 4.8Anthropic2026-05-2891.0%
29#29DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3191.0%
30#30ZGLM-5.3(max)Z.ai2026-08-1490.9%

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings