Valumigo

Epoch AI · Questions expertes dans divers domaines (HLE)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Humanity's Last Exam a été créé par Center for AI Safety et Scale AI. Il comprend 2,500 questions publiques rédigées par des experts de plusieurs domaines et a été développé pour répondre à la saturation des benchmarks existants.

Comment lire le score : Il s’agit du taux de bonnes réponses (%). Le test évalue des connaissances et un raisonnement avancés ; le score varie selon le modèle et les conditions d’utilisation des outils.

Points à surveiller : Des erreurs ont été signalées dans les questions, les réponses et la notation. Pour interpréter de petits écarts de score, examinez aussi les défauts des questions, les conditions d’évaluation et l’incertitude statistique.

Ce que révèle ce classement

  • Le meilleur score est de 54.8%, obtenu par GPT-6 Astra.
  • L’écart entre la 1re et la 5e place est de 10.5%p.
  • Parmi les 10 premiers, les modèles de OpenAI sont les plus nombreux, avec 3 modèles.
  • Les résultats de ce test sont publics pour 30 modèles.

Questions expertes dans divers domaines (HLE) Epoch AI

Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04

OGPT-6 Astra
54.8%
AnthropicClaude Fable 5.1
46.5%
GoogleGemini 3.1 Pro Preview
46.4%
GoogleGemini 3.8 Flash
44.5%
OGPT-5.4 Pro
44.3%
MetaMuse Spark
40.6%
GoogleGemini 3 Pro Preview
37.5%
OGPT-5.4
36.2%
AnthropicClaude Opus 4.7
36.2%
AnthropicClaude Opus 4.6
34.4%
OGPT-5 Pro
31.6%
OGPT-5.2
27.8%
OGPT-5
25.3%
AnthropicClaude Opus 4.5
25.2%
Moonshot AIKimi K2.5
24.4%
OGPT-5.1
23.7%
GoogleGemini 2.5 Pro Preview
21.6%
Oo3
20.3%
OGPT-5 mini
19.4%
GoogleGemini 2.5 Pro Exp
18.2%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Voir le tableau (top 30)
RangModèleDéveloppeurDate de sortieScore
1#1OGPT-6 Astra(unknown thinking)OpenAI2026-09-0354.8%
2#2AnthropicClaude Fable 5.1(xhigh)Anthropic2026-09-0146.5%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1946.4%
4#4GoogleGemini 3.8 Flash(unknown)Google2026-09-0244.5%
5#5OGPT-5.4 ProOpenAI2026-03-0544.3%
6#6MetaMuse SparkMeta2026-04-0840.6%
7#7GoogleGemini 3 Pro PreviewGoogle2025-11-1837.5%
8#8OGPT-5.4(xhigh)OpenAI2026-03-0536.2%
9#9AnthropicClaude Opus 4.7(unknown)Anthropic2026-04-1636.2%
10#10AnthropicClaude Opus 4.6(max)Anthropic2026-02-0534.4%
11#11OGPT-5 ProOpenAI2025-10-0731.6%
12#12OGPT-5.2(unknown thinking)OpenAI2025-12-1127.8%
13#13OGPT-5(high)OpenAI2025-08-0725.3%
14#14AnthropicClaude Opus 4.5(unknown thinking)Anthropic2025-11-2425.2%
15#15Moonshot AIKimi K2.5Moonshot AI2026-01-2724.4%
16#16OGPT-5.1(unknown thinking)OpenAI2025-11-1323.7%
17#17GoogleGemini 2.5 Pro Preview(Jun 2025)Google2025-06-0521.6%
18#18Oo3(high)OpenAI2025-04-1620.3%
19#19OGPT-5 mini(unknown thinking)OpenAI2025-08-0719.4%
20#20GoogleGemini 2.5 Pro Exp(Mar 2025)Google2025-03-2518.2%
21#21Oo4-mini(high)OpenAI2025-04-1618.1%
22#22AnthropicClaude Sonnet 4.5(unknown thinking)Anthropic2025-09-2913.7%
23#23GoogleGemini 2.5 Flash Preview(Apr 2025)Google2025-04-1712.1%
24#24AnthropicClaude Opus 4.1(unknown thinking)Anthropic2025-08-0511.5%
25#25Googlegemini-2.5-flash-preview-05-20Google2025-05-2011.0%
26#26AnthropicClaude Opus 4Anthropic2025-05-2210.7%
27#27GoogleGemini 3.1 Flash-LiteGoogle2026-03-038.6%
28#28Zglm-4.5Z.ai2025-08-038.3%
29#29ZGLM-4.5-AirZ.ai2025-07-208.1%
30#30Oo1 ProOpenAI2025-03-198.1%

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings