Valumigo

Epoch AI · Mathématiques de très haut niveau (FrontierMath)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Il s’agit du jeu d’évaluation privé Tiers 1~3 de FrontierMath, créé par Epoch AI avec des mathématiciens professionnels. Il couvre des niveaux allant de la fin du premier cycle universitaire aux débuts de la recherche. Les problèmes restent privés afin de réduire le risque de contamination des données d’entraînement.

Comment lire le score : Il s’agit du taux de bonnes réponses (%). Les réponses sont soumises sous forme d’objets Python dans un format imposé, puis leur exactitude est évaluée automatiquement.

Points à surveiller : Ce test mesure autre chose que les capacités de calcul courant ou d’aide aux devoirs. Le caractère privé des problèmes n’élimine pas totalement le risque de contamination. Vérifiez la version du jeu de données et les conditions d’évaluation avant toute comparaison.

Ce que révèle ce classement

  • Le meilleur score est de 93.7%, obtenu par GPT-6.1 Sol.
  • L’écart entre la 1re et la 5e place est de 3.9%p.
  • Parmi les 10 premiers, les modèles de OpenAI sont les plus nombreux, avec 6 modèles.
  • Les résultats de ce test sont publics pour 30 modèles.

Mathématiques de très haut niveau (FrontierMath) Epoch AI

Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04

OGPT-6.1 Sol
93.7%
OGPT-6 Astra
93.7%
AnthropicClaude Opus 5.5
91.2%
AnthropicClaude Fable 5.1
90.2%
OGPT-6 Sol
89.8%
OGPT-5.6 Sol
89.1%
AnthropicClaude Sonnet 5.5
88.8%
OGPT-5.5 Pro
87.7%
AnthropicClaude Fable 5
87.0%
OGPT-5.6 Terra
86.0%
AnthropicClaude Opus 5
85.6%
OGPT-5.5
85.3%
OGPT-5.4 Pro
82.5%
OGPT-5.6 Luna
82.1%
AnthropicClaude Opus 4.8
80.0%
OGPT-6 Luna
78.9%
OGPT-5.4
78.6%
AlibabaQwen3.8 Max
74.7%
MetaMuse Spark 1.3
74.4%
OGPT-5.2 Pro
74.0%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Voir le tableau (top 30)
RangModèleDéveloppeurDate de sortieScore
1#1OGPT-6.1 Sol(max)OpenAI2026-09-2993.7%
2#2OGPT-6 Astra(max)OpenAI2026-09-0393.7%
3#3AnthropicClaude Opus 5.5(max)Anthropic2026-09-2291.2%
4#4AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.2%
5#5OGPT-6 Sol(max)OpenAI2026-09-2289.8%
6#6OGPT-5.6 Sol(max)OpenAI2026-07-0989.1%
7#7AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2888.8%
8#8OGPT-5.5 Pro(xhigh)OpenAI2026-04-2387.7%
9#9AnthropicClaude Fable 5(max)Anthropic2026-06-0987.0%
10#10OGPT-5.6 Terra(max)OpenAI2026-07-0986.0%
11#11AnthropicClaude Opus 5(max)Anthropic2026-07-2485.6%
12#12OGPT-5.5(xhigh)OpenAI2026-04-2385.3%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0582.5%
14#14OGPT-5.6 Luna(max)OpenAI2026-07-0982.1%
15#15AnthropicClaude Opus 4.8Anthropic2026-05-2880.0%
16#16OGPT-6 Luna(max)OpenAI2026-09-2278.9%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0578.6%
18#18AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0274.7%
19#19MetaMuse Spark 1.3(xhigh)Meta2026-09-0274.4%
20#20OGPT-5.2 ProOpenAI2025-12-1174.0%
21#21Moonshot AIKimi K3(max)Moonshot AI2026-07-1672.2%
22#22GoogleGemini 3.7 Flash(high)Google2026-08-1371.6%
23#23AnthropicClaude Opus 4.7(max)Anthropic2026-04-1670.2%
24#24ZGLM-5.3(max)Z.ai2026-08-1468.8%
25#25GoogleGemini 3.8 Flash(high)Google2026-09-0268.4%
26#26OGPT-5.2(xhigh)OpenAI2025-12-1167.4%
27#27xGrok 4.6(xhigh)xAI2026-08-1266.0%
28#28AnthropicClaude Opus 4.6(max)Anthropic2026-02-0566.0%
29#29AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0165.6%
30#30AnthropicClaude Sonnet 5(max)Anthropic2026-06-3065.6%

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings