Valumigo

LMArena · Mathématiques

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Ce classement repose sur les votes concernant les questions classées comme mathématiques dans les conversations textuelles de LMArena.

Comment lire le score : Il s’agit d’un score relatif des modèles préférés par les utilisateurs pour les réponses mathématiques. Les modèles ayant peu de votes peuvent présenter des intervalles de confiance plus larges.

Points à surveiller : Il s’agit d’une évaluation des préférences, et non d’un test mesurant directement le taux de bonnes réponses. Pour l’exactitude mathématique, consultez aussi des évaluations avec notation comme FrontierMath.

Ce que révèle ce classement

  • Les intervalles de confiance à 95% de gemini-4-argon-high, en 1re place, et de claude-fable-5-high, en 2e place, se chevauchent. Cette agrégation seule permet difficilement de déterminer leur ordre.
  • 37 autres modèles ont un intervalle de confiance qui chevauche celui du premier. Interprétez les petits écarts de classement avec prudence, en tenant compte du nombre de votes.
  • Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 7 modèles.
  • Le modèle en 1re place a reçu 255 votes, et ce classement comprend 396 modèles.

Mathématiques LMArena

Publié le 2026-10-02 · Récupéré le 2026-10-04

14701500153015601590
Googlegemini-4-argon-high
1530
Anthropicclaude-fable-5-high
1522
Anthropicclaude-opus-5-high
1521
Anthropicclaude-fable-5.1-max
1518
Googlegemini-3.8-flash-high
1517
Anthropicclaude-opus-4-6-high
1517
Anthropicclaude-opus-5.5-high
1510
Metamuse-spark-1.3-max
1509
Anthropicclaude-opus-4-7-high
1504
Googlegemini-3.7-flash-high
1503
Zglm-5.3-flash
1503
DeepSeekdeepseek-v4.1-flash-max
1503
Googlegemini-3.6-flash-high
1501
Moonshot AIkimi-k3-max
1500
Ogpt-5.5
1500
Alibabaqwen3.8-max
1498
Googlegemini-3.5-flash-high
1497
Zglm-5.3-max
1494
Anthropicclaude-opus-4-8-high
1494
Ogpt-5.6-sol-xhigh
1494

Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages. Les classements de conversation et de vision utilisent la correction du style et de la longueur (style control), comme le réglage par défaut du site LMArena.

Meilleur classement par entreprise

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-fable-5-high#2
  • MetaMetamuse-spark-1.3-max#9
  • ZZ.aiglm-5.3-flash#13
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#14
  • Moonshot AIMoonshot AIkimi-k3-max#16
  • OOpenAIgpt-5.5#17
  • AlibabaAlibabaqwen3.8-max#18
  • XiaomiXiaomimimo-v2.6-pro#30
Voir le tableau (top 50)
RangModèleDéveloppeurScoreIntervalle de confiance à 95%Nombre de votes
1#1Googlegemini-4-argon-highGoogle15301494–1566255
2#2Anthropicclaude-fable-5-highAnthropic15221509–15361,889
3#3Anthropicclaude-opus-5-highAnthropic15211509–15332,756
4#4Anthropicclaude-fable-5.1-maxAnthropic15181493–1543544
5#5Googlegemini-3.8-flash-highGoogle15171501–15341,274
6#6Anthropicclaude-opus-4-6-highAnthropic15171507–15273,978
7#7Anthropicclaude-opus-5-maxAnthropic15161499–15321,337
8#8Anthropicclaude-opus-5.5-highAnthropic15101475–1546235
9#9Metamuse-spark-1.3-maxMeta15091485–1533586
10#10Anthropicclaude-opus-4-6Anthropic15071497–15164,454
11#11Anthropicclaude-opus-4-7-highAnthropic15041493–15153,260
12#12Googlegemini-3.7-flash-highGoogle15031485–15211,097
13#13Zglm-5.3-flashZ.ai15031485–15211,131
14#14DeepSeekdeepseek-v4.1-flash-maxDeepSeek15031476–1530433
15#15Googlegemini-3.6-flash-highGoogle15011487–15161,736
16#16Moonshot AIkimi-k3-maxMoonshot AI15001483–15171,218
17#17Ogpt-5.5OpenAI15001489–15103,499
18#18Alibabaqwen3.8-maxAlibaba14981480–15151,151
19#19Googlegemini-3.5-flash-highGoogle14971485–15102,361
20#20Zglm-5.3-maxZ.ai14941473–1515739
21#21Anthropicclaude-opus-4-8-highAnthropic14941483–15052,941
22#22Ogpt-5.6-sol-xhighOpenAI14941480–15081,732
23#23Ogpt-5.5-highOpenAI14931483–15033,472
24#24Metamuse-spark-1.1Meta14921478–15071,661
25#25Ogpt-5.4-highOpenAI14921481–15023,379
26#26Anthropicclaude-opus-4-7Anthropic14921481–15023,371
27#27Ogpt-6-astra-maxOpenAI14901463–1517458
28#28Zglm-5.2-maxZ.ai14881475–15012,035
29#29Googlegemini-3.1-pro-previewGoogle14881480–14966,301
30#30Xiaomimimo-v2.6-proXiaomi14871447–1527213
31#31Alibabaqwen3.7-max-previewAlibaba14841446–1523231
32#32Googlegemini-3.5-flash-mediumGoogle14821469–14952,196
33#33Xiaomimimo-v2.5-proXiaomi14811470–14913,356
34#34Thy3Tencent14801455–1505550
35#35Moonshot AIkimi-k2.6Moonshot AI14801467–14932,075
36#36Ogpt-5.6-terra-xhighOpenAI14781464–14931,664
37#37TinklingThinky14781463–14931,581
38#38Baiduernie-5.1Baidu14771464–14911,980
39#39Ogpt-5.6-luna-xhighOpenAI14771463–14911,780
40#40Anthropicclaude-opus-4-8Anthropic14771466–14883,072
41#41Googlegemini-3-proGoogle14771465–14882,761
42#42Alibabaqwen3.6-max-previewAlibaba14761447–1505380
43#43Zglm-5.1Z.ai14751464–14872,860
44#44Googlegemini-3-flashGoogle14741461–14872,060
45#45Anthropicclaude-sonnet-5-highAnthropic14741460–14872,061
46#46xgrok-4.5xAI14731459–14871,752
47#47Xiaomimimo-v2.6-flashXiaomi14721441–1503330
48#48Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14721460–14842,334
49#49Moonshot AIkimi-k2.5-thinkingMoonshot AI14711462–14814,158
50#50Googlegemma-4-31bGoogle14691443–1496432

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings