Valumigo

LMArena · Code

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Ce classement est calculé à partir des votes sur les questions classées comme liées au code dans les conversations textuelles de LMArena.

Comment lire le score : Il s’agit d’un score relatif des modèles préférés par les utilisateurs pour les réponses liées au code. Interprétez les petits écarts en tenant compte des intervalles de confiance et du nombre de votes.

Points à surveiller : Il s’agit d’une évaluation des préférences dans les conversations sur le code. Distinguez-la des évaluations d’agents qui modifient et testent réellement des dépôts. Consultez aussi SWE-bench, Terminal-Bench et les résultats publiés de tests pratiques.

Ce que révèle ce classement

  • Les intervalles de confiance à 95% de gemini-4-argon-high, en 1re place, et de claude-fable-5-high, en 2e place, se chevauchent. Cette agrégation seule permet difficilement de déterminer leur ordre.
  • 14 autres modèles ont un intervalle de confiance qui chevauche celui du premier. Interprétez les petits écarts de classement avec prudence, en tenant compte du nombre de votes.
  • Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 5 modèles.
  • Le modèle en 1re place a reçu 1,230 votes, et ce classement comprend 408 modèles.

Code LMArena

Publié le 2026-10-02 · Récupéré le 2026-10-04

15001520154015601580
Googlegemini-4-argon-high
1560
Anthropicclaude-fable-5-high
1552
Anthropicclaude-opus-4-6-high
1551
Anthropicclaude-opus-4-7-high
1551
Ogpt-6-astra-max
1543
Ogpt-6.1-sol-max
1542
Moonshot AIkimi-k3-max
1541
Xiaomimimo-v2.6-pro
1540
Metamuse-spark-1.3-max
1539
Anthropicclaude-opus-5.5-high
1538
Anthropicclaude-sonnet-5.5-xhigh
1536
Ogpt-5.6-sol-xhigh
1534
Anthropicclaude-opus-5-high
1533
Anthropicclaude-opus-4-8-high
1533
Metamuse-spark-1.1
1533
Metamuse-spark-1.2 (xHigh)
1531
Anthropicclaude-fable-5.1-max
1531
Anthropicclaude-opus-4-5-20251101-high-32k
1530
Googlegemini-3.8-flash-high
1530
Metamuse-spark
1530

Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages. Les classements de conversation et de vision utilisent la correction du style et de la longueur (style control), comme le réglage par défaut du site LMArena.

Meilleur classement par entreprise

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-fable-5-high#2
  • OOpenAIgpt-6-astra-max#7
  • Moonshot AIMoonshot AIkimi-k3-max#9
  • XiaomiXiaomimimo-v2.6-pro#10
  • MetaMetamuse-spark-1.3-max#11
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#26
  • AlibabaAlibabaqwen3.7-max-preview#27
  • ZZ.aiglm-5.3-flash#29
Voir le tableau (top 50)
RangModèleDéveloppeurScoreIntervalle de confiance à 95%Nombre de votes
1#1Googlegemini-4-argon-highGoogle15601543–15771,230
2#2Anthropicclaude-fable-5-highAnthropic15521545–155910,038
3#3Anthropicclaude-opus-4-6-highAnthropic15511546–155720,235
4#4Anthropicclaude-opus-4-7-highAnthropic15511545–155618,521
5#5Anthropicclaude-opus-4-6Anthropic15481542–155322,901
6#6Anthropicclaude-opus-4-7Anthropic15461541–155218,728
7#7Ogpt-6-astra-maxOpenAI15431530–15562,135
8#8Ogpt-6.1-sol-maxOpenAI15421518–1566609
9#9Moonshot AIkimi-k3-maxMoonshot AI15411533–15497,285
10#10Xiaomimimo-v2.6-proXiaomi15401522–15581,103
11#11Metamuse-spark-1.3-maxMeta15391528–15493,307
12#12Anthropicclaude-opus-5.5-highAnthropic15381521–15561,060
13#13Anthropicclaude-sonnet-5.5-xhighAnthropic15361515–1558779
14#14Ogpt-5.6-sol-xhighOpenAI15341527–15419,943
15#15Anthropicclaude-opus-5-highAnthropic15331527–154015,559
16#16Anthropicclaude-opus-4-8-highAnthropic15331527–153917,395
17#17Metamuse-spark-1.1Meta15331526–153910,537
18#18Metamuse-spark-1.2 (xHigh)Meta15311514–15491,222
19#19Anthropicclaude-fable-5.1-maxAnthropic15311519–15442,358
20#20Anthropicclaude-opus-4-5-20251101-high-32kAnthropic15301523–15387,793
21#21Anthropicclaude-opus-5-maxAnthropic15301522–15387,382
22#22Googlegemini-3.8-flash-highGoogle15301522–15387,067
23#23Anthropicclaude-opus-4-8Anthropic15301524–153518,024
24#24Metamuse-sparkMeta15301520–15403,930
25#25Anthropicclaude-sonnet-4-6Anthropic15291523–153419,686
26#26DeepSeekdeepseek-v4.1-flash-maxDeepSeek15281516–15402,469
27#27Alibabaqwen3.7-max-previewAlibaba15241506–15421,165
28#28Alibabaqwen3.8-maxAlibaba15241516–15326,611
29#29Zglm-5.3-flashZ.ai15231515–15326,157
30#30Anthropicclaude-opus-4-5-20251101Anthropic15231518–152817,962
31#31Googlegemini-3.1-pro-previewGoogle15221517–152633,581
32#32Xiaomimimo-v2.5-proXiaomi15221516–152719,324
33#33Xiaomimimo-v2.6-flashXiaomi15211506–15371,508
34#34Zglm-5.3-maxZ.ai15211511–15304,424
35#35Ogpt-5.4-highOpenAI15211515–152717,566
36#36Ogpt-6-sol-maxOpenAI15201507–15342,071
37#37Anthropicclaude-sonnet-4-5-20250929-high-32kAnthropic15191514–152419,905
38#38Googlegemini-3.6-flash-highGoogle15191512–152610,350
39#39Anthropicclaude-sonnet-5-highAnthropic15191512–152512,377
40#40Ogpt-5.5-highOpenAI15191513–152419,110
41#41Googlegemini-3.7-flash-highGoogle15181510–15266,041
42#42Googlegemini-3-proGoogle15181511–15258,787
43#43Moonshot AIkimi-k2.6Moonshot AI15161509–152311,062
44#44Ogpt-5.6-terra-xhighOpenAI15151508–152210,166
45#45Ogpt-5.2-chat-latest-20260210OpenAI15151508–15229,629
46#46xgrok-4.5xAI15141507–152111,055
47#47ByteDancedola-seed-2.0-proByteDance15141509–151921,996
48#48Alibabaqwen3.5-max-previewAlibaba15141506–15226,358
49#49Ogpt-5.5-instantOpenAI15131506–15217,909
50#50Zglm-5.1Z.ai15131507–151816,060

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings