Valumigo

LMArena · Développement web

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Ce classement WebDev Arena repose sur la génération de pages ou d’applications web à partir d’une même demande, suivie d’une comparaison anonyme des résultats exécutés et d’un vote.

Comment lire le score : Il s’agit d’un score relatif des résultats exécutés préférés par les utilisateurs. Ce n’est ni un taux objectif de réussite aux tests fonctionnels ni une note de maintenabilité.

Points à surveiller : L’évaluation se limite aux frameworks pris en charge et aux conditions de génération et d’exécution. Elle ne garantit donc pas la capacité à maintenir de grands projets sur le long terme.

Ce que révèle ce classement

  • Les intervalles de confiance à 95% de claude-opus-5.5-max, en 1re place, et de gpt-6-astra-max, en 2e place, ne se chevauchent pas. Cette agrégation fournit des éléments relativement clairs en faveur de l’avance du premier.
  • Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 5 modèles.
  • Le modèle en 1re place a reçu 2,062 votes, et ce classement comprend 50 modèles.

Développement web LMArena

Publié le 2026-10-01 · Récupéré le 2026-10-04

156016201680174018001860
Anthropicclaude-opus-5.5-max
1815
Ogpt-6-astra-max
1788
Anthropicclaude-sonnet-5.5-xhigh
1786
Ogpt-6.1-sol-max
1758
Anthropicclaude-fable-5.1-max
1749
Anthropicclaude-opus-5-max
1695
Ogpt-6-sol-max
1689
Googlegemini-4-argon-high
1680
Alibabaqwen3.8-max
1671
Alibabaqwen3.8-max-0902
1670
Moonshot AIkimi-k3-max
1658
Metamuse-spark-1.3-max
1657
xgrok-4.7-xhigh
1638
Alibabaqwen3.8-flash-next
1637
Thy4-preview
1633
Anthropicclaude-fable-5-high
1625
Zglm-5.3-max
1623
DeepSeekdeepseek-v4.1-flash-max
1620
Ogpt-5.6-sol-xhigh (codex-harness)
1620
xgrok-4.6-high
1620

Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.

Meilleur classement par entreprise

  • AnthropicAnthropicclaude-opus-5.5-max#1
  • OOpenAIgpt-6-astra-max#2
  • GoogleGooglegemini-4-argon-high#9
  • AlibabaAlibabaqwen3.8-max#10
  • Moonshot AIMoonshot AIkimi-k3-max#13
  • MetaMetamuse-spark-1.3-max#14
  • xxAIgrok-4.7-xhigh#15
  • TTencenthy4-preview#17
  • ZZ.aiglm-5.3-max#20
Voir le tableau (top 50)
RangModèleDéveloppeurScoreIntervalle de confiance à 95%Nombre de votes
1#1Anthropicclaude-opus-5.5-maxAnthropic18151799–18312,062
2#2Ogpt-6-astra-maxOpenAI17881777–17986,123
3#3Anthropicclaude-sonnet-5.5-xhighAnthropic17861768–18041,531
4#4Ogpt-6.1-sol-maxOpenAI17581741–17751,620
5#5Anthropicclaude-fable-5.1-maxAnthropic17491740–17596,318
6#6Anthropicclaude-sonnet-5.5-highAnthropic17151702–17292,527
7#7Anthropicclaude-opus-5-maxAnthropic16951689–170116,954
8#8Ogpt-6-sol-maxOpenAI16891678–17003,411
9#9Googlegemini-4-argon-highGoogle16801666–16932,422
10#10Alibabaqwen3.8-maxAlibaba16711659–16833,454
11#11Alibabaqwen3.8-max-0902Alibaba16701662–16789,485
12#12Anthropicclaude-opus-5-highAnthropic16601654–166621,506
13#13Moonshot AIkimi-k3-maxMoonshot AI16581651–166416,513
14#14Metamuse-spark-1.3-maxMeta16571648–16657,249
15#15xgrok-4.7-xhighxAI16381626–16493,216
16#16Alibabaqwen3.8-flash-nextAlibaba16371629–16466,193
17#17Thy4-previewTencent16331624–16435,088
18#18Anthropicclaude-fable-5-highAnthropic16251619–163214,126
19#19Metamuse-spark-1.3 (xHigh)Meta16241616–16336,326
20#20Zglm-5.3-maxZ.ai16231615–16317,658
21#21DeepSeekdeepseek-v4.1-flash-maxDeepSeek16201609–16303,960
22#22Ogpt-5.6-sol-xhigh (codex-harness)OpenAI16201614–162617,128
23#23xgrok-4.6-highxAI16201612–16278,315
24#24Xiaomimimo-v2.6-proXiaomi16181606–16312,734
25#25Zglm-5.3-flashZ.ai16161608–162310,355
26#26Zglm-5.2-maxZ.ai16051599–161114,729
27#27Googlegemini-3.7-flash-highGoogle15921584–15999,624
28#28Alibabaqwen3.8-27bAlibaba15911584–159812,388
29#29Googlegemini-3.8-flash-highGoogle15831575–15918,524
30#30DeepSeekdeepseek-v4-pro-high-20260813DeepSeek15831573–15924,882
31#31DeepSeekdeepseek-v4-flash-highDeepSeek15811572–15905,040
32#32Ogpt-6-luna-maxOpenAI15791570–15876,429
33#33Sstep-5-preview-highStepFun15701557–15832,506
34#34Anthropicclaude-opus-4-7-highAnthropic15571552–156317,982
35#35Anthropicclaude-opus-4-8-highAnthropic15561550–156118,908
36#36Anthropicclaude-opus-4-7Anthropic15551550–156118,174
37#37xgrok-4.5xAI15521545–155811,393
38#38Anthropicclaude-opus-4-6-highAnthropic15461540–155119,519
39#39Metamuse-spark-1.1Meta15421534–15498,070
40#40Anthropicclaude-sonnet-5-highAnthropic15391533–154614,130
41#41Anthropicclaude-opus-4-6Anthropic15371532–154220,762
42#42Googlegemini-3.6-flash-highGoogle15361529–15448,823
43#43Anthropicclaude-opus-4-8Anthropic15341528–154017,880
44#44Metamuse-spark-1.2 (xHigh)Meta15321518–15452,183
45#45Anthropicclaude-sonnet-4-6Anthropic15211516–152722,960
46#46Ogpt-5.6-terra-xhigh (codex-harness)OpenAI15191513–152612,526
47#47Ogpt-5.6-luna-xhigh (codex-harness)OpenAI15181512–152412,776
48#48ByteDanceseed-2.1-pro-previewByteDance15171511–152313,312
49#49Alibabaqwen3.7-max-20260517Alibaba15151508–15228,922
50#50Ogpt-5.5-xhigh (codex-harness)OpenAI15121506–151815,873

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings