Valumigo

LMArena · Classement global des agents

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Ce classement repose sur les interactions dans Agent Arena de LMArena, où les utilisateurs confient des tâches réelles aux modèles en mode agent, comme le développement logiciel ou l’analyse financière. Les agents utilisent directement des outils comme bash, la recherche web et les opérations sur les fichiers.

Comment lire le score : Le score est une estimation causale appelée IPS(τ̂), avec 0 comme référence : plus il est élevé, plus l’utilisation du modèle a amélioré les résultats. Il combine cinq signaux : la confirmation de réussite par l’utilisateur, les compliments et les plaintes, la prise en compte des consignes de correction, la récupération après des erreurs bash et l’évitement des hallucinations liées aux outils.

Points à surveiller : L’échelle des scores diffère de celle du classement de conversation (méthode Bradley–Terry), ce qui empêche toute comparaison directe. Les modèles ayant peu d’observations présentent des intervalles de confiance larges.

Ce que révèle ce classement

  • Les intervalles de confiance à 95% de Claude Fable 5.1 (Max), en 1re place, et de Claude Opus 5.5 (High), en 2e place, se chevauchent. Cette agrégation seule permet difficilement de déterminer leur ordre.
  • 4 autres modèles ont un intervalle de confiance qui chevauche celui du premier. Interprétez les petits écarts de classement avec prudence, en tenant compte du nombre de votes.
  • Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 6 modèles.
  • Le modèle en tête compte 1,683,381 observations, et ce classement comprend 50 modèles.

Classement global des agents LMArena

Publié le 2026-10-02 · Récupéré le 2026-10-04

00.040.080.120.160.2
AnthropicClaude Fable 5.1 (Max)
0.143
AnthropicClaude Opus 5.5 (High)
0.138
AnthropicClaude Sonnet 5.5 (Max)
0.125
OGPT 6 Astra (Max)
0.123
OGPT 6.1 Sol (Max)
0.112
OGPT 6 Sol (Max)
0.097
AnthropicClaude Opus 5 (High)
0.087
AnthropicClaude Fable 5 (High)
0.082
GoogleGemini 4 Argon (High)
0.076
AnthropicClaude Opus 4.8 (High)
0.066
OGPT 5.6 Sol (xHigh)
0.065
AnthropicClaude Sonnet 5 (High)
0.044
Moonshot AIKimi K3 (Max)
0.042
OGPT 5.5 (xHigh)
0.042
xGrok 4.7 (xHigh)
0.04
DeepSeekDeepseek V4.1 Flash (Max)
0.04
MetaMuse Spark 1.3 (Max)
0.04
THy4 preview
0.04
ZGLM 5.2 (Max)
0.035
GoogleGemini 3.8 Flash (High)
0.03

Les scores sont exprimés en IPS(τ̂), avec 0 comme référence ; plus le score est élevé, mieux c’est. Les lignes représentent les intervalles de confiance à 95%. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.

Meilleur classement par entreprise

  • AnthropicAnthropicClaude Fable 5.1 (Max)#1
  • OOpenAIGPT 6 Astra (Max)#4
  • GoogleGoogleGemini 4 Argon (High)#10
  • Moonshot AIMoonshot AIKimi K3 (Max)#14
  • xxAIGrok 4.7 (xHigh)#16
  • DeepSeekDeepSeekDeepseek V4.1 Flash (Max)#17
  • MetaMetaMuse Spark 1.3 (Max)#18
  • TTencentHy4 preview#19
  • ZZ.aiGLM 5.2 (Max)#20
Voir le tableau (top 50)
RangModèleDéveloppeurScoreIntervalle de confiance à 95%Nombre d’observations
1#1AnthropicClaude Fable 5.1 (Max)Anthropic0.1430.124–0.1621,683,381
2#2AnthropicClaude Opus 5.5 (High)Anthropic0.1380.116–0.16754,031
3#3AnthropicClaude Sonnet 5.5 (Max)Anthropic0.1250.094–0.156483,211
4#4OGPT 6 Astra (Max)OpenAI0.1230.1–0.145888,641
5#5OGPT 6.1 Sol (Max)OpenAI0.1120.085–0.14379,372
6#6OGPT 6 Sol (Max)OpenAI0.0970.073–0.121994,367
7#7AnthropicClaude Opus 5 (High)Anthropic0.0870.073–0.1013,531,760
8#8AnthropicClaude Fable 5 (High)Anthropic0.0820.07–0.0942,603,067
9#9AnthropicClaude Opus 5 (Max)Anthropic0.0790.064–0.0943,006,257
10#10GoogleGemini 4 Argon (High)Google0.0760.056–0.095587,353
11#11AnthropicClaude Opus 4.8 (High)Anthropic0.0660.053–0.082,431,185
12#12OGPT 5.6 Sol (xHigh)OpenAI0.0650.052–0.0774,348,715
13#13AnthropicClaude Sonnet 5 (High)Anthropic0.0440.028–0.063,612,898
14#14Moonshot AIKimi K3 (Max)Moonshot AI0.0420.036–0.04712,305,667
15#15OGPT 5.5 (xHigh)OpenAI0.0420.031–0.0523,060,353
16#16xGrok 4.7 (xHigh)xAI0.040.024–0.0561,656,641
17#17DeepSeekDeepseek V4.1 Flash (Max)DeepSeek0.040.036–0.04516,932,092
18#18MetaMuse Spark 1.3 (Max)Meta0.040.034–0.0466,139,426
19#19THy4 previewTencent0.040.032–0.0475,108,255
20#20ZGLM 5.2 (Max)Z.ai0.0350.028–0.0426,684,620
21#21GoogleGemini 3.8 Flash (High)Google0.030.021–0.0384,279,699
22#22AlibabaQwen3.8 MaxAlibaba0.0250.019–0.0314,577,924
23#23ZGLM 5.3 (Max)Z.ai0.0240.017–0.039,155,315
24#24OGPT 6 Luna (Max)OpenAI0.0140.003–0.0243,443,780
25#25xGrok 4.6 (xHigh)xAI0.0130.003–0.0233,131,725
26#26xGrok 4.5xAI0.0120.002–0.0222,418,629
27#27DeepSeekDeepSeek V4 Pro (High) (0813)DeepSeek0.012-0.005–0.028797,284
28#28OGPT 5.4 (High)OpenAI0.0110.001–0.024,332,904
29#29OGPT 5.5OpenAI0.010.001–0.022,659,460
30#30SStep 5 PreviewStepFun0.005-0.01–0.021,125,598
31#31OGPT 5.6 Terra (xHigh)OpenAI0.004-0.008–0.0161,686,712
32#32ZGLM 5.3 FlashZ.ai-0.004-0.009–09,533,773
33#33XiaomiMiMo V2.6 FlashXiaomi-0.006-0.019–0.0071,562,757
34#34AlibabaQwen3.8 Flash NextAlibaba-0.007-0.014–-0.00111,249,221
35#35OGPT 5.6 Luna (xHigh)OpenAI-0.012-0.018–-0.0054,028,029
36#36GoogleGemini 3.7 Flash (High)Google-0.015-0.022–-0.0075,048,920
37#37AlibabaQwen 3.8 27BAlibaba-0.017-0.023–-0.0116,972,838
38#38MetaMuse Spark 1.2 (xHigh)Meta-0.033-0.039–-0.0262,884,900
39#39MetaMuse Spark 1.1Meta-0.049-0.053–-0.0447,612,456
40#40AlibabaQwen3.7 MaxAlibaba-0.051-0.061–-0.0422,207,521
41#41THy3Tencent-0.054-0.066–-0.0421,171,568
42#42MiniMaxMinimax M3MiniMax-0.069-0.078–-0.063,338,791
43#43AlibabaQwen3.7 PlusAlibaba-0.072-0.086–-0.0571,144,063
44#44XiaomiMimo V2.5 ProXiaomi-0.075-0.084–-0.0662,309,389
45#45GoogleGemini 3.6 Flash (High)Google-0.077-0.087–-0.0661,523,777
46#46GoogleGemini 3.1 Pro PreviewGoogle-0.077-0.087–-0.0673,446,977
47#47TInkling SmallThinky-0.103-0.117–-0.089503,653
48#48TInklingThinky-0.109-0.119–-0.0981,798,990
49#49Mistral AIMistral Medium 3.5Mistral AI-0.124-0.139–-0.109437,621
50#50USolar Pro 4Upstage-0.159-0.178–-0.141427,705

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings