LMArena · Classement global des agents
Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.
Comment lire ce classement
Ce qui est mesuré : Ce classement repose sur les interactions dans Agent Arena de LMArena, où les utilisateurs confient des tâches réelles aux modèles en mode agent, comme le développement logiciel ou l’analyse financière. Les agents utilisent directement des outils comme bash, la recherche web et les opérations sur les fichiers.
Comment lire le score : Le score est une estimation causale appelée IPS(τ̂), avec 0 comme référence : plus il est élevé, plus l’utilisation du modèle a amélioré les résultats. Il combine cinq signaux : la confirmation de réussite par l’utilisateur, les compliments et les plaintes, la prise en compte des consignes de correction, la récupération après des erreurs bash et l’évitement des hallucinations liées aux outils.
Points à surveiller : L’échelle des scores diffère de celle du classement de conversation (méthode Bradley–Terry), ce qui empêche toute comparaison directe. Les modèles ayant peu d’observations présentent des intervalles de confiance larges.
Ce que révèle ce classement
- Les intervalles de confiance à 95% de Claude Fable 5.1 (Max), en 1re place, et de Claude Opus 5.5 (High), en 2e place, se chevauchent. Cette agrégation seule permet difficilement de déterminer leur ordre.
- 4 autres modèles ont un intervalle de confiance qui chevauche celui du premier. Interprétez les petits écarts de classement avec prudence, en tenant compte du nombre de votes.
- Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 6 modèles.
- Le modèle en tête compte 1,683,381 observations, et ce classement comprend 50 modèles.
Classement global des agents LMArena
Publié le 2026-10-02 · Récupéré le 2026-10-04
Les scores sont exprimés en IPS(τ̂), avec 0 comme référence ; plus le score est élevé, mieux c’est. Les lignes représentent les intervalles de confiance à 95%. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.
Meilleur classement par entreprise
- AnthropicClaude Fable 5.1 (Max)#1
- OOpenAIGPT 6 Astra (Max)#4
- GoogleGemini 4 Argon (High)#10
- Moonshot AIKimi K3 (Max)#14
- xxAIGrok 4.7 (xHigh)#16
- DeepSeekDeepseek V4.1 Flash (Max)#17
- MetaMuse Spark 1.3 (Max)#18
- TTencentHy4 preview#19
- ZZ.aiGLM 5.2 (Max)#20
Voir le tableau (top 50)
| Rang | Modèle | Développeur | Score | Intervalle de confiance à 95% | Nombre d’observations |
|---|---|---|---|---|---|
| 1 | #1Claude Fable 5.1 (Max) | Anthropic | 0.143 | 0.124–0.162 | 1,683,381 |
| 2 | #2Claude Opus 5.5 (High) | Anthropic | 0.138 | 0.116–0.16 | 754,031 |
| 3 | #3Claude Sonnet 5.5 (Max) | Anthropic | 0.125 | 0.094–0.156 | 483,211 |
| 4 | #4OGPT 6 Astra (Max) | OpenAI | 0.123 | 0.1–0.145 | 888,641 |
| 5 | #5OGPT 6.1 Sol (Max) | OpenAI | 0.112 | 0.085–0.14 | 379,372 |
| 6 | #6OGPT 6 Sol (Max) | OpenAI | 0.097 | 0.073–0.121 | 994,367 |
| 7 | #7Claude Opus 5 (High) | Anthropic | 0.087 | 0.073–0.101 | 3,531,760 |
| 8 | #8Claude Fable 5 (High) | Anthropic | 0.082 | 0.07–0.094 | 2,603,067 |
| 9 | #9Claude Opus 5 (Max) | Anthropic | 0.079 | 0.064–0.094 | 3,006,257 |
| 10 | #10Gemini 4 Argon (High) | 0.076 | 0.056–0.095 | 587,353 | |
| 11 | #11Claude Opus 4.8 (High) | Anthropic | 0.066 | 0.053–0.08 | 2,431,185 |
| 12 | #12OGPT 5.6 Sol (xHigh) | OpenAI | 0.065 | 0.052–0.077 | 4,348,715 |
| 13 | #13Claude Sonnet 5 (High) | Anthropic | 0.044 | 0.028–0.06 | 3,612,898 |
| 14 | #14Kimi K3 (Max) | Moonshot AI | 0.042 | 0.036–0.047 | 12,305,667 |
| 15 | #15OGPT 5.5 (xHigh) | OpenAI | 0.042 | 0.031–0.052 | 3,060,353 |
| 16 | #16xGrok 4.7 (xHigh) | xAI | 0.04 | 0.024–0.056 | 1,656,641 |
| 17 | #17Deepseek V4.1 Flash (Max) | DeepSeek | 0.04 | 0.036–0.045 | 16,932,092 |
| 18 | #18Muse Spark 1.3 (Max) | Meta | 0.04 | 0.034–0.046 | 6,139,426 |
| 19 | #19THy4 preview | Tencent | 0.04 | 0.032–0.047 | 5,108,255 |
| 20 | #20ZGLM 5.2 (Max) | Z.ai | 0.035 | 0.028–0.042 | 6,684,620 |
| 21 | #21Gemini 3.8 Flash (High) | 0.03 | 0.021–0.038 | 4,279,699 | |
| 22 | #22Qwen3.8 Max | Alibaba | 0.025 | 0.019–0.031 | 4,577,924 |
| 23 | #23ZGLM 5.3 (Max) | Z.ai | 0.024 | 0.017–0.03 | 9,155,315 |
| 24 | #24OGPT 6 Luna (Max) | OpenAI | 0.014 | 0.003–0.024 | 3,443,780 |
| 25 | #25xGrok 4.6 (xHigh) | xAI | 0.013 | 0.003–0.023 | 3,131,725 |
| 26 | #26xGrok 4.5 | xAI | 0.012 | 0.002–0.022 | 2,418,629 |
| 27 | #27DeepSeek V4 Pro (High) (0813) | DeepSeek | 0.012 | -0.005–0.028 | 797,284 |
| 28 | #28OGPT 5.4 (High) | OpenAI | 0.011 | 0.001–0.02 | 4,332,904 |
| 29 | #29OGPT 5.5 | OpenAI | 0.01 | 0.001–0.02 | 2,659,460 |
| 30 | #30SStep 5 Preview | StepFun | 0.005 | -0.01–0.02 | 1,125,598 |
| 31 | #31OGPT 5.6 Terra (xHigh) | OpenAI | 0.004 | -0.008–0.016 | 1,686,712 |
| 32 | #32ZGLM 5.3 Flash | Z.ai | -0.004 | -0.009–0 | 9,533,773 |
| 33 | #33MiMo V2.6 Flash | Xiaomi | -0.006 | -0.019–0.007 | 1,562,757 |
| 34 | #34Qwen3.8 Flash Next | Alibaba | -0.007 | -0.014–-0.001 | 11,249,221 |
| 35 | #35OGPT 5.6 Luna (xHigh) | OpenAI | -0.012 | -0.018–-0.005 | 4,028,029 |
| 36 | #36Gemini 3.7 Flash (High) | -0.015 | -0.022–-0.007 | 5,048,920 | |
| 37 | #37Qwen 3.8 27B | Alibaba | -0.017 | -0.023–-0.011 | 6,972,838 |
| 38 | #38Muse Spark 1.2 (xHigh) | Meta | -0.033 | -0.039–-0.026 | 2,884,900 |
| 39 | #39Muse Spark 1.1 | Meta | -0.049 | -0.053–-0.044 | 7,612,456 |
| 40 | #40Qwen3.7 Max | Alibaba | -0.051 | -0.061–-0.042 | 2,207,521 |
| 41 | #41THy3 | Tencent | -0.054 | -0.066–-0.042 | 1,171,568 |
| 42 | #42Minimax M3 | MiniMax | -0.069 | -0.078–-0.06 | 3,338,791 |
| 43 | #43Qwen3.7 Plus | Alibaba | -0.072 | -0.086–-0.057 | 1,144,063 |
| 44 | #44Mimo V2.5 Pro | Xiaomi | -0.075 | -0.084–-0.066 | 2,309,389 |
| 45 | #45Gemini 3.6 Flash (High) | -0.077 | -0.087–-0.066 | 1,523,777 | |
| 46 | #46Gemini 3.1 Pro Preview | -0.077 | -0.087–-0.067 | 3,446,977 | |
| 47 | #47TInkling Small | Thinky | -0.103 | -0.117–-0.089 | 503,653 |
| 48 | #48TInkling | Thinky | -0.109 | -0.119–-0.098 | 1,798,990 |
| 49 | #49Mistral Medium 3.5 | Mistral AI | -0.124 | -0.139–-0.109 | 437,621 |
| 50 | #50USolar Pro 4 | Upstage | -0.159 | -0.178–-0.141 | 427,705 |
Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings