Artificial Analysis · Indice agentique
Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.
Comment lire ce classement
Ce qui est mesuré : Cet indice regroupe des évaluations réalisées par Artificial Analysis sur des tâches d’agent utilisant des outils et comportant plusieurs étapes.
Comment lire le score : Un indice plus élevé indique de meilleurs résultats aux évaluations d’utilisation d’outils et de tâches en plusieurs étapes.
Points à surveiller : Les résultats peuvent varier selon l’environnement d’évaluation et les outils disponibles. Ils ne reflètent donc pas nécessairement les performances des outils d’agent que vous utilisez réellement.
Ce que révèle ce classement
- Le meilleur score est de 57.9, obtenu par Claude Fable 5.1 (Max, Default Fallback).
- L’écart entre la 1re et la 5e place est de 4.9.
- Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 3 modèles.
Indice agentique Artificial Analysis
Publié le 2026-10-05 · Récupéré le 2026-10-05
Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.
Voir le tableau (top 60)
| Rang | Modèle | Développeur | Score |
|---|---|---|---|
| 1 | #1Claude Fable 5.1 (Max, Default Fallback) | Anthropic | 57.9 |
| 2 | #2Claude Opus 5 (Max) | Anthropic | 56.5 |
| 3 | #3Qwen3.8 Max (0902) | Alibaba | 56 |
| 4 | #4ZGLM-5.3 (Max) | Z.ai | 53.1 |
| 5 | #5xGrok 4.6 (High) | xAI | 53 |
| 6 | #6OGPT-6 Astra (max) | OpenAI | 51 |
| 7 | #7ZGLM 5.3 Flash | Z.ai | 50.9 |
| 8 | #8Claude Fable 5 (Max, Opus 4.8 Fallback) | Anthropic | 50.7 |
| 9 | #9OGPT-5.6 Sol (Max) | OpenAI | 50.2 |
| 10 | #10Qwen3.8 2.4T A95B | Alibaba | 50.1 |
| 11 | #11Kimi K3 (Max) | Moonshot AI | 50 |
| 12 | #12Qwen3.8 Max | Alibaba | 49.9 |
| 13 | #13Qwen3.8 27B (Xhigh) | Alibaba | 45.8 |
| 14 | #14Claude Sonnet 5 (Max) | Anthropic | 43.6 |
| 15 | #15Muse Spark 1.2 (Xhigh) | Meta | 43.2 |
| 16 | #16OGPT-5.6 Terra (Max) | OpenAI | 43.2 |
| 17 | #17OGPT-5.6 Luna (Max) | OpenAI | 42.1 |
| 18 | #18Claude Opus 4.8 (Max) | Anthropic | 41.9 |
| 19 | #19DeepSeek V4 Pro 0813 (Max) | DeepSeek | 41.3 |
| 20 | #20xGrok 4.5 (High) | xAI | 41.2 |
| 21 | #21DeepSeek V4 Flash 0731 (Max) | DeepSeek | 41 |
| 22 | #22Gemini 3.8 Flash (High) | 40.2 | |
| 23 | #23Claude Opus 4.7 (Max) | Anthropic | 38.6 |
| 24 | #24ZGLM-5.2 (Max) | Z.ai | 38.4 |
| 25 | #25OGPT-5.5 (Xhigh) | OpenAI | 36.4 |
| 26 | #26Gemini 3.7 Flash (High) | 35.2 | |
| 27 | #27Claude Sonnet 4.6 (Max) | Anthropic | 31.8 |
| 28 | #28MiniMax-M3 | MiniMax | 29.5 |
| 29 | #29Gemini 3.6 Flash (High) | 29 | |
| 30 | #30iLing-3.0-flash-VL | inclusionAI | 28.7 |
| 31 | #31iLing-3.0-flash-Fin | inclusionAI | 27.9 |
| 32 | #32DeepSeek V4 Flash 0420 (High) | DeepSeek | 26.3 |
| 33 | #33DeepSeek V4 Pro 0424 (Max) | DeepSeek | 26.3 |
| 34 | #34Gemini 3.5 Flash (High) | 26 | |
| 35 | #35Muse Spark 1.1 (Xhigh) | Meta | 25.8 |
| 36 | #36THy3 | Tencent | 24.1 |
| 37 | #37ZGLM-5.1 (Reasoning) | Z.ai | 23.9 |
| 38 | #38NNex-N2-Pro (Based on Qwen3.5-397B-A17B) | Nex Agi | 23.7 |
| 39 | #39TInkling Small | Thinkingmachines | 23.5 |
| 40 | #40TInkling (Xhigh) | Thinkingmachines | 22.5 |
| 41 | #41Qwen3.7 Max | Alibaba | 22.5 |
| 42 | #42MiMo-V2.5-Pro (Reasoning) | Xiaomi | 21.3 |
| 43 | #43Kimi K2.7 Code | Moonshot AI | 21 |
| 44 | #44Kimi K2.6 (Reasoning) | Moonshot AI | 20.5 |
| 45 | #45Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 20.1 |
| 46 | #46iLing 3.0 Flash | inclusionAI | 19.3 |
| 47 | #47Qwen3.6 27B (Reasoning) | Alibaba | 18.5 |
| 48 | #48OGPT-5.4 mini (Xhigh) | OpenAI | 17.9 |
| 49 | #49Qwen3.7 Plus | Alibaba | 17.5 |
| 50 | #50OGPT-5.4 nano (Xhigh) | OpenAI | 16 |
| 51 | #51Claude 4.5 Sonnet (Reasoning) | Anthropic | 15.8 |
| 52 | #52MiMo-V2.5 | Xiaomi | 15.8 |
| 53 | #53xGrok 4.3 (High) | xAI | 15.5 |
| 54 | #54MiniMax-M2.7 | MiniMax | 15.3 |
| 55 | #55Gemini 3.5 Flash-Lite | 14.3 | |
| 56 | #56MLongCat 2.0 | Meituan | 14 |
| 57 | #57Qwen3.6 35B A3B (Reasoning) | Alibaba | 13.1 |
| 58 | #58iRing-2.6-1T | inclusionAI | 10.7 |
| 59 | #59Qwen3.5 397B A17B (Reasoning) | Alibaba | 8.3 |
| 60 | #60Gemini 3.1 Pro Preview | 8.2 |
Source: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.
Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings