Classements des IA dans les benchmarks
Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.
Les derniers modèles en un coup d’œil
Les modèles sortis au cours des 120 derniers jours, classés par date de sortie, avec les scores des deux sources publiques sur une même ligne. Les scores indiquent le taux de bonnes réponses (%).
| Modèle | Date de sortie | Indice global | GPQA Diamond | FrontierMath | HLE | ARC-AGI-2 | SWE-bench Verified | Classement global LMArena | Classement LMArena : Français |
|---|---|---|---|---|---|---|---|---|---|
| OGPT-6.1 SolOpenAI | 2026-09-29 | – | 95.4 | 93.7 | – | – | – | #21 | Pas encore disponible |
| Claude Sonnet 5.5Anthropic | 2026-09-28 | 165.2 | 95.6 | 88.8 | – | – | – | #45 | Pas encore disponible |
| Claude Opus 5.5Anthropic | 2026-09-22 | 167.4 | – | 91.2 | – | 92.5 | – | #4 | Pas encore disponible |
| OGPT-6 SolOpenAI | 2026-09-22 | – | 94.3 | 89.8 | – | 89.6 | – | #64 | #39 |
| OGPT-6 LunaOpenAI | 2026-09-22 | – | – | 78.9 | – | 59.3 | – | #90 | #43 |
| DeepSeek V4.1 FlashDeepSeek | 2026-09-09 | 155 | – | – | – | – | – | #38 | #86 |
| OGPT-6 AstraOpenAI | 2026-09-03 | 166.5 | 95.8 | 93.7 | 54.8 | 95 | – | #29 | #26 |
| Gemini 3.8 FlashGoogle | 2026-09-02 | 156.9 | 95.4 | 68.4 | 44.5 | – | – | #8 | #18 |
| Muse Spark 1.3Meta | 2026-09-02 | 156.9 | – | 74.4 | – | – | – | #9 | #1 |
| Claude Fable 5.1Anthropic | 2026-09-01 | 164.8 | – | 90.2 | 46.5 | 90 | – | #6 | #6 |
| Qwen3.8 Max (0902)Alibaba | 2026-09-01 | 155.2 | 92.3 | 65.6 | – | – | – | Pas encore disponible | Pas encore disponible |
| ZGLM-5.3-FlashZ.ai | 2026-08-20 | 151.9 | – | – | – | – | – | #41 | #15 |
| ZGLM-5.3Z.ai | 2026-08-14 | 155.8 | 90.9 | 68.8 | – | – | – | #27 | #11 |
| Qwen 3.8 27BAlibaba | 2026-08-14 | 149.4 | – | – | – | – | – | #99 | #76 |
| Gemini 3.7 FlashGoogle | 2026-08-13 | 157.4 | 94.8 | 71.6 | – | 84.6 | – | #17 | #8 |
| DeepSeek V4 Pro 0813DeepSeek | 2026-08-13 | 155.4 | 91.7 | – | – | 61.3 | – | Pas encore disponible | Pas encore disponible |
Les nouveaux modèles doivent recueillir suffisamment de votes pour figurer dans les classements, surtout ceux par langue. Juste après leur sortie, ils peuvent afficher « Pas encore disponible ».
Français LMArena
Publié le 2026-10-02 · Récupéré le 2026-10-04
Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages. Les classements de conversation et de vision utilisent la correction du style et de la longueur (style control), comme le réglage par défaut du site LMArena.
Meilleur classement par entreprise
- Metamuse-spark-1.3-max#1
- Anthropicclaude-fable-5-high#2
- Googlegemini-3.6-flash-high#7
- ZZ.aiglm-5.3-max#11
- OOpenAIgpt-5.6-sol-xhigh#12
- Moonshot AIkimi-k3-max#13
- Alibabaqwen3.8-max#19
- xxAIgrok-4.20-beta-0309-reasoning#21
- Xiaomimimo-v2.5-pro#31
Voir le tableau (top 50)
| Rang | Modèle | Développeur | Score | Intervalle de confiance à 95% | Nombre de votes |
|---|---|---|---|---|---|
| 1 | #1muse-spark-1.3-max | Meta | 1534 | 1501–1568 | 333 |
| 2 | #2claude-fable-5-high | Anthropic | 1525 | 1507–1544 | 1,276 |
| 3 | #3muse-spark | Meta | 1521 | 1492–1549 | 481 |
| 4 | #4claude-opus-4-7-high | Anthropic | 1519 | 1505–1533 | 2,295 |
| 5 | #5muse-spark-1.1 | Meta | 1517 | 1499–1536 | 1,219 |
| 6 | #6claude-fable-5.1-max | Anthropic | 1514 | 1482–1546 | 379 |
| 7 | #7gemini-3.6-flash-high | 1513 | 1493–1532 | 1,120 | |
| 8 | #8gemini-3.7-flash-high | 1511 | 1486–1536 | 614 | |
| 9 | #9claude-opus-4-7 | Anthropic | 1510 | 1496–1524 | 2,370 |
| 10 | #10claude-opus-4-6-high | Anthropic | 1510 | 1496–1524 | 2,518 |
| 11 | #11Zglm-5.3-max | Z.ai | 1510 | 1483–1536 | 532 |
| 12 | #12Ogpt-5.6-sol-xhigh | OpenAI | 1510 | 1490–1529 | 1,116 |
| 13 | #13kimi-k3-max | Moonshot AI | 1509 | 1490–1529 | 1,012 |
| 14 | #14claude-opus-4-8-high | Anthropic | 1508 | 1494–1523 | 2,173 |
| 15 | #15Zglm-5.3-flash | Z.ai | 1507 | 1485–1530 | 765 |
| 16 | #16gemini-3-pro | 1506 | 1486–1526 | 968 | |
| 17 | #17claude-opus-5-high | Anthropic | 1506 | 1490–1522 | 1,759 |
| 18 | #18gemini-3.8-flash-high | 1506 | 1483–1528 | 789 | |
| 19 | #19qwen3.8-max | Alibaba | 1505 | 1483–1527 | 778 |
| 20 | #20claude-opus-4-8 | Anthropic | 1504 | 1490–1519 | 2,208 |
| 21 | #21xgrok-4.20-beta-0309-reasoning | xAI | 1503 | 1489–1518 | 2,225 |
| 22 | #22gemini-3.1-pro-preview | 1502 | 1490–1513 | 3,972 | |
| 23 | #23Ogpt-5.5 | OpenAI | 1501 | 1487–1515 | 2,508 |
| 24 | #24Ogpt-5.4-high | OpenAI | 1500 | 1486–1514 | 2,396 |
| 25 | #25claude-opus-4-6 | Anthropic | 1497 | 1484–1511 | 2,682 |
| 26 | #26Ogpt-6-astra-max | OpenAI | 1497 | 1456–1537 | 216 |
| 27 | #27Ogpt-5.5-high | OpenAI | 1496 | 1482–1510 | 2,514 |
| 28 | #28claude-opus-5-max | Anthropic | 1496 | 1474–1518 | 865 |
| 29 | #29Ogpt-5.6-terra-xhigh | OpenAI | 1495 | 1476–1514 | 1,146 |
| 30 | #30xgrok-4.20-beta1 | xAI | 1494 | 1473–1516 | 861 |
| 31 | #31mimo-v2.5-pro | Xiaomi | 1493 | 1480–1507 | 2,587 |
| 32 | #32Ogpt-5.5-instant | OpenAI | 1493 | 1473–1513 | 1,053 |
| 33 | #33gemini-3-flash | 1492 | 1471–1514 | 825 | |
| 34 | #34xgrok-4.20-multi-agent-beta-0309 | xAI | 1492 | 1478–1507 | 2,272 |
| 35 | #35gemini-3.5-flash-high | 1492 | 1475–1509 | 1,511 | |
| 36 | #36xgrok-4.6-high | xAI | 1491 | 1467–1516 | 625 |
| 37 | #37claude-opus-4-5-20251101 | Anthropic | 1491 | 1476–1506 | 2,022 |
| 38 | #38Zglm-5.2-max | Z.ai | 1491 | 1474–1507 | 1,599 |
| 39 | #39Ogpt-6-sol-max | OpenAI | 1490 | 1452–1528 | 252 |
| 40 | #40claude-opus-4-5-20251101-high-32k | Anthropic | 1490 | 1468–1511 | 845 |
| 41 | #41dola-seed-2.0-pro | ByteDance | 1488 | 1474–1502 | 2,588 |
| 42 | #42Zglm-5.1 | Z.ai | 1486 | 1471–1501 | 2,013 |
| 43 | #43Ogpt-6-luna-max | OpenAI | 1486 | 1448–1523 | 265 |
| 44 | #44ernie-5.1 | Baidu | 1486 | 1468–1503 | 1,514 |
| 45 | #45Ogpt-5.4 | OpenAI | 1485 | 1471–1500 | 2,411 |
| 46 | #46deepseek-v4-pro | DeepSeek | 1485 | 1470–1499 | 2,205 |
| 47 | #47claude-sonnet-5-high | Anthropic | 1484 | 1467–1501 | 1,472 |
| 48 | #48xgrok-4.1-thinking | xAI | 1484 | 1468–1500 | 1,718 |
| 49 | #49Ogpt-5.2-chat-latest-20260210 | OpenAI | 1483 | 1463–1503 | 1,048 |
| 50 | #50Ogpt-5.6-luna-xhigh | OpenAI | 1482 | 1464–1501 | 1,212 |
Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings