Valumigo

Classements des IA dans les benchmarks

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les derniers modèles en un coup d’œil

Les modèles sortis au cours des 120 derniers jours, classés par date de sortie, avec les scores des deux sources publiques sur une même ligne. Les scores indiquent le taux de bonnes réponses (%).

ModèleDate de sortieIndice globalGPQA DiamondFrontierMathHLEARC-AGI-2SWE-bench VerifiedClassement global LMArenaClassement LMArena : Français
OGPT-6.1 SolOpenAI2026-09-29–95.493.7–––#21Pas encore disponible
AnthropicClaude Sonnet 5.5Anthropic2026-09-28165.295.688.8–––#45Pas encore disponible
AnthropicClaude Opus 5.5Anthropic2026-09-22167.4–91.2–92.5–#4Pas encore disponible
OGPT-6 SolOpenAI2026-09-22–94.389.8–89.6–#64#39
OGPT-6 LunaOpenAI2026-09-22––78.9–59.3–#90#43
DeepSeekDeepSeek V4.1 FlashDeepSeek2026-09-09155–––––#38#86
OGPT-6 AstraOpenAI2026-09-03166.595.893.754.895–#29#26
GoogleGemini 3.8 FlashGoogle2026-09-02156.995.468.444.5––#8#18
MetaMuse Spark 1.3Meta2026-09-02156.9–74.4–––#9#1
AnthropicClaude Fable 5.1Anthropic2026-09-01164.8–90.246.590–#6#6
AlibabaQwen3.8 Max (0902)Alibaba2026-09-01155.292.365.6–––Pas encore disponiblePas encore disponible
ZGLM-5.3-FlashZ.ai2026-08-20151.9–––––#41#15
ZGLM-5.3Z.ai2026-08-14155.890.968.8–––#27#11
AlibabaQwen 3.8 27BAlibaba2026-08-14149.4–––––#99#76
GoogleGemini 3.7 FlashGoogle2026-08-13157.494.871.6–84.6–#17#8
DeepSeekDeepSeek V4 Pro 0813DeepSeek2026-08-13155.491.7––61.3–Pas encore disponiblePas encore disponible

Les nouveaux modèles doivent recueillir suffisamment de votes pour figurer dans les classements, surtout ceux par langue. Juste après leur sortie, ils peuvent afficher « Pas encore disponible ».

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Français LMArena

Publié le 2026-10-02 · Récupéré le 2026-10-04

14701500153015601590
Metamuse-spark-1.3-max
1534
Anthropicclaude-fable-5-high
1525
Metamuse-spark
1521
Anthropicclaude-opus-4-7-high
1519
Metamuse-spark-1.1
1517
Anthropicclaude-fable-5.1-max
1514
Googlegemini-3.6-flash-high
1513
Googlegemini-3.7-flash-high
1511
Anthropicclaude-opus-4-6-high
1510
Zglm-5.3-max
1510
Ogpt-5.6-sol-xhigh
1510
Moonshot AIkimi-k3-max
1509
Anthropicclaude-opus-4-8-high
1508
Zglm-5.3-flash
1507
Googlegemini-3-pro
1506
Anthropicclaude-opus-5-high
1506
Googlegemini-3.8-flash-high
1506
Alibabaqwen3.8-max
1505
xgrok-4.20-beta-0309-reasoning
1503
Googlegemini-3.1-pro-preview
1502

Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages. Les classements de conversation et de vision utilisent la correction du style et de la longueur (style control), comme le réglage par défaut du site LMArena.

Meilleur classement par entreprise

  • MetaMetamuse-spark-1.3-max#1
  • AnthropicAnthropicclaude-fable-5-high#2
  • GoogleGooglegemini-3.6-flash-high#7
  • ZZ.aiglm-5.3-max#11
  • OOpenAIgpt-5.6-sol-xhigh#12
  • Moonshot AIMoonshot AIkimi-k3-max#13
  • AlibabaAlibabaqwen3.8-max#19
  • xxAIgrok-4.20-beta-0309-reasoning#21
  • XiaomiXiaomimimo-v2.5-pro#31
Voir le tableau (top 50)
RangModèleDéveloppeurScoreIntervalle de confiance à 95%Nombre de votes
1#1Metamuse-spark-1.3-maxMeta15341501–1568333
2#2Anthropicclaude-fable-5-highAnthropic15251507–15441,276
3#3Metamuse-sparkMeta15211492–1549481
4#4Anthropicclaude-opus-4-7-highAnthropic15191505–15332,295
5#5Metamuse-spark-1.1Meta15171499–15361,219
6#6Anthropicclaude-fable-5.1-maxAnthropic15141482–1546379
7#7Googlegemini-3.6-flash-highGoogle15131493–15321,120
8#8Googlegemini-3.7-flash-highGoogle15111486–1536614
9#9Anthropicclaude-opus-4-7Anthropic15101496–15242,370
10#10Anthropicclaude-opus-4-6-highAnthropic15101496–15242,518
11#11Zglm-5.3-maxZ.ai15101483–1536532
12#12Ogpt-5.6-sol-xhighOpenAI15101490–15291,116
13#13Moonshot AIkimi-k3-maxMoonshot AI15091490–15291,012
14#14Anthropicclaude-opus-4-8-highAnthropic15081494–15232,173
15#15Zglm-5.3-flashZ.ai15071485–1530765
16#16Googlegemini-3-proGoogle15061486–1526968
17#17Anthropicclaude-opus-5-highAnthropic15061490–15221,759
18#18Googlegemini-3.8-flash-highGoogle15061483–1528789
19#19Alibabaqwen3.8-maxAlibaba15051483–1527778
20#20Anthropicclaude-opus-4-8Anthropic15041490–15192,208
21#21xgrok-4.20-beta-0309-reasoningxAI15031489–15182,225
22#22Googlegemini-3.1-pro-previewGoogle15021490–15133,972
23#23Ogpt-5.5OpenAI15011487–15152,508
24#24Ogpt-5.4-highOpenAI15001486–15142,396
25#25Anthropicclaude-opus-4-6Anthropic14971484–15112,682
26#26Ogpt-6-astra-maxOpenAI14971456–1537216
27#27Ogpt-5.5-highOpenAI14961482–15102,514
28#28Anthropicclaude-opus-5-maxAnthropic14961474–1518865
29#29Ogpt-5.6-terra-xhighOpenAI14951476–15141,146
30#30xgrok-4.20-beta1xAI14941473–1516861
31#31Xiaomimimo-v2.5-proXiaomi14931480–15072,587
32#32Ogpt-5.5-instantOpenAI14931473–15131,053
33#33Googlegemini-3-flashGoogle14921471–1514825
34#34xgrok-4.20-multi-agent-beta-0309xAI14921478–15072,272
35#35Googlegemini-3.5-flash-highGoogle14921475–15091,511
36#36xgrok-4.6-highxAI14911467–1516625
37#37Anthropicclaude-opus-4-5-20251101Anthropic14911476–15062,022
38#38Zglm-5.2-maxZ.ai14911474–15071,599
39#39Ogpt-6-sol-maxOpenAI14901452–1528252
40#40Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14901468–1511845
41#41ByteDancedola-seed-2.0-proByteDance14881474–15022,588
42#42Zglm-5.1Z.ai14861471–15012,013
43#43Ogpt-6-luna-maxOpenAI14861448–1523265
44#44Baiduernie-5.1Baidu14861468–15031,514
45#45Ogpt-5.4OpenAI14851471–15002,411
46#46DeepSeekdeepseek-v4-proDeepSeek14851470–14992,205
47#47Anthropicclaude-sonnet-5-highAnthropic14841467–15011,472
48#48xgrok-4.1-thinkingxAI14841468–15001,718
49#49Ogpt-5.2-chat-latest-20260210OpenAI14831463–15031,048
50#50Ogpt-5.6-luna-xhighOpenAI14821464–15011,212

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings