Valumigo

LMArena · Compréhension d’images (vision)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Ce classement de compréhension d’images repose sur des votes comparant les réponses de deux modèles à des questions contenant des images.

Comment lire le score : Il s’agit d’un score relatif des réponses préférées par les utilisateurs. Ce n’est pas un taux objectif de bonnes réponses pour l’interprétation de photos, de graphiques ou de captures d’écran.

Points à surveiller : Vérifiez séparément l’exactitude dans les conditions dont vous avez besoin, comme la lecture de petits caractères dans des documents ou la reconnaissance du coréen (Hangul).

Ce que révèle ce classement

  • Les intervalles de confiance à 95% de claude-fable-5-high, en 1re place, et de qwen3.8-max, en 2e place, se chevauchent. Cette agrégation seule permet difficilement de déterminer leur ordre.
  • 11 autres modèles ont un intervalle de confiance qui chevauche celui du premier. Interprétez les petits écarts de classement avec prudence, en tenant compte du nombre de votes.
  • Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 5 modèles.
  • Le modèle en 1re place a reçu 13,709 votes, et ce classement comprend 50 modèles.

Compréhension d’images (vision) LMArena

Publié le 2026-10-02 · Récupéré le 2026-10-04

1260128013001320
Anthropicclaude-fable-5-high
1309
Alibabaqwen3.8-max
1301
Anthropicclaude-opus-4-6-high
1299
Anthropicclaude-opus-4-7
1298
Googlegemini-3.7-flash-high
1296
Metamuse-spark
1294
Metamuse-spark-1.2 (xHigh)
1293
Ogpt-6.1-sol-max
1291
Googlegemini-3.8-flash-high
1290
Metamuse-spark-1.3-max
1290
Googlegemini-3-pro
1289
Anthropicclaude-opus-5-high
1289
Anthropicclaude-fable-5.1-max
1288
Ogpt-5.5
1287
Anthropicclaude-opus-4-8-high
1286
Ogpt-5.6-sol-xhigh
1285
Googlegemini-3.5-flash-medium
1284
Ogpt-6-astra-max
1284
Ogpt-5.4-high
1284
Metamuse-spark-1.1
1281

Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages. Les classements de conversation et de vision utilisent la correction du style et de la longueur (style control), comme le réglage par défaut du site LMArena.

Meilleur classement par entreprise

  • AnthropicAnthropicclaude-fable-5-high#1
  • AlibabaAlibabaqwen3.8-max#2
  • GoogleGooglegemini-3.7-flash-high#6
  • MetaMetamuse-spark#8
  • OOpenAIgpt-6.1-sol-max#10
  • xxAIgrok-4.5#28
  • ZZ.aiglm-5.3-flash#30
  • Moonshot AIMoonshot AIkimi-k2.6#38
  • SStepFunStep 5 Preview#45
Voir le tableau (top 50)
RangModèleDéveloppeurScoreIntervalle de confiance à 95%Nombre de votes
1#1Anthropicclaude-fable-5-highAnthropic13091301–131613,709
2#2Alibabaqwen3.8-maxAlibaba13011294–130910,040
3#3Anthropicclaude-opus-4-6-highAnthropic12991293–130622,328
4#4Anthropicclaude-opus-4-7Anthropic12981292–130523,169
5#5Anthropicclaude-opus-4-7-highAnthropic12981291–130422,755
6#6Googlegemini-3.7-flash-highGoogle12961286–13063,814
7#7Anthropicclaude-opus-4-6Anthropic12941288–130126,869
8#8Metamuse-sparkMeta12941284–13035,868
9#9Metamuse-spark-1.2 (xHigh)Meta12931279–13071,951
10#10Ogpt-6.1-sol-maxOpenAI12911275–13071,408
11#11Googlegemini-3.8-flash-highGoogle12901279–13023,086
12#12Metamuse-spark-1.3-maxMeta12901280–13013,843
13#13Googlegemini-3-proGoogle12891282–129713,620
14#14Anthropicclaude-opus-5-highAnthropic12891282–129615,900
15#15Anthropicclaude-fable-5.1-maxAnthropic12881278–12984,312
16#16Ogpt-5.5OpenAI12871281–129227,223
17#17Anthropicclaude-opus-4-8-highAnthropic12861280–129318,350
18#18Ogpt-5.6-sol-xhighOpenAI12851277–129210,421
19#19Googlegemini-3.5-flash-mediumGoogle12841277–129112,467
20#20Ogpt-6-astra-maxOpenAI12841273–12963,175
21#21Googlegemini-3.5-flash-highGoogle12841277–129112,336
22#22Ogpt-5.4-highOpenAI12841278–129029,177
23#23Metamuse-spark-1.1Meta12811274–128811,255
24#24Ogpt-5.5-highOpenAI12811275–128725,488
25#25Googlegemini-3.6-flash-highGoogle12801271–12887,392
26#26Anthropicclaude-opus-4-8Anthropic12791273–128618,857
27#27Googlegemini-3.1-pro-previewGoogle12791274–128545,558
28#28xgrok-4.5xAI12791272–128611,039
29#29Ogpt-5.4OpenAI12791272–128522,828
30#30Zglm-5.3-flashZ.ai12781269–12885,479
31#31Ogpt-5.2-chat-latest-20260210OpenAI12781271–128516,480
32#32Ogpt-5.5-instantOpenAI12761267–12857,605
33#33Anthropicclaude-sonnet-4-6Anthropic12751269–128127,429
34#34Googlegemini-3-flashGoogle12731268–127839,142
35#35Anthropicclaude-sonnet-5.5-xhighAnthropic12681253–12841,608
36#36Ogpt-5.6-terra-xhighOpenAI12681261–127610,292
37#37Alibabaqwen3.7-plusAlibaba12651259–127213,065
38#38Moonshot AIkimi-k2.6Moonshot AI12651258–127216,387
39#39Anthropicclaude-sonnet-5-highAnthropic12641257–127113,029
40#40Googlegemini-3.5-flash-liteGoogle12641256–12737,579
41#41xgrok-4.6-highxAI12631254–12735,736
42#42Googlegemma-4-31bGoogle12621256–126839,111
43#43Googlegemini-3-flash (thinking-minimal)Google12601254–126537,184
44#44Ogpt-5.6-luna-xhighOpenAI12601252–126710,446
45#45SStep 5 PreviewStepFun12601235–1284604
46#46ByteDancedola-seed-2.0-proByteDance12571249–126410,981
47#47xgrok-4.20-beta-0309-reasoningxAI12551249–126226,832
48#48Moonshot AIkimi-k2.5-thinkingMoonshot AI12521246–125828,326
49#49Ogpt-5.1-highOpenAI12511244–12599,842
50#50Ogpt-5.4-mini-highOpenAI12511244–125725,734

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings