Valumigo

LMArena · Compréhension de documents

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Ce classement LMArena repose sur les votes comparant les réponses de deux modèles à une question posée après l’importation d’un document (PDF, etc.).

Comment lire le score : Il s’agit d’un score relatif estimé par la méthode Bradley–Terry. Si les intervalles de confiance à 95% sont larges, interprétez les écarts de classement avec prudence.

Points à surveiller : Les publications peuvent être plus espacées que pour les autres classements ; vérifiez la date de publication. Les résultats peuvent varier selon le type et la langue des documents.

Ce que révèle ce classement

  • Les intervalles de confiance à 95% de claude-opus-5-high, en 1re place, et de claude-fable-5.1-max, en 2e place, se chevauchent. Cette agrégation seule permet difficilement de déterminer leur ordre.
  • 3 autres modèles ont un intervalle de confiance qui chevauche celui du premier. Interprétez les petits écarts de classement avec prudence, en tenant compte du nombre de votes.
  • Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 7 modèles.
  • Le modèle en 1re place a reçu 8,794 votes, et ce classement comprend 44 modèles.

Compréhension de documents LMArena

Publié le 2026-09-13 · Récupéré le 2026-10-04

1440147015001530
Anthropicclaude-opus-5-high
1516
Anthropicclaude-fable-5.1-max
1513
Anthropicclaude-opus-4-6-high
1507
Anthropicclaude-fable-5
1496
Anthropicclaude-opus-4-7
1495
Ogpt-5.5
1486
Ogpt-5.6-sol-xhigh
1483
Anthropicclaude-sonnet-4-6
1482
Anthropicclaude-opus-4-8-high
1475
Ogpt-5.6-terra-xhigh
1472
Ogpt-5.4
1471
Metamuse-spark-1.3-max
1471
Ogpt-6-astra-max
1468
Anthropicclaude-sonnet-5-high
1466
Metamuse-spark-1.1
1465
Googlegemini-3.5-flash-medium
1463
Anthropicclaude-opus-4-5-20251101
1462
Ogpt-5.6-luna-xhigh
1457
Googlegemini-3.6-flash-high
1456
xgrok-4.6-high
1452

Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.

Meilleur classement par entreprise

  • AnthropicAnthropicclaude-opus-5-high#1
  • OOpenAIgpt-5.5#8
  • MetaMetamuse-spark-1.3-max#15
  • GoogleGooglegemini-3.5-flash-medium#20
  • xxAIgrok-4.6-high#25
  • Moonshot AIMoonshot AIkimi-k2.6#27
  • AlibabaAlibabaqwen3.7-plus#30
  • MiniMaxMiniMaxminimax-m3#32
  • ZZ.aiglm-5v-turbo#39
Voir le tableau (top 50)
RangModèleDéveloppeurScoreIntervalle de confiance à 95%Nombre de votes
1#1Anthropicclaude-opus-5-highAnthropic15161509–15238,794
2#2Anthropicclaude-fable-5.1-maxAnthropic15131497–15281,403
3#3Anthropicclaude-opus-4-6-highAnthropic15071501–151427,929
4#4Anthropicclaude-opus-4-6Anthropic15071501–151341,260
5#5Anthropicclaude-fable-5Anthropic14961488–15048,497
6#6Anthropicclaude-opus-4-7Anthropic14951489–150122,192
7#7Anthropicclaude-opus-4-7-highAnthropic14951488–150121,957
8#8Ogpt-5.5OpenAI14861479–149221,279
9#9Ogpt-5.5-highOpenAI14841478–149120,944
10#10Ogpt-5.6-sol-xhighOpenAI14831474–14924,818
11#11Anthropicclaude-sonnet-4-6Anthropic14821476–148857,813
12#12Anthropicclaude-opus-4-8-highAnthropic14751468–148211,551
13#13Ogpt-5.6-terra-xhighOpenAI14721463–14805,787
14#14Ogpt-5.4OpenAI14711465–147733,331
15#15Metamuse-spark-1.3-maxMeta14711452–14891,006
16#16Ogpt-6-astra-maxOpenAI14681453–14821,621
17#17Anthropicclaude-sonnet-5-highAnthropic14661458–14747,411
18#18Metamuse-spark-1.1Meta14651456–14744,885
19#19Anthropicclaude-opus-4-8Anthropic14641457–147112,128
20#20Googlegemini-3.5-flash-mediumGoogle14631455–14716,500
21#21Anthropicclaude-opus-4-5-20251101Anthropic14621452–14737,981
22#22Googlegemini-3.5-flash-highGoogle14611452–14714,061
23#23Ogpt-5.6-luna-xhighOpenAI14571449–14655,766
24#24Googlegemini-3.6-flash-highGoogle14561445–14672,975
25#25xgrok-4.6-highxAI14521440–14642,258
26#26xgrok-4.5xAI14521443–14614,965
27#27Moonshot AIkimi-k2.6Moonshot AI14511443–145811,291
28#28Anthropicclaude-sonnet-4-5-20250929Anthropic14501444–145631,455
29#29Metamuse-sparkMeta14441426–14621,084
30#30Alibabaqwen3.7-plusAlibaba14441435–14534,591
31#31Googlegemini-3.1-pro-previewGoogle14441439–144949,457
32#32MiniMaxminimax-m3MiniMax14351427–14436,314
33#33Googlegemini-3-proGoogle14341425–144310,769
34#34Moonshot AIkimi-k2.5-thinkingMoonshot AI14301423–143721,569
35#35Googlegemma-4-31bGoogle14251417–143212,326
36#36Googlegemini-2.5-proGoogle14211415–142725,110
37#37Anthropicclaude-haiku-4-5-20251001Anthropic14201414–142634,677
38#38xgrok-4.20-beta-0309-reasoningxAI14161409–142320,948
39#39Zglm-5v-turboZ.ai14161407–14246,995
40#40Googlegemini-3-flashGoogle14131404–14227,158
41#41Ogpt-5.2-highOpenAI14051395–14147,108
42#42Ogpt-5.1OpenAI14031394–14138,244
43#43Ogpt-5.5-instantOpenAI14031395–14118,497
44#44Ogpt-5.2OpenAI14011395–140728,212

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings