LMArena · Compréhension de documents
Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.
Comment lire ce classement
Ce qui est mesuré : Ce classement LMArena repose sur les votes comparant les réponses de deux modèles à une question posée après l’importation d’un document (PDF, etc.).
Comment lire le score : Il s’agit d’un score relatif estimé par la méthode Bradley–Terry. Si les intervalles de confiance à 95% sont larges, interprétez les écarts de classement avec prudence.
Points à surveiller : Les publications peuvent être plus espacées que pour les autres classements ; vérifiez la date de publication. Les résultats peuvent varier selon le type et la langue des documents.
Ce que révèle ce classement
- Les intervalles de confiance à 95% de claude-opus-5-high, en 1re place, et de claude-fable-5.1-max, en 2e place, se chevauchent. Cette agrégation seule permet difficilement de déterminer leur ordre.
- 3 autres modèles ont un intervalle de confiance qui chevauche celui du premier. Interprétez les petits écarts de classement avec prudence, en tenant compte du nombre de votes.
- Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 7 modèles.
- Le modèle en 1re place a reçu 8,794 votes, et ce classement comprend 44 modèles.
Compréhension de documents LMArena
Publié le 2026-09-13 · Récupéré le 2026-10-04
Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.
Meilleur classement par entreprise
- Anthropicclaude-opus-5-high#1
- OOpenAIgpt-5.5#8
- Metamuse-spark-1.3-max#15
- Googlegemini-3.5-flash-medium#20
- xxAIgrok-4.6-high#25
- Moonshot AIkimi-k2.6#27
- Alibabaqwen3.7-plus#30
- MiniMaxminimax-m3#32
- ZZ.aiglm-5v-turbo#39
Voir le tableau (top 50)
| Rang | Modèle | Développeur | Score | Intervalle de confiance à 95% | Nombre de votes |
|---|---|---|---|---|---|
| 1 | #1claude-opus-5-high | Anthropic | 1516 | 1509–1523 | 8,794 |
| 2 | #2claude-fable-5.1-max | Anthropic | 1513 | 1497–1528 | 1,403 |
| 3 | #3claude-opus-4-6-high | Anthropic | 1507 | 1501–1514 | 27,929 |
| 4 | #4claude-opus-4-6 | Anthropic | 1507 | 1501–1513 | 41,260 |
| 5 | #5claude-fable-5 | Anthropic | 1496 | 1488–1504 | 8,497 |
| 6 | #6claude-opus-4-7 | Anthropic | 1495 | 1489–1501 | 22,192 |
| 7 | #7claude-opus-4-7-high | Anthropic | 1495 | 1488–1501 | 21,957 |
| 8 | #8Ogpt-5.5 | OpenAI | 1486 | 1479–1492 | 21,279 |
| 9 | #9Ogpt-5.5-high | OpenAI | 1484 | 1478–1491 | 20,944 |
| 10 | #10Ogpt-5.6-sol-xhigh | OpenAI | 1483 | 1474–1492 | 4,818 |
| 11 | #11claude-sonnet-4-6 | Anthropic | 1482 | 1476–1488 | 57,813 |
| 12 | #12claude-opus-4-8-high | Anthropic | 1475 | 1468–1482 | 11,551 |
| 13 | #13Ogpt-5.6-terra-xhigh | OpenAI | 1472 | 1463–1480 | 5,787 |
| 14 | #14Ogpt-5.4 | OpenAI | 1471 | 1465–1477 | 33,331 |
| 15 | #15muse-spark-1.3-max | Meta | 1471 | 1452–1489 | 1,006 |
| 16 | #16Ogpt-6-astra-max | OpenAI | 1468 | 1453–1482 | 1,621 |
| 17 | #17claude-sonnet-5-high | Anthropic | 1466 | 1458–1474 | 7,411 |
| 18 | #18muse-spark-1.1 | Meta | 1465 | 1456–1474 | 4,885 |
| 19 | #19claude-opus-4-8 | Anthropic | 1464 | 1457–1471 | 12,128 |
| 20 | #20gemini-3.5-flash-medium | 1463 | 1455–1471 | 6,500 | |
| 21 | #21claude-opus-4-5-20251101 | Anthropic | 1462 | 1452–1473 | 7,981 |
| 22 | #22gemini-3.5-flash-high | 1461 | 1452–1471 | 4,061 | |
| 23 | #23Ogpt-5.6-luna-xhigh | OpenAI | 1457 | 1449–1465 | 5,766 |
| 24 | #24gemini-3.6-flash-high | 1456 | 1445–1467 | 2,975 | |
| 25 | #25xgrok-4.6-high | xAI | 1452 | 1440–1464 | 2,258 |
| 26 | #26xgrok-4.5 | xAI | 1452 | 1443–1461 | 4,965 |
| 27 | #27kimi-k2.6 | Moonshot AI | 1451 | 1443–1458 | 11,291 |
| 28 | #28claude-sonnet-4-5-20250929 | Anthropic | 1450 | 1444–1456 | 31,455 |
| 29 | #29muse-spark | Meta | 1444 | 1426–1462 | 1,084 |
| 30 | #30qwen3.7-plus | Alibaba | 1444 | 1435–1453 | 4,591 |
| 31 | #31gemini-3.1-pro-preview | 1444 | 1439–1449 | 49,457 | |
| 32 | #32minimax-m3 | MiniMax | 1435 | 1427–1443 | 6,314 |
| 33 | #33gemini-3-pro | 1434 | 1425–1443 | 10,769 | |
| 34 | #34kimi-k2.5-thinking | Moonshot AI | 1430 | 1423–1437 | 21,569 |
| 35 | #35gemma-4-31b | 1425 | 1417–1432 | 12,326 | |
| 36 | #36gemini-2.5-pro | 1421 | 1415–1427 | 25,110 | |
| 37 | #37claude-haiku-4-5-20251001 | Anthropic | 1420 | 1414–1426 | 34,677 |
| 38 | #38xgrok-4.20-beta-0309-reasoning | xAI | 1416 | 1409–1423 | 20,948 |
| 39 | #39Zglm-5v-turbo | Z.ai | 1416 | 1407–1424 | 6,995 |
| 40 | #40gemini-3-flash | 1413 | 1404–1422 | 7,158 | |
| 41 | #41Ogpt-5.2-high | OpenAI | 1405 | 1395–1414 | 7,108 |
| 42 | #42Ogpt-5.1 | OpenAI | 1403 | 1394–1413 | 8,244 |
| 43 | #43Ogpt-5.5-instant | OpenAI | 1403 | 1395–1411 | 8,497 |
| 44 | #44Ogpt-5.2 | OpenAI | 1401 | 1395–1407 | 28,212 |
Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings