Valumigo

LMArena · Recherche par IA

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Ce classement repose sur des votes comparant les réponses de systèmes d’IA utilisant la recherche web. Il couvre diverses demandes nécessitant une recherche, dont des questions sur des informations récentes.

Comment lire le score : Il s’agit d’un score relatif des réponses de recherche préférées par les utilisateurs. Distinguez le score de préférence de base de l’indicateur ajusté Factuality, qui intègre aussi l’exactitude factuelle.

Points à surveiller : Vérifiez la date de mise à jour, les outils de recherche et les conditions d’exécution. N’interprétez pas ce score comme l’exactitude de toutes les réponses de recherche d’un service réel.

Ce que révèle ce classement

  • Les intervalles de confiance à 95% de gpt-5.6-sol-xhigh, en 1re place, et de claude-opus-4-6-search, en 2e place, se chevauchent. Cette agrégation seule permet difficilement de déterminer leur ordre.
  • Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 4 modèles.
  • Le modèle en 1re place a reçu 29,663 votes, et ce classement comprend 34 modèles.

Recherche par IA LMArena

Publié le 2026-08-24 · Récupéré le 2026-10-04

114011701200123012601290
Ogpt-5.6-sol-xhigh
1257
Anthropicclaude-opus-4-6-search
1253
Ogpt-5.5-search
1242
Anthropicclaude-opus-4-7
1233
Anthropicclaude-fable-5
1230
Baiduernie-5.1
1227
Anthropicclaude-sonnet-4-6-search
1221
xgrok-4.5
1213
Googlegemini-3.1-pro-grounding
1210
Googlegemini-3-pro-grounding
1207
Ogpt-5.2-search
1207
Anthropicclaude-opus-4-8
1204
xgrok-4.20-multi-agent-beta-0309
1204
Ogpt-5.1-search
1199
Googlegemini-3-flash-grounding
1198
Ogpt-5.4-search
1197
Anthropicclaude-sonnet-5-search
1194
xgrok-4.20-beta1
1189
Anthropicclaude-opus-4-5-search
1180
Ogpt-5.2-search-non-reasoning
1172

Les points indiquent les scores, les lignes horizontales les intervalles de confiance à 95 %. Si les lignes se chevauchent, les performances sont globalement similaires. Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.

Meilleur classement par entreprise

  • OOpenAIgpt-5.6-sol-xhigh#1
  • AnthropicAnthropicclaude-opus-4-6-search#2
  • BaiduBaiduernie-5.1#6
  • xxAIgrok-4.5#8
  • GoogleGooglegemini-3.1-pro-grounding#9
  • PerplexityPerplexityppl-sonar-reasoning-pro-high#29
  • DDiffbotdiffbot-small-xl#33
Voir le tableau (top 50)
RangModèleDéveloppeurScoreIntervalle de confiance à 95%Nombre de votes
1#1Ogpt-5.6-sol-xhighOpenAI12571250–126529,663
2#2Anthropicclaude-opus-4-6-searchAnthropic12531248–1258134,699
3#3Ogpt-5.5-searchOpenAI12421237–124789,873
4#4Anthropicclaude-opus-4-7Anthropic12331228–123991,394
5#5Anthropicclaude-fable-5Anthropic12301222–123841,795
6#6Baiduernie-5.1Baidu12271217–12373,788
7#7Anthropicclaude-sonnet-4-6-searchAnthropic12211216–1226134,905
8#8xgrok-4.5xAI12131206–122031,505
9#9Googlegemini-3.1-pro-groundingGoogle12101205–1216113,282
10#10Googlegemini-3-pro-groundingGoogle12071202–121337,024
11#11Ogpt-5.2-searchOpenAI12071201–121352,712
12#12Anthropicclaude-opus-4-8Anthropic12041198–121170,998
13#13xgrok-4.20-multi-agent-beta-0309xAI12041199–1209109,553
14#14Ogpt-5.1-searchOpenAI11991194–120559,909
15#15Googlegemini-3-flash-groundingGoogle11981193–1203149,334
16#16Ogpt-5.4-searchOpenAI11971192–1203110,116
17#17Anthropicclaude-sonnet-5-searchAnthropic11941187–120140,230
18#18xgrok-4.20-beta1xAI11891183–119553,921
19#19Anthropicclaude-opus-4-5-searchAnthropic11801174–118561,573
20#20Ogpt-5.2-search-non-reasoningOpenAI11721167–117875,658
21#21xgrok-4-1-fast-searchxAI11711166–117681,507
22#22xgrok-4-fast-searchxAI11711166–117541,794
23#23xgrok-4.3xAI11651160–117091,483
24#24Anthropicclaude-sonnet-4-5-searchAnthropic11581153–1163127,378
25#25Anthropicclaude-opus-4-1-searchAnthropic11481143–115376,933
26#26Oo3-searchOpenAI11441139–115020,644
27#27Googlegemini-2.5-pro-groundingGoogle11421137–114683,404
28#28xgrok-4-searchxAI11421136–114719,108
29#29Perplexityppl-sonar-reasoning-pro-highPerplexity11391133–114429,055
30#30Ogpt-5-searchOpenAI11331127–113920,781
31#31Perplexityppl-sonar-pro-highPerplexity11301124–113628,519
32#32Anthropicclaude-opus-4-searchAnthropic11261121–113231,037
33#33Ddiffbot-small-xlDiffbot10231014–10316,388
34#34Oapi-gpt-4o-searchOpenAI1006995–10173,411

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings