Valumigo

LMArena · Búsqueda con IA

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Es una clasificación basada en votos que comparan respuestas de sistemas de IA que utilizan búsquedas web. Abarca diversas solicitudes que requieren búsquedas, incluidas preguntas sobre información reciente.

Cómo interpretar la puntuación: Es una puntuación relativa de las respuestas de búsqueda preferidas por los usuarios. Distingue entre la puntuación básica de preferencia y la métrica ajustada por Factuality, que incorpora además la exactitud factual.

Precauciones: Comprueba la fecha de actualización, las herramientas de búsqueda y las condiciones de ejecución. No interpretes esta puntuación como la precisión de todas las respuestas de búsqueda del servicio real.

Claves para interpretar esta clasificación

  • Los intervalos de confianza del 95% de gpt-5.6-sol-xhigh, en 1.º lugar, y claude-opus-4-6-search, en 2.º, se solapan. Esta agregación por sí sola no permite establecer con certeza el orden de ambos modelos.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 4 modelos.
  • El modelo en 1.º lugar recibió 29,663 votos y esta clasificación incluye 34 modelos.

Búsqueda con IA LMArena

Publicado el 2026-08-24 · Obtenido el 2026-10-04

114011701200123012601290
Ogpt-5.6-sol-xhigh
1257
Anthropicclaude-opus-4-6-search
1253
Ogpt-5.5-search
1242
Anthropicclaude-opus-4-7
1233
Anthropicclaude-fable-5
1230
Baiduernie-5.1
1227
Anthropicclaude-sonnet-4-6-search
1221
xgrok-4.5
1213
Googlegemini-3.1-pro-grounding
1210
Googlegemini-3-pro-grounding
1207
Ogpt-5.2-search
1207
Anthropicclaude-opus-4-8
1204
xgrok-4.20-multi-agent-beta-0309
1204
Ogpt-5.1-search
1199
Googlegemini-3-flash-grounding
1198
Ogpt-5.4-search
1197
Anthropicclaude-sonnet-5-search
1194
xgrok-4.20-beta1
1189
Anthropicclaude-opus-4-5-search
1180
Ogpt-5.2-search-non-reasoning
1172

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones.

Mejor posición por empresa

  • OOpenAIgpt-5.6-sol-xhigh#1
  • AnthropicAnthropicclaude-opus-4-6-search#2
  • BaiduBaiduernie-5.1#6
  • xxAIgrok-4.5#8
  • GoogleGooglegemini-3.1-pro-grounding#9
  • PerplexityPerplexityppl-sonar-reasoning-pro-high#29
  • DDiffbotdiffbot-small-xl#33
Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1#1Ogpt-5.6-sol-xhighOpenAI12571250–126529,663
2#2Anthropicclaude-opus-4-6-searchAnthropic12531248–1258134,699
3#3Ogpt-5.5-searchOpenAI12421237–124789,873
4#4Anthropicclaude-opus-4-7Anthropic12331228–123991,394
5#5Anthropicclaude-fable-5Anthropic12301222–123841,795
6#6Baiduernie-5.1Baidu12271217–12373,788
7#7Anthropicclaude-sonnet-4-6-searchAnthropic12211216–1226134,905
8#8xgrok-4.5xAI12131206–122031,505
9#9Googlegemini-3.1-pro-groundingGoogle12101205–1216113,282
10#10Googlegemini-3-pro-groundingGoogle12071202–121337,024
11#11Ogpt-5.2-searchOpenAI12071201–121352,712
12#12Anthropicclaude-opus-4-8Anthropic12041198–121170,998
13#13xgrok-4.20-multi-agent-beta-0309xAI12041199–1209109,553
14#14Ogpt-5.1-searchOpenAI11991194–120559,909
15#15Googlegemini-3-flash-groundingGoogle11981193–1203149,334
16#16Ogpt-5.4-searchOpenAI11971192–1203110,116
17#17Anthropicclaude-sonnet-5-searchAnthropic11941187–120140,230
18#18xgrok-4.20-beta1xAI11891183–119553,921
19#19Anthropicclaude-opus-4-5-searchAnthropic11801174–118561,573
20#20Ogpt-5.2-search-non-reasoningOpenAI11721167–117875,658
21#21xgrok-4-1-fast-searchxAI11711166–117681,507
22#22xgrok-4-fast-searchxAI11711166–117541,794
23#23xgrok-4.3xAI11651160–117091,483
24#24Anthropicclaude-sonnet-4-5-searchAnthropic11581153–1163127,378
25#25Anthropicclaude-opus-4-1-searchAnthropic11481143–115376,933
26#26Oo3-searchOpenAI11441139–115020,644
27#27Googlegemini-2.5-pro-groundingGoogle11421137–114683,404
28#28xgrok-4-searchxAI11421136–114719,108
29#29Perplexityppl-sonar-reasoning-pro-highPerplexity11391133–114429,055
30#30Ogpt-5-searchOpenAI11331127–113920,781
31#31Perplexityppl-sonar-pro-highPerplexity11301124–113628,519
32#32Anthropicclaude-opus-4-searchAnthropic11261121–113231,037
33#33Ddiffbot-small-xlDiffbot10231014–10316,388
34#34Oapi-gpt-4o-searchOpenAI1006995–10173,411

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings