Valumigo

LMArena · Inglés

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Es una clasificación calculada con los votos de preguntas clasificadas como Inglés en las conversaciones de texto de LMArena.

Cómo interpretar la puntuación: Muestra qué modelo prefieren los votantes en preguntas en Inglés. El idioma de la pregunta no indica la lengua materna ni la identidad de quien vota.

Precauciones: El número de votos y la amplitud de los intervalos de confianza varían según el idioma y el modelo. Para los modelos nuevos, comprueba también el número de votos, la fecha de actualización y las condiciones de agregación.

Claves para interpretar esta clasificación

  • Los intervalos de confianza del 95% de gemini-4-argon-high, en 1.º lugar, y claude-opus-4-6-high, en 2.º, se solapan. Esta agregación por sí sola no permite establecer con certeza el orden de ambos modelos.
  • Hay otros 3 modelos cuyos intervalos de confianza se solapan con el del 1.º. Interpreta con cautela las diferencias pequeñas de posición, teniendo en cuenta el número de votos.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 6 modelos.
  • El modelo en 1.º lugar recibió 1,928 votos y esta clasificación incluye 413 modelos.

Inglés LMArena

Publicado el 2026-10-02 · Obtenido el 2026-10-04

146014801500152015401560
Googlegemini-4-argon-high
1533
Anthropicclaude-opus-4-6-high
1514
Anthropicclaude-fable-5-high
1513
Anthropicclaude-opus-4-7-high
1510
Anthropicclaude-opus-5.5-high
1506
Metamuse-spark-1.3-max
1499
Metamuse-spark-1.2 (xHigh)
1498
Googlegemini-3.8-flash-high
1498
Anthropicclaude-fable-5.1-max
1498
Metamuse-spark
1497
Ogpt-6.1-sol-max
1496
Xiaomimimo-v2.6-pro
1496
Moonshot AIkimi-k3-max
1495
Anthropicclaude-opus-5-high
1493
Anthropicclaude-sonnet-5.5-xhigh
1492
Alibabaqwen3.8-max
1492
Metamuse-spark-1.1
1491
Googlegemini-3.1-pro-preview
1490
Anthropicclaude-opus-4-8-high
1490
Zglm-5.3-max
1490

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones. Las clasificaciones de conversación y visión usan el ajuste de tono y longitud (style control), igual que la opción predeterminada del sitio de LMArena.

Mejor posición por empresa

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-opus-4-6-high#2
  • MetaMetamuse-spark-1.3-max#8
  • OOpenAIgpt-6.1-sol-max#13
  • XiaomiXiaomimimo-v2.6-pro#14
  • Moonshot AIMoonshot AIkimi-k3-max#15
  • AlibabaAlibabaqwen3.8-max#18
  • ZZ.aiglm-5.3-max#23
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#24
Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1#1Googlegemini-4-argon-highGoogle15331519–15471,928
2#2Anthropicclaude-opus-4-6-highAnthropic15141509–151934,324
3#3Anthropicclaude-fable-5-highAnthropic15131508–151916,474
4#4Anthropicclaude-opus-4-7-highAnthropic15101505–151530,082
5#5Anthropicclaude-opus-4-6Anthropic15071502–151136,805
6#6Anthropicclaude-opus-5.5-highAnthropic15061492–15201,719
7#7Anthropicclaude-opus-4-7Anthropic15011496–150630,422
8#8Metamuse-spark-1.3-maxMeta14991491–15084,928
9#9Metamuse-spark-1.2 (xHigh)Meta14981484–15121,805
10#10Googlegemini-3.8-flash-highGoogle14981491–150510,363
11#11Anthropicclaude-fable-5.1-maxAnthropic14981489–15064,793
12#12Metamuse-sparkMeta14971489–15046,673
13#13Ogpt-6.1-sol-maxOpenAI14961479–15131,149
14#14Xiaomimimo-v2.6-proXiaomi14961481–15111,487
15#15Moonshot AIkimi-k3-maxMoonshot AI14951489–150210,786
16#16Anthropicclaude-opus-5-highAnthropic14931488–149824,266
17#17Anthropicclaude-sonnet-5.5-xhighAnthropic14921475–15091,196
18#18Alibabaqwen3.8-maxAlibaba14921485–14999,003
19#19Metamuse-spark-1.1Meta14911486–149715,100
20#20Anthropicclaude-opus-5-maxAnthropic14911484–149711,702
21#21Googlegemini-3.1-pro-previewGoogle14901486–149453,727
22#22Anthropicclaude-opus-4-8-highAnthropic14901485–149527,922
23#23Zglm-5.3-maxZ.ai14901482–14977,223
24#24DeepSeekdeepseek-v4.1-flash-maxDeepSeek14891479–15003,237
25#25Ogpt-5.6-sol-xhighOpenAI14891483–149514,827
26#26Ogpt-6-astra-maxOpenAI14881478–14983,692
27#27Googlegemini-3-proGoogle14871482–149316,887
28#28Googlegemini-3.6-flash-highGoogle14871481–149315,114
29#29Googlegemini-3.7-flash-highGoogle14851478–14938,659
30#30Ogpt-5.5-highOpenAI14841480–148931,442
31#31Ogpt-5.5OpenAI14831478–148832,123
32#32Anthropicclaude-sonnet-4-6Anthropic14821478–148731,850
33#33Zglm-5.2-maxZ.ai14821477–148818,859
34#34Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14821477–148814,837
35#35Anthropicclaude-opus-4-8Anthropic14821477–148728,640
36#36Ogpt-5.2-chat-latest-20260210OpenAI14811476–148715,854
37#37Zglm-5.1Z.ai14811477–148625,210
38#38xgrok-4.20-beta1xAI14811475–148712,733
39#39Xiaomimimo-v2.5-proXiaomi14801475–148429,857
40#40Anthropicclaude-opus-4-5-20251101Anthropic14791474–148331,143
41#41Googlegemini-3.5-flash-highGoogle14791473–148420,509
42#42DeepSeekdeepseek-v4-pro-high-20260813DeepSeek14791469–14883,755
43#43Baiduernie-5.1Baidu14781473–148417,926
44#44Zglm-5.3-flashZ.ai14781471–14858,546
45#45Googlegemini-3.5-flash-mediumGoogle14781472–148319,998
46#46xgrok-4.20-beta-0309-reasoningxAI14781473–148330,381
47#47Ogpt-5.4-highOpenAI14761471–148129,222
48#48Googlegemini-3-flashGoogle14761470–148212,474
49#49xgrok-4.5xAI14741468–148016,121
50#50xgrok-4.20-multi-agent-beta-0309xAI14741469–147829,508

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings