Valumigo

LMArena · General

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Esta clasificación reúne los votos de usuarios de LMArena que comparan respuestas de dos modelos cuyos nombres están ocultos. Al igual que la opción predeterminada del sitio de LMArena, usa el ajuste de tono y longitud (style control), que corrige estadísticamente la influencia de la longitud de las respuestas y de formatos como Markdown en los votos.

Cómo interpretar la puntuación: Es una puntuación relativa estimada a partir de los votos mediante el modelo Bradley–Terry y expresada en una escala similar a Elo. Los intervalos de confianza del 95% indican la incertidumbre de la estimación; que se solapen no basta para concluir que las capacidades son iguales.

Precauciones: Evalúa las respuestas preferidas por los usuarios, por lo que pueden influir el tono, la longitud y el formato, además de la precisión. Comprueba también los filtros y ajustes aplicados.

Claves para interpretar esta clasificación

  • Los intervalos de confianza del 95% de gemini-4-argon-high, en 1.º lugar, y claude-opus-4-6-high, en 2.º, no se solapan. En esta agregación, la evidencia de que el 1.º lleva ventaja es relativamente clara.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 7 modelos.
  • El modelo en 1.º lugar recibió 4,932 votos y esta clasificación incluye 413 modelos.

General LMArena

Publicado el 2026-10-02 · Obtenido el 2026-10-04

14601480150015201540
Googlegemini-4-argon-high
1525
Anthropicclaude-opus-4-6-high
1505
Anthropicclaude-fable-5-high
1504
Anthropicclaude-opus-5.5-high
1504
Anthropicclaude-opus-4-7-high
1501
Anthropicclaude-fable-5.1-max
1501
Googlegemini-3.8-flash-high
1495
Metamuse-spark-1.3-max
1494
Metamuse-spark-1.2 (xHigh)
1494
Metamuse-spark-1.1
1491
Anthropicclaude-opus-5-high
1490
Metamuse-spark
1489
Moonshot AIkimi-k3-max
1488
Googlegemini-3.7-flash-high
1488
Googlegemini-3.1-pro-preview
1487
Googlegemini-3-pro
1485
Ogpt-5.6-sol-xhigh
1484
Ogpt-6.1-sol-max
1483
Googlegemini-3.6-flash-high
1483
Alibabaqwen3.8-max
1482

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones. Las clasificaciones de conversación y visión usan el ajuste de tono y longitud (style control), igual que la opción predeterminada del sitio de LMArena.

Mejor posición por empresa

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-opus-4-6-high#2
  • MetaMetamuse-spark-1.3-max#9
  • Moonshot AIMoonshot AIkimi-k3-max#16
  • OOpenAIgpt-5.6-sol-xhigh#20
  • AlibabaAlibabaqwen3.8-max#23
  • XiaomiXiaomimimo-v2.6-pro#26
  • ZZ.aiglm-5.3-max#27
  • xxAIgrok-4.20-beta1#36
Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1#1Googlegemini-4-argon-highGoogle15251516–15344,932
2#2Anthropicclaude-opus-4-6-highAnthropic15051501–150877,636
3#3Anthropicclaude-fable-5-highAnthropic15041500–150938,387
4#4Anthropicclaude-opus-5.5-highAnthropic15041495–15134,552
5#5Anthropicclaude-opus-4-7-highAnthropic15011498–150564,946
6#6Anthropicclaude-fable-5.1-maxAnthropic15011495–150811,800
7#7Anthropicclaude-opus-4-6Anthropic14971494–150182,189
8#8Googlegemini-3.8-flash-highGoogle14951490–150026,298
9#9Metamuse-spark-1.3-maxMeta14941488–150012,343
10#10Anthropicclaude-opus-4-7Anthropic14941490–149866,058
11#11Metamuse-spark-1.2 (xHigh)Meta14941484–15034,356
12#12Metamuse-spark-1.1Meta14911487–149637,238
13#13Anthropicclaude-opus-5-highAnthropic14901486–149459,482
14#14Anthropicclaude-opus-5-maxAnthropic14891485–149428,937
15#15Metamuse-sparkMeta14891484–149514,120
16#16Moonshot AIkimi-k3-maxMoonshot AI14881484–149328,280
17#17Googlegemini-3.7-flash-highGoogle14881483–149321,539
18#18Googlegemini-3.1-pro-previewGoogle14871484–1490121,806
19#19Googlegemini-3-proGoogle14851482–148941,910
20#20Ogpt-5.6-sol-xhighOpenAI14841479–148836,656
21#21Ogpt-6.1-sol-maxOpenAI14831473–14943,071
22#22Googlegemini-3.6-flash-highGoogle14831479–148736,070
23#23Alibabaqwen3.8-maxAlibaba14821476–148723,353
24#24Anthropicclaude-opus-4-8-highAnthropic14821478–148563,974
25#25Ogpt-5.5-highOpenAI14811478–148569,202
26#26Xiaomimimo-v2.6-proXiaomi14801471–14894,056
27#27Zglm-5.3-maxZ.ai14781473–148417,857
28#28Googlegemini-3.5-flash-highGoogle14771473–148148,420
29#29Ogpt-6-astra-maxOpenAI14771470–14849,156
30#30Ogpt-5.5OpenAI14771473–148070,781
31#31Googlegemini-3.5-flash-mediumGoogle14761472–148047,187
32#32Zglm-5.2-maxZ.ai14761471–148045,399
33#33Ogpt-5.2-chat-latest-20260210OpenAI14761472–148035,937
34#34Ogpt-5.4-highOpenAI14751471–147964,642
35#35Alibabaqwen3.7-max-previewAlibaba14751465–14853,920
36#36xgrok-4.20-beta1xAI14751470–147927,827
37#37Anthropicclaude-opus-4-8Anthropic14751471–147865,072
38#38DeepSeekdeepseek-v4.1-flash-maxDeepSeek14741468–14818,728
39#39Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14741470–147737,448
40#40Ogpt-5.5-instantOpenAI14731468–147827,098
41#41Zglm-5.3-flashZ.ai14731468–147822,971
42#42Googlegemini-3-flashGoogle14731468–147731,259
43#43Anthropicclaude-sonnet-4-6Anthropic14721469–147670,747
44#44xgrok-4.20-beta-0309-reasoningxAI14721468–147566,334
45#45Anthropicclaude-sonnet-5.5-xhighAnthropic14711461–14813,145
46#46xgrok-4.20-multi-agent-beta-0309xAI14711467–147464,788
47#47Anthropicclaude-opus-4-5-20251101Anthropic14701467–147372,772
48#48Baiduernie-5.1Baidu14681463–147239,396
49#49Xiaomimimo-v2.5-proXiaomi14681464–147170,871
50#50xgrok-4.5xAI14661461–147039,789

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings