Valumigo

LMArena · Desarrollo web

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Es la clasificación de WebDev Arena, basada en votos que comparan de forma anónima los resultados ejecutados de páginas o aplicaciones web generadas con la misma solicitud.

Cómo interpretar la puntuación: Es una puntuación relativa de los resultados ejecutados preferidos por los usuarios. No es una tasa objetiva de aprobación de pruebas funcionales ni una puntuación de mantenimiento.

Precauciones: La evaluación se limita a los frameworks compatibles y a las condiciones de generación y ejecución, por lo que no garantiza la capacidad de mantener proyectos grandes a largo plazo.

Claves para interpretar esta clasificación

  • Los intervalos de confianza del 95% de claude-opus-5.5-max, en 1.º lugar, y gpt-6-astra-max, en 2.º, no se solapan. En esta agregación, la evidencia de que el 1.º lleva ventaja es relativamente clara.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 5 modelos.
  • El modelo en 1.º lugar recibió 2,062 votos y esta clasificación incluye 50 modelos.

Desarrollo web LMArena

Publicado el 2026-10-01 · Obtenido el 2026-10-04

156016201680174018001860
Anthropicclaude-opus-5.5-max
1815
Ogpt-6-astra-max
1788
Anthropicclaude-sonnet-5.5-xhigh
1786
Ogpt-6.1-sol-max
1758
Anthropicclaude-fable-5.1-max
1749
Anthropicclaude-opus-5-max
1695
Ogpt-6-sol-max
1689
Googlegemini-4-argon-high
1680
Alibabaqwen3.8-max
1671
Alibabaqwen3.8-max-0902
1670
Moonshot AIkimi-k3-max
1658
Metamuse-spark-1.3-max
1657
xgrok-4.7-xhigh
1638
Alibabaqwen3.8-flash-next
1637
Thy4-preview
1633
Anthropicclaude-fable-5-high
1625
Zglm-5.3-max
1623
DeepSeekdeepseek-v4.1-flash-max
1620
Ogpt-5.6-sol-xhigh (codex-harness)
1620
xgrok-4.6-high
1620

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones.

Mejor posición por empresa

  • AnthropicAnthropicclaude-opus-5.5-max#1
  • OOpenAIgpt-6-astra-max#2
  • GoogleGooglegemini-4-argon-high#9
  • AlibabaAlibabaqwen3.8-max#10
  • Moonshot AIMoonshot AIkimi-k3-max#13
  • MetaMetamuse-spark-1.3-max#14
  • xxAIgrok-4.7-xhigh#15
  • TTencenthy4-preview#17
  • ZZ.aiglm-5.3-max#20
Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1#1Anthropicclaude-opus-5.5-maxAnthropic18151799–18312,062
2#2Ogpt-6-astra-maxOpenAI17881777–17986,123
3#3Anthropicclaude-sonnet-5.5-xhighAnthropic17861768–18041,531
4#4Ogpt-6.1-sol-maxOpenAI17581741–17751,620
5#5Anthropicclaude-fable-5.1-maxAnthropic17491740–17596,318
6#6Anthropicclaude-sonnet-5.5-highAnthropic17151702–17292,527
7#7Anthropicclaude-opus-5-maxAnthropic16951689–170116,954
8#8Ogpt-6-sol-maxOpenAI16891678–17003,411
9#9Googlegemini-4-argon-highGoogle16801666–16932,422
10#10Alibabaqwen3.8-maxAlibaba16711659–16833,454
11#11Alibabaqwen3.8-max-0902Alibaba16701662–16789,485
12#12Anthropicclaude-opus-5-highAnthropic16601654–166621,506
13#13Moonshot AIkimi-k3-maxMoonshot AI16581651–166416,513
14#14Metamuse-spark-1.3-maxMeta16571648–16657,249
15#15xgrok-4.7-xhighxAI16381626–16493,216
16#16Alibabaqwen3.8-flash-nextAlibaba16371629–16466,193
17#17Thy4-previewTencent16331624–16435,088
18#18Anthropicclaude-fable-5-highAnthropic16251619–163214,126
19#19Metamuse-spark-1.3 (xHigh)Meta16241616–16336,326
20#20Zglm-5.3-maxZ.ai16231615–16317,658
21#21DeepSeekdeepseek-v4.1-flash-maxDeepSeek16201609–16303,960
22#22Ogpt-5.6-sol-xhigh (codex-harness)OpenAI16201614–162617,128
23#23xgrok-4.6-highxAI16201612–16278,315
24#24Xiaomimimo-v2.6-proXiaomi16181606–16312,734
25#25Zglm-5.3-flashZ.ai16161608–162310,355
26#26Zglm-5.2-maxZ.ai16051599–161114,729
27#27Googlegemini-3.7-flash-highGoogle15921584–15999,624
28#28Alibabaqwen3.8-27bAlibaba15911584–159812,388
29#29Googlegemini-3.8-flash-highGoogle15831575–15918,524
30#30DeepSeekdeepseek-v4-pro-high-20260813DeepSeek15831573–15924,882
31#31DeepSeekdeepseek-v4-flash-highDeepSeek15811572–15905,040
32#32Ogpt-6-luna-maxOpenAI15791570–15876,429
33#33Sstep-5-preview-highStepFun15701557–15832,506
34#34Anthropicclaude-opus-4-7-highAnthropic15571552–156317,982
35#35Anthropicclaude-opus-4-8-highAnthropic15561550–156118,908
36#36Anthropicclaude-opus-4-7Anthropic15551550–156118,174
37#37xgrok-4.5xAI15521545–155811,393
38#38Anthropicclaude-opus-4-6-highAnthropic15461540–155119,519
39#39Metamuse-spark-1.1Meta15421534–15498,070
40#40Anthropicclaude-sonnet-5-highAnthropic15391533–154614,130
41#41Anthropicclaude-opus-4-6Anthropic15371532–154220,762
42#42Googlegemini-3.6-flash-highGoogle15361529–15448,823
43#43Anthropicclaude-opus-4-8Anthropic15341528–154017,880
44#44Metamuse-spark-1.2 (xHigh)Meta15321518–15452,183
45#45Anthropicclaude-sonnet-4-6Anthropic15211516–152722,960
46#46Ogpt-5.6-terra-xhigh (codex-harness)OpenAI15191513–152612,526
47#47Ogpt-5.6-luna-xhigh (codex-harness)OpenAI15181512–152412,776
48#48ByteDanceseed-2.1-pro-previewByteDance15171511–152313,312
49#49Alibabaqwen3.7-max-20260517Alibaba15151508–15228,922
50#50Ogpt-5.5-xhigh (codex-harness)OpenAI15121506–151815,873

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings