Valumigo

LMArena · Programación

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Es una clasificación calculada con los votos de preguntas clasificadas como relacionadas con programación en las conversaciones de texto de LMArena.

Cómo interpretar la puntuación: Es una puntuación relativa de los modelos preferidos por los usuarios en respuestas sobre programación. Interpreta las diferencias pequeñas de puntuación teniendo en cuenta los intervalos de confianza y el número de votos.

Precauciones: Evalúa preferencias en conversaciones sobre programación, por lo que debe distinguirse de las evaluaciones de agentes que modifican y prueban repositorios. Consulta también SWE-bench, Terminal-Bench y los resultados publicados de pruebas prácticas.

Claves para interpretar esta clasificación

  • Los intervalos de confianza del 95% de gemini-4-argon-high, en 1.º lugar, y claude-fable-5-high, en 2.º, se solapan. Esta agregación por sí sola no permite establecer con certeza el orden de ambos modelos.
  • Hay otros 14 modelos cuyos intervalos de confianza se solapan con el del 1.º. Interpreta con cautela las diferencias pequeñas de posición, teniendo en cuenta el número de votos.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 5 modelos.
  • El modelo en 1.º lugar recibió 1,230 votos y esta clasificación incluye 408 modelos.

Programación LMArena

Publicado el 2026-10-02 · Obtenido el 2026-10-04

15001520154015601580
Googlegemini-4-argon-high
1560
Anthropicclaude-fable-5-high
1552
Anthropicclaude-opus-4-6-high
1551
Anthropicclaude-opus-4-7-high
1551
Ogpt-6-astra-max
1543
Ogpt-6.1-sol-max
1542
Moonshot AIkimi-k3-max
1541
Xiaomimimo-v2.6-pro
1540
Metamuse-spark-1.3-max
1539
Anthropicclaude-opus-5.5-high
1538
Anthropicclaude-sonnet-5.5-xhigh
1536
Ogpt-5.6-sol-xhigh
1534
Anthropicclaude-opus-5-high
1533
Anthropicclaude-opus-4-8-high
1533
Metamuse-spark-1.1
1533
Metamuse-spark-1.2 (xHigh)
1531
Anthropicclaude-fable-5.1-max
1531
Anthropicclaude-opus-4-5-20251101-high-32k
1530
Googlegemini-3.8-flash-high
1530
Metamuse-spark
1530

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones. Las clasificaciones de conversación y visión usan el ajuste de tono y longitud (style control), igual que la opción predeterminada del sitio de LMArena.

Mejor posición por empresa

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-fable-5-high#2
  • OOpenAIgpt-6-astra-max#7
  • Moonshot AIMoonshot AIkimi-k3-max#9
  • XiaomiXiaomimimo-v2.6-pro#10
  • MetaMetamuse-spark-1.3-max#11
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#26
  • AlibabaAlibabaqwen3.7-max-preview#27
  • ZZ.aiglm-5.3-flash#29
Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1#1Googlegemini-4-argon-highGoogle15601543–15771,230
2#2Anthropicclaude-fable-5-highAnthropic15521545–155910,038
3#3Anthropicclaude-opus-4-6-highAnthropic15511546–155720,235
4#4Anthropicclaude-opus-4-7-highAnthropic15511545–155618,521
5#5Anthropicclaude-opus-4-6Anthropic15481542–155322,901
6#6Anthropicclaude-opus-4-7Anthropic15461541–155218,728
7#7Ogpt-6-astra-maxOpenAI15431530–15562,135
8#8Ogpt-6.1-sol-maxOpenAI15421518–1566609
9#9Moonshot AIkimi-k3-maxMoonshot AI15411533–15497,285
10#10Xiaomimimo-v2.6-proXiaomi15401522–15581,103
11#11Metamuse-spark-1.3-maxMeta15391528–15493,307
12#12Anthropicclaude-opus-5.5-highAnthropic15381521–15561,060
13#13Anthropicclaude-sonnet-5.5-xhighAnthropic15361515–1558779
14#14Ogpt-5.6-sol-xhighOpenAI15341527–15419,943
15#15Anthropicclaude-opus-5-highAnthropic15331527–154015,559
16#16Anthropicclaude-opus-4-8-highAnthropic15331527–153917,395
17#17Metamuse-spark-1.1Meta15331526–153910,537
18#18Metamuse-spark-1.2 (xHigh)Meta15311514–15491,222
19#19Anthropicclaude-fable-5.1-maxAnthropic15311519–15442,358
20#20Anthropicclaude-opus-4-5-20251101-high-32kAnthropic15301523–15387,793
21#21Anthropicclaude-opus-5-maxAnthropic15301522–15387,382
22#22Googlegemini-3.8-flash-highGoogle15301522–15387,067
23#23Anthropicclaude-opus-4-8Anthropic15301524–153518,024
24#24Metamuse-sparkMeta15301520–15403,930
25#25Anthropicclaude-sonnet-4-6Anthropic15291523–153419,686
26#26DeepSeekdeepseek-v4.1-flash-maxDeepSeek15281516–15402,469
27#27Alibabaqwen3.7-max-previewAlibaba15241506–15421,165
28#28Alibabaqwen3.8-maxAlibaba15241516–15326,611
29#29Zglm-5.3-flashZ.ai15231515–15326,157
30#30Anthropicclaude-opus-4-5-20251101Anthropic15231518–152817,962
31#31Googlegemini-3.1-pro-previewGoogle15221517–152633,581
32#32Xiaomimimo-v2.5-proXiaomi15221516–152719,324
33#33Xiaomimimo-v2.6-flashXiaomi15211506–15371,508
34#34Zglm-5.3-maxZ.ai15211511–15304,424
35#35Ogpt-5.4-highOpenAI15211515–152717,566
36#36Ogpt-6-sol-maxOpenAI15201507–15342,071
37#37Anthropicclaude-sonnet-4-5-20250929-high-32kAnthropic15191514–152419,905
38#38Googlegemini-3.6-flash-highGoogle15191512–152610,350
39#39Anthropicclaude-sonnet-5-highAnthropic15191512–152512,377
40#40Ogpt-5.5-highOpenAI15191513–152419,110
41#41Googlegemini-3.7-flash-highGoogle15181510–15266,041
42#42Googlegemini-3-proGoogle15181511–15258,787
43#43Moonshot AIkimi-k2.6Moonshot AI15161509–152311,062
44#44Ogpt-5.6-terra-xhighOpenAI15151508–152210,166
45#45Ogpt-5.2-chat-latest-20260210OpenAI15151508–15229,629
46#46xgrok-4.5xAI15141507–152111,055
47#47ByteDancedola-seed-2.0-proByteDance15141509–151921,996
48#48Alibabaqwen3.5-max-previewAlibaba15141506–15226,358
49#49Ogpt-5.5-instantOpenAI15131506–15217,909
50#50Zglm-5.1Z.ai15131507–151816,060

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings