Valumigo

Artificial Analysis · Índice de programación

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Es un índice de programación creado por Artificial Analysis que reúne evaluaciones relacionadas con la programación.

Cómo interpretar la puntuación: Un valor más alto indica mejores resultados en las evaluaciones de escritura y modificación de código.

Precauciones: Son resultados de evaluaciones de programación conversacional, por lo que pueden diferir de la capacidad de un agente para trabajar con un repositorio completo. Consulta también nuestros registros de pruebas prácticas de programación.

Claves para interpretar esta clasificación

  • La puntuación más alta es 81.6, obtenida por Claude Fable 5.1 (Max, Default Fallback).
  • La diferencia entre el 1.º y el 5.º puesto es de 4.8.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 3 modelos.

Índice de programación Artificial Analysis

Publicado el 2026-10-05 · Obtenido el 2026-10-05

AnthropicClaude Fable 5.1 (Max, Default Fallback)
81.6
OGPT-5.6 Sol (Xhigh)
78.3
AnthropicClaude Opus 5 (Max)
78.0
OGPT-6 Astra (max)
76.9
xGrok 4.6 (High)
76.8
OGPT-5.6 Terra (Max)
76.7
AnthropicClaude Fable 5 (Max, Opus 4.8 Fallback)
76.5
GoogleGemini 3.8 Flash (High)
76.3
Moonshot AIKimi K3 (Max)
76.2
AlibabaQwen3.8 Max (0902)
76.2
GoogleGemini 3.7 Flash (High)
76.1
OGPT-5.5 (Xhigh)
74.9
ZGLM-5.3 (Max)
74.8
AnthropicClaude Opus 4.8 (Max)
74.3
AnthropicClaude Opus 4.7 (Max)
73.6
xGrok 4.5 (High)
72.4
MetaMuse Spark 1.2 (Xhigh)
72.2
AlibabaQwen3.8 2.4T A95B
71.9
AnthropicClaude Sonnet 5 (Max)
71.5
ZGLM 5.3 Flash
71.5

El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones.

Ver tabla (los 60 mejores)
PuestoModeloDesarrolladorPuntuación
1#1AnthropicClaude Fable 5.1 (Max, Default Fallback)Anthropic81.6
2#2OGPT-5.6 Sol (Xhigh)OpenAI78.3
3#3AnthropicClaude Opus 5 (Max)Anthropic78
4#4OGPT-6 Astra (max)OpenAI76.9
5#5xGrok 4.6 (High)xAI76.8
6#6OGPT-5.6 Terra (Max)OpenAI76.7
7#7AnthropicClaude Fable 5 (Max, Opus 4.8 Fallback)Anthropic76.5
8#8GoogleGemini 3.8 Flash (High)Google76.3
9#9Moonshot AIKimi K3 (Max)Moonshot AI76.2
10#10AlibabaQwen3.8 Max (0902)Alibaba76.2
11#11GoogleGemini 3.7 Flash (High)Google76.1
12#12OGPT-5.5 (Xhigh)OpenAI74.9
13#13ZGLM-5.3 (Max)Z.ai74.8
14#14AnthropicClaude Opus 4.8 (Max)Anthropic74.3
15#15AnthropicClaude Opus 4.7 (Max)Anthropic73.6
16#16xGrok 4.5 (High)xAI72.4
17#17MetaMuse Spark 1.2 (Xhigh)Meta72.2
18#18AlibabaQwen3.8 2.4T A95BAlibaba71.9
19#19AnthropicClaude Sonnet 5 (Max)Anthropic71.5
20#20ZGLM 5.3 FlashZ.ai71.5
21#21OGPT-5.6 Luna (Max)OpenAI71.4
22#22MetaMuse Spark 1.1 (Xhigh)Meta71.3
23#23OGPT-5.4 (Xhigh)OpenAI71.1
24#24GoogleGemini 3.5 Flash (High)Google70.1
25#25GoogleGemini 3.6 Flash (High)Google69.2
26#26DeepSeekDeepSeek V4 Flash 0731 (Max)DeepSeek69.1
27#27AlibabaQwen3.8 MaxAlibaba68.9
28#28ZGLM-5.2 (Max)Z.ai68.8
29#29GoogleGemini 3.1 Pro PreviewGoogle68.8
30#30DeepSeekDeepSeek V4 Pro 0813 (Max)DeepSeek68.8
31#31AlibabaQwen3.8 27B (Xhigh)Alibaba68.1
32#32AlibabaQwen3.7 MaxAlibaba66
33#33AnthropicClaude Sonnet 4.6 (Max)Anthropic63
34#34Moonshot AIKimi K2.6 (Reasoning)Moonshot AI61.8
35#35Moonshot AIKimi K2.7 CodeMoonshot AI60.8
36#36XiaomiMiMo-V2.5-Pro (Reasoning)Xiaomi60.2
37#37KKAT Coder Pro V2Kwaipilot59.5
38#38DeepSeekDeepSeek V4 Pro 0424 (Max)DeepSeek59.4
39#39NNex-N2-Pro (Based on Qwen3.5-397B-A17B)Nex Agi59.1
40#40THy3Tencent58.8
41#41MiniMaxMiniMax-M3MiniMax58.6
42#42iLing-3.0-flash-VLinclusionAI57
43#43XiaomiMiMo-V2.5Xiaomi56.8
44#44DeepSeekDeepSeek V4 Flash 0420 (Max)DeepSeek56.2
45#45OGPT-5.4 nano (Xhigh)OpenAI56.1
46#46OGPT-5.4 mini (Xhigh)OpenAI56.1
47#47AlibabaQwen3.7 PlusAlibaba55.9
48#48ZGLM-5.1 (Reasoning)Z.ai55.8
49#49iLing-3.0-flash-FininclusionAI55.6
50#50AlibabaQwen3.6 PlusAlibaba54.5
51#51AlibabaQwen3.6 27B (Reasoning)Alibaba53.7
52#52TInkling SmallThinkingmachines52.9
53#53USolar Pro 4Upstage52.7
54#54MiniMaxMiniMax-M2.7MiniMax52.6
55#55AnthropicClaude 4.5 Sonnet (Reasoning)Anthropic52.1
56#56TInkling (Xhigh)Thinkingmachines52.1
57#57xGrok Build 0.1 0616xAI51.5
58#58iLing 3.0 FlashinclusionAI50.6
59#59XiaomiMiMo-V2-Flash (Non-reasoning)Xiaomi49.8
60#60OGPT-5.1 (High)OpenAI49.4

Source: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings