Valumigo

Epoch AI · Corrección de errores reales de código (SWE-bench Verified)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: SWE-bench Verified consiste en resolver incidencias de GitHub de repositorios reales de código abierto de Python. El conjunto original contiene 500 incidencias de 12 repositorios; la evaluación propia de Epoch utiliza 484 verificadas en su entorno de ejecución.

Cómo interpretar la puntuación: Es el porcentaje (%) de incidencias que superan las pruebas especificadas para verificar la solución y conservar las funciones existentes. Sirve como referencia para comparar la capacidad de resolver incidencias en repositorios reales.

Precauciones: La puntuación depende tanto del modelo como de las herramientas y la configuración del agente. Se centra en repositorios de Python; comprueba también el número de incidencias evaluadas y las condiciones de ejecución.

Claves para interpretar esta clasificación

  • La puntuación más alta es 83.5%, obtenida por Claude Opus 4.7.
  • La diferencia entre el 1.º y el 5.º puesto es de 4.8%p.
  • Hay 30 modelos con resultados publicados para esta prueba.

Corrección de errores reales de código (SWE-bench Verified) Epoch AI

Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04

AnthropicClaude Opus 4.7
83.5%
OGPT-5.5
80.6%
GoogleGemini 3.5 Flash
79.3%
AnthropicClaude Opus 4.6
78.7%
ZGLM-5.2
78.7%
DeepSeekDeepSeek v4 Pro
77.6%
AlibabaQwen3.7 Max
77.3%
OGPT-5.4
76.9%
AlibabaQwen 3.6 Max
76.7%
Moonshot AIKimi K2.6
76.7%
AnthropicClaude Opus 4.5
76.7%
GoogleGemini 3.1 Pro Preview
75.6%
GoogleGemini 3 Flash Preview
75.4%
AnthropicClaude Sonnet 4.6
75.2%
OGPT-5.3 Codex
74.8%
ZGLM-5.1
74.2%
Moonshot AIKimi K2.5
73.8%
OGPT-5.2
73.8%
OGPT-5
73.6%
Anthropicclaude-opus-4-1-20250805
73.3%

Las barras indican el porcentaje de aciertos y parten del 0%.

Ver tabla (los 30 mejores)
PuestoModeloDesarrolladorFecha de lanzamientoPuntuación
1#1AnthropicClaude Opus 4.7(max)Anthropic2026-04-1683.5%
2#2OGPT-5.5(xhigh)OpenAI2026-04-2380.6%
3#3GoogleGemini 3.5 FlashGoogle2026-05-1979.3%
4#4AnthropicClaude Opus 4.6(no thinking)Anthropic2026-02-0578.7%
5#5ZGLM-5.2Z.ai2026-06-1678.7%
6#6DeepSeekDeepSeek v4 Pro(max)DeepSeek2026-04-2477.6%
7#7AlibabaQwen3.7 MaxAlibaba2026-05-1977.3%
8#8OGPT-5.4(high)OpenAI2026-03-0576.9%
9#9AlibabaQwen 3.6 Max(Preview)Alibaba2026-04-2076.7%
10#10Moonshot AIKimi K2.6Moonshot AI2026-04-2076.7%
11#11AnthropicClaude Opus 4.5(no thinking)Anthropic2025-11-2476.7%
12#12GoogleGemini 3.1 Pro PreviewGoogle2026-02-1975.6%
13#13GoogleGemini 3 Flash PreviewGoogle2025-12-1775.4%
14#14AnthropicClaude Sonnet 4.6(no thinking)Anthropic2026-02-1775.2%
15#15OGPT-5.3 Codex(high)OpenAI2026-02-0574.8%
16#16ZGLM-5.1Z.ai2026-04-0774.2%
17#17Moonshot AIKimi K2.5Moonshot AI2026-01-2773.8%
18#18OGPT-5.2(high)OpenAI2025-12-1173.8%
19#19OGPT-5(high)OpenAI2025-08-0773.6%
20#20Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0573.3%
21#21GoogleGemini 3 Pro PreviewGoogle2025-11-1872.9%
22#22ZGLM-5Z.ai2026-02-1172.1%
23#23AnthropicClaude Sonnet 4.5(no thinking)Anthropic2025-09-2971.3%
24#24AnthropicClaude Opus 4Anthropic2025-05-2270.7%
25#25OGPT-5.1(high)OpenAI2025-11-1368.0%
26#26OGPT-5 mini(medium)OpenAI2025-08-0764.7%
27#27Oo3(medium)OpenAI2025-04-1662.3%
28#28Anthropicclaude-3-7-sonnet-20250219Anthropic2025-02-2461.0%
29#29AlibabaQwen 3.6 Plus(2026-04-02)Alibaba2026-03-3157.9%
30#30Googlegemini-2.5-proGoogle2025-06-0557.6%

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings