Epoch AI · Corrección de errores reales de código (SWE-bench Verified)
Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.
Cómo interpretar esta clasificación
Qué mide: SWE-bench Verified consiste en resolver incidencias de GitHub de repositorios reales de código abierto de Python. El conjunto original contiene 500 incidencias de 12 repositorios; la evaluación propia de Epoch utiliza 484 verificadas en su entorno de ejecución.
Cómo interpretar la puntuación: Es el porcentaje (%) de incidencias que superan las pruebas especificadas para verificar la solución y conservar las funciones existentes. Sirve como referencia para comparar la capacidad de resolver incidencias en repositorios reales.
Precauciones: La puntuación depende tanto del modelo como de las herramientas y la configuración del agente. Se centra en repositorios de Python; comprueba también el número de incidencias evaluadas y las condiciones de ejecución.
Claves para interpretar esta clasificación
- La puntuación más alta es 83.5%, obtenida por Claude Opus 4.7.
- La diferencia entre el 1.º y el 5.º puesto es de 4.8%p.
- Hay 30 modelos con resultados publicados para esta prueba.
Corrección de errores reales de código (SWE-bench Verified) Epoch AI
Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04
Las barras indican el porcentaje de aciertos y parten del 0%.
Ver tabla (los 30 mejores)
| Puesto | Modelo | Desarrollador | Fecha de lanzamiento | Puntuación |
|---|---|---|---|---|
| 1 | #1Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 83.5% |
| 2 | #2OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 80.6% |
| 3 | #3Gemini 3.5 Flash | 2026-05-19 | 79.3% | |
| 4 | #4Claude Opus 4.6(no thinking) | Anthropic | 2026-02-05 | 78.7% |
| 5 | #5ZGLM-5.2 | Z.ai | 2026-06-16 | 78.7% |
| 6 | #6DeepSeek v4 Pro(max) | DeepSeek | 2026-04-24 | 77.6% |
| 7 | #7Qwen3.7 Max | Alibaba | 2026-05-19 | 77.3% |
| 8 | #8OGPT-5.4(high) | OpenAI | 2026-03-05 | 76.9% |
| 9 | #9Qwen 3.6 Max(Preview) | Alibaba | 2026-04-20 | 76.7% |
| 10 | #10Kimi K2.6 | Moonshot AI | 2026-04-20 | 76.7% |
| 11 | #11Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 76.7% |
| 12 | #12Gemini 3.1 Pro Preview | 2026-02-19 | 75.6% | |
| 13 | #13Gemini 3 Flash Preview | 2025-12-17 | 75.4% | |
| 14 | #14Claude Sonnet 4.6(no thinking) | Anthropic | 2026-02-17 | 75.2% |
| 15 | #15OGPT-5.3 Codex(high) | OpenAI | 2026-02-05 | 74.8% |
| 16 | #16ZGLM-5.1 | Z.ai | 2026-04-07 | 74.2% |
| 17 | #17Kimi K2.5 | Moonshot AI | 2026-01-27 | 73.8% |
| 18 | #18OGPT-5.2(high) | OpenAI | 2025-12-11 | 73.8% |
| 19 | #19OGPT-5(high) | OpenAI | 2025-08-07 | 73.6% |
| 20 | #20claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 73.3% |
| 21 | #21Gemini 3 Pro Preview | 2025-11-18 | 72.9% | |
| 22 | #22ZGLM-5 | Z.ai | 2026-02-11 | 72.1% |
| 23 | #23Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 71.3% |
| 24 | #24Claude Opus 4 | Anthropic | 2025-05-22 | 70.7% |
| 25 | #25OGPT-5.1(high) | OpenAI | 2025-11-13 | 68.0% |
| 26 | #26OGPT-5 mini(medium) | OpenAI | 2025-08-07 | 64.7% |
| 27 | #27Oo3(medium) | OpenAI | 2025-04-16 | 62.3% |
| 28 | #28claude-3-7-sonnet-20250219 | Anthropic | 2025-02-24 | 61.0% |
| 29 | #29Qwen 3.6 Plus(2026-04-02) | Alibaba | 2026-03-31 | 57.9% |
| 30 | #30gemini-2.5-pro | 2025-06-05 | 57.6% |
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings