Valumigo

Epoch AI · Tareas informáticas autónomas (Terminal-Bench)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Terminal-Bench 2.0 consiste en completar tareas de varios pasos en un entorno de terminal. Abarca tareas de línea de comandos, como usar programas, instalar, configurar y depurar.

Cómo interpretar la puntuación: Es el porcentaje (%) de tareas que superan las pruebas de evaluación y a veces se presenta como el promedio de varias ejecuciones. Evalúa combinaciones de modelos y herramientas como Claude Code y Codex CLI.

Precauciones: La puntuación varía según las herramientas y la configuración del agente. El valor representativo de cada modelo en Epoch corresponde a la combinación de modelo y agente que obtuvo la puntuación más alta, por lo que debes comprobar también las herramientas utilizadas.

Claves para interpretar esta clasificación

  • La puntuación más alta es 84.7%, obtenida por GPT-5.5.
  • La diferencia entre el 1.º y el 5.º puesto es de 4.9%p.
  • Entre los 10 modelos mejor clasificados, OpenAI tiene la mayor cantidad, con 5 modelos.
  • Hay 30 modelos con resultados publicados para esta prueba.

Tareas informáticas autónomas (Terminal-Bench) Epoch AI

Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04

OGPT-5.5
84.7%
OGPT-5.4
81.8%
GoogleGemini 3.1 Pro Preview
80.2%
AnthropicClaude Opus 4.7
80.2%
AnthropicClaude Opus 4.6
79.8%
OGPT-5.3 Codex
78.4%
GoogleGemini 3 Pro Preview
69.4%
OGPT-5.2 Codex
66.5%
OGPT-5.2
64.9%
GoogleGemini 3 Flash Preview
64.3%
AnthropicClaude Opus 4.5
63.1%
OGPT-5.1 Codex Mini
61.6%
?
61.2%
OGPT-5.1-Codex-Max
60.4%
OGPT-5.1 Codex
57.8%
xgrok-4-20
57.3%
AnthropicClaude Sonnet 4.6
53.4%
ZGLM-5
52.4%
OGPT-5
49.6%
OGPT-5.1
47.6%

Las barras indican el porcentaje de aciertos y parten del 0%.

Ver tabla (los 30 mejores)
PuestoModeloDesarrolladorFecha de lanzamientoPuntuación
1#1OGPT-5.5(unknown thinking)OpenAI2026-04-2384.7%
2#2OGPT-5.4(unknown thinking)OpenAI2026-03-0581.8%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1980.2%
4#4AnthropicClaude Opus 4.7(unknown)Anthropic2026-04-1680.2%
5#5AnthropicClaude Opus 4.6(unknown thinking)Anthropic2026-02-0579.8%
6#6OGPT-5.3 CodexOpenAI2026-02-0578.4%
7#7GoogleGemini 3 Pro PreviewGoogle2025-11-1869.4%
8#8OGPT-5.2 CodexOpenAI2025-12-1866.5%
9#9OGPT-5.2(unknown thinking)OpenAI2025-12-1164.9%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1764.3%
11#11AnthropicClaude Opus 4.5(unknown thinking)Anthropic2025-11-2463.1%
12#12OGPT-5.1 Codex MiniOpenAI2025-11-1261.6%
13#13??61.2%
14#14OGPT-5.1-Codex-MaxOpenAI2025-11-1960.4%
15#15OGPT-5.1 CodexOpenAI2025-11-1257.8%
16#16xgrok-4-20xAI2026-02-1757.3%
17#17AnthropicClaude Sonnet 4.6(unknown thinking)Anthropic2026-02-1753.4%
18#18ZGLM-5Z.ai2026-02-1152.4%
19#19OGPT-5(unknown thinking)OpenAI2025-08-0749.6%
20#20OGPT-5.1(medium)OpenAI2025-11-1347.6%
21#21AnthropicClaude Sonnet 4.5(unknown thinking)Anthropic2025-09-2946.5%
22#22MiniMaxMiniMax-M2.7MiniMax2026-03-1845.1%
23#23OGPT-5-codexOpenAI2025-09-1544.3%
24#24Moonshot AIKimi K2.5Moonshot AI2026-01-2743.2%
25#25MiniMaxMiniMax-M2.5MiniMax2026-02-1242.7%
26#26DeepSeekDeepSeek-V3.2(Thinking; Novita)DeepSeek2025-12-0139.6%
27#27Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0538.0%
28#28AnthropicClaude Opus 4.1(unknown thinking)Anthropic2025-08-0538.0%
29#29MiniMaxMiniMax-M2.1MiniMax2025-12-2336.6%
30#30Moonshot AIKimi K2 ThinkingMoonshot AI2025-11-0635.7%

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings