Valumigo

Claude Code vs Codex: probamos las mismas 3 tareas de programación 3 veces cada una

Al elegir un agente de programación, la principal pregunta es quién realiza mejor y más rápido el mismo trabajo. Creamos 3 tareas pequeñas, las asignamos a Claude Code y Codex CLI con las mismas instrucciones 3 veces cada una y las evaluamos mediante pruebas ocultas que los agentes no podían ver.

Ejecutado el 2026-10-04

De un vistazo

  • Exactitud: ambas herramientas superaron todas las pruebas ocultas en sus 9 ejecuciones. En tareas de este tamaño no se observó ninguna diferencia en la exactitud de los resultados.
  • Velocidad: según la mediana de cada tarea, Codex (GPT-6.1 Sol) terminó aproximadamente 1.8~2 veces más rápido que Claude Code (Claude Opus 5). La diferencia fue de 16~43 segundos según la tarea.
  • Tokens: según la mediana por tarea, Claude Code procesó aproximadamente 4.2~5.7 veces más tokens de entrada (incluida la reutilización de caché) y 3.5~4.3 veces más tokens de salida que Codex. Al ejecutar T1 una vez más con todas las conexiones a herramientas MCP desactivadas, el volumen de tokens de entrada fue similar (aproximadamente 397000), pero no pudimos determinar la causa de la diferencia.
  • Código: en la tarea de corrección de errores, ambas herramientas modificaron las mismas tres líneas. En la tarea de rendimiento, Codex escribió código que conservaba incluso un comportamiento muy poco frecuente del original, cuando id es NaN, mientras que Claude Code escribió código más breve con comentarios que explicaban sus decisiones.
  • Gemini: también ejecutamos Gemini CLI en las mismas condiciones, pero se detuvo inmediatamente durante la autenticación. Esto se debe a que el servicio de Gemini CLI para cuentas personales, Google AI Pro y Google AI Ultra terminó el 18 de junio de 2026.

Resultados

El tiempo es la mediana de 3 ejecuciones; entre paréntesis se indica el valor más rápido~más lento.

TareaHerramientaAprobadas (en las 3 ejecuciones)Tiempo empleadoTokens de entradaTokens de salidaLíneas modificadas (+/−)
T1 Corrección de errores · Claude CodeT1 Corrección de erroresClaude Code3/336,6s (36,1–48,7)356.1961913+3 / −3
T1 Corrección de errores · Codex CLICodex CLI3/320,3s (19,1–32,5)85.176486+3 / −3
T2 Implementación de funciones · Claude CodeT2 Implementación de funcionesClaude Code3/369,8s (66–73,6)615.0195379+64 / −2
T2 Implementación de funciones · Codex CLICodex CLI3/338,2s (33,2–39,1)107.4281265+53 / −2
T3 Mejora del rendimiento · Claude CodeT3 Mejora del rendimientoClaude Code3/387,2s (85,3–104,3)561.7326085+26 / −12
T3 Mejora del rendimiento · Codex CLICodex CLI3/344,2s (39,8–55,1)109.7491742+21 / −6

La mayor parte de los tokens de entrada corresponde a la reutilización de caché al releer la conversación de pasos anteriores. Como las dos CLI no cuentan los tokens de la misma manera, usa estos datos solo para comparar aproximadamente su magnitud.

Claude Code también informa en cada ejecución del 'coste equivalente a las tarifas oficiales de la API' (aproximadamente 0.53~1.04 USD por tarea en esta prueba). Las cuentas de suscripción no pagan este importe por separado; el uso se descuenta del límite del plan. Codex no informa del mismo valor, por lo que no lo comparamos.

Las 3 tareas

T1 Corrección de errores

El código de cálculo de fechas para reservas de alojamiento (dates.js) contiene 3 errores: los meses no se cuentan desde 0, se cuenta 1 día de estancia de más y se omite el último día al calcular los días laborables. Las pruebas ocultas comprueban años bisiestos, cambios de año y fechas de cambio de horario de verano, entre otros casos.

T2 Implementación de funciones

La tarea consiste en crear desde cero un parser de CSV según el README. Las pruebas ocultas comprueban comas y saltos de línea dentro de comillas, el tratamiento de comillas dobles duplicadas (""), saltos de línea de Windows (CRLF), campos vacíos y errores de comillas sin cerrar.

T3 Mejora del rendimiento

El código que agrega 200 000 pedidos —eliminación de duplicados, clasificación de clientes y totales diarios— es demasiado lento. La tarea consiste en modificarlo para que termine en menos de 1 segundo sin cambiar los resultados. Las pruebas ocultas comprueban que los resultados coincidan con los del código original, que se conserve el orden en caso de empate y que también procese 300 000 pedidos en menos de 1 segundo.

Instrucciones utilizadas en todas las ejecuciones

En el texto siguiente, solo cambia para cada tarea la frase que aparece después de 'Task:'.

This folder is a small Node.js project (ES modules, no dependencies). Read the code, README.md if present, and the tests. Task: {task} Do not modify existing test files. When you are done, make sure `node --test` passes.
  • T1 Corrección de errores — Fix the bugs in dates.js so that every function behaves as its comment describes and the tests pass.
  • T2 Implementación de funciones — Implement parseCSV in csv.js according to README.md.
  • T3 Mejora del rendimiento — Make report.js fast enough as described in README.md, without changing any results.

Cómo lo medimos

  • Fecha de ejecución: 2026-10-04 (por la tarde-noche, hora de Corea), Apple M1 Pro · macOS 26.6 · Node.js 22.
  • Claude Code 2.1.250 — modelo predeterminado Claude Opus 5 (también se invocó Claude Haiku 4.5 para tareas auxiliares breves). Codex CLI 0.159.2 — modelo GPT-6.1 Sol, nivel de razonamiento medium.
  • Ejecutamos ambas herramientas en modo no interactivo (claude -p, codex exec), con las cuentas de suscripción personales del responsable del sitio. Permitimos automáticamente la modificación de archivos y la ejecución de node.
  • Copiamos la tarea original a una carpeta nueva para cada ejecución. Para reducir el efecto del orden, ejecutamos primero Claude Code en las rondas 1 y 3, y Codex en la ronda 2.
  • El tiempo se midió desde el inicio del comando hasta su finalización. Los tokens se transcribieron tal como los comunicó cada CLI en sus resultados.

Método de evaluación

  • Cada tarea incluía 3 pruebas visibles para el agente y pruebas ocultas (9~14) que solo se incorporaban al evaluar. Las pruebas ocultas se validaron primero con una implementación correcta escrita por el responsable del sitio.
  • Antes de evaluar, restauramos los archivos de pruebas visibles a su versión original. Los agentes no modificaron los archivos de pruebas en ninguna de las 18 ejecuciones.
  • Como los errores de fechas pueden aparecer solo en regiones con horario de verano, ejecutamos las pruebas en las zonas horarias de Nueva York y Berlín y registramos la puntuación más baja.

En qué se diferenciaba el código de las dos herramientas

  • T1: cada herramienta se ejecutó 3 veces y, en las 6 ejecuciones, ambas corrigieron las mismas tres líneas (cálculo del mes, eliminación del +1 en las noches de estancia e inclusión del último día). El número de líneas modificadas también fue idéntico en cada ejecución: 3 líneas añadidas y 3 eliminadas.
  • T2: ambas utilizaron un analizador que lee los caracteres uno a uno. Claude Code añadió 63~67 líneas y Codex, 53~55; Claude Code incluyó algo más de comentarios explicativos.
  • T3: ambas sustituyeron la búsqueda en la lista desde el principio en cada ocasión por estructuras hash (Map y Set). Codex conservó incluso el comportamiento del código original que no considera duplicados los valores cuyo id es NaN. Claude Code dejó un comentario que explicaba por qué se conserva el orden de primera aparición en caso de empate.

Por qué no se incluyó Gemini

  • También ejecutamos Gemini CLI 0.58.0 con las mismas tareas e instrucciones, pero las tres tareas terminaron con un error de autenticación en menos de 4 segundos. Mensaje de error: "This client is no longer supported for Gemini Code Assist for individuals. To continue using Gemini, please migrate to the Antigravity suite of products".
  • Según el anuncio oficial de Google, desde el 18 de junio de 2026 Gemini CLI y la extensión de Gemini Code Assist para IDE no procesan solicitudes de los niveles Gemini Code Assist para particulares, Google AI Pro y Google AI Ultra. En su lugar, recomiendan usar Antigravity y Antigravity CLI (agy).
  • Para realizar las mismas mediciones con Antigravity CLI, se requiere un inicio de sesión interactivo inicial, por lo que no lo incluimos en esta prueba.

Notas oficiales de la versión de Gemini Code Assist

Limitaciones de esta prueba

  • Son 3 tareas pequeñas de un solo archivo, ejecutadas solo 3 veces cada una. Los resultados pueden variar en repositorios grandes, trabajos con requisitos ambiguos o cambios en varios archivos.
  • El tiempo empleado varía según la carga del servidor, la red y la versión del modelo y de la CLI. Alternar las ejecuciones el mismo día y en el mismo ordenador redujo este efecto, pero no lo eliminó.
  • Ejecutamos Codex con el nivel de razonamiento medium, configurado por el responsable del sitio, y Claude Code con la configuración predeterminada. Cambiar el nivel de razonamiento o el modelo modifica la velocidad y el consumo de tokens.
  • No medimos cuánto se redujo el límite de uso del plan de suscripción.

Qué elegir

A continuación se presenta la opinión del responsable del sitio basada en los resultados de esta prueba.

  • En trabajos de alcance claro, como corregir errores pequeños o implementar funciones, esta prueba no mostró diferencias en los resultados de las dos herramientas. Es razonable probar primero la incluida en la suscripción que ya pagas, ChatGPT o Claude.
  • Si necesitas ejecutar el mismo trabajo varias veces con rapidez, Codex fue aproximadamente 2 veces más rápido en esta prueba y utilizó menos tokens.
  • Claude Code mostró una tendencia a verificar mediante más pasos y a explicar sus decisiones en comentarios. Esto puede ser una ventaja cuando una persona debe leer y revisar el código resultante.
  • Los usuarios particulares que usaban Gemini deben migrar a Antigravity CLI, ya que Gemini CLI ha dejado de funcionar para ellos.

ClaudeChatGPT (Codex)Agentes

Registros completos de las 18 ejecuciones

TareaHerramientaRondaSegundosPruebas aprobadasTokens de entradaTokens de salidaLíneas modificadas (+/−)
T1 · Claude Code · Ronda 1T1Claude Code148,715/15356.1962540+3 / −3
T1 · Claude Code · Ronda 2T1Claude Code236,115/15291.0261913+3 / −3
T1 · Claude Code · Ronda 3T1Claude Code336,615/15537.0291781+3 / −3
T1 · Codex CLI · Ronda 1T1Codex CLI132,515/15107.102776+3 / −3
T1 · Codex CLI · Ronda 2T1Codex CLI219,115/1585.176485+3 / −3
T1 · Codex CLI · Ronda 3T1Codex CLI320,315/1570.801486+3 / −3
T2 · Claude Code · Ronda 1T2Claude Code16617/17551.8915379+63 / −2
T2 · Claude Code · Ronda 2T2Claude Code273,617/17618.6365603+64 / −2
T2 · Claude Code · Ronda 3T2Claude Code369,817/17615.0195240+67 / −2
T2 · Codex CLI · Ronda 1T2Codex CLI138,217/17107.4281228+53 / −2
T2 · Codex CLI · Ronda 2T2Codex CLI233,217/1787.4321265+53 / −2
T2 · Codex CLI · Ronda 3T2Codex CLI339,117/17107.4611268+55 / −2
T3 · Claude Code · Ronda 1T3Claude Code187,212/12428.5015398+19 / −11
T3 · Claude Code · Ronda 2T3Claude Code2104,312/12628.3096880+29 / −15
T3 · Claude Code · Ronda 3T3Claude Code385,312/12561.7326085+26 / −12
T3 · Codex CLI · Ronda 1T3Codex CLI144,212/1289.6781742+20 / −8
T3 · Codex CLI · Ronda 2T3Codex CLI255,112/12112.3932561+21 / −6
T3 · Codex CLI · Ronda 3T3Codex CLI339,812/12109.7491593+21 / −5

Descargar los archivos de tareas y evaluación

Reunimos las tareas originales, las pruebas ocultas, los scripts de ejecución, el resumen de los 18 resultados (JSON) y los cambios de código de cada ejecución (diff). Puedes repetir las mediciones por tu cuenta con el mismo método.

Descargar coding-agents-2026-10.zip