Valumigo

Claude Code vs. Codex, segunda ronda: 3 tareas prácticas con varios archivos, repetidas 3 veces

En la primera prueba, ambas herramientas obtuvieron la máxima puntuación con tareas pequeñas de un solo archivo. Esta vez creamos un proyecto de una pequeña tienda más parecido al código de un servicio real (cálculo de precios, inventario, pedidos y almacenamiento, 6 archivos) y planteamos un error descrito solo por sus síntomas, como en un reporte de cliente, una función definida mediante especificaciones y un error que solo aparece con pedidos simultáneos.

Ejecutado el 2026-10-04

De un vistazo

  • Aciertos: ambas herramientas volvieron a superar todas las pruebas ocultas en sus 9 ejecuciones. La tarea de concurrencia incluía retardos aleatorios, por lo que evaluamos cada ejecución tres veces; no hubo ningún fallo.
  • Velocidad: según la mediana de cada tarea, Codex (GPT-6.1 Sol) fue aproximadamente 1.3~1.9 veces más rápido que Claude Code (Claude Opus 5). La diferencia fue de 24~42 segundos según la tarea.
  • Tokens: según la mediana de cada tarea, Claude Code utilizó aproximadamente 4~6 veces más tokens de entrada que Codex, incluida la reutilización de caché, y 2.5~3.7 veces más tokens de salida.
  • Hábitos de trabajo: Codex añadió archivos de pruebas de regresión en las 6 ejecuciones de las tareas de errores (T4) y concurrencia (T6). En una también modificó README y el código de almacenamiento (store.js). Claude Code solo modificó archivos fuente, sin añadir pruebas en ninguna de sus 9 ejecuciones.
  • Decisiones de diseño: en las 6 ejecuciones de la tarea de concurrencia, ambas herramientas recurrieron a un bloqueo global que 'pone el procesamiento de pedidos en fila'. El resultado es correcto, pero los pedidos de productos distintos también deben esperar su turno.

Resultados

Los tiempos son la mediana de 3 ejecuciones; entre paréntesis, el intervalo entre la más rápida y la más lenta.

TareaHerramientaAprobado (las 3 ejecuciones)Tiempo empleadoTokens de entradaTokens de salidaLíneas modificadas (+/−)
T4 Corrección de errores en varios archivos · Claude CodeT4 Corrección de errores en varios archivosClaude Code3/360,6s (59,7–75,2)564.6184495+6 / −5
T4 Corrección de errores en varios archivos · Codex CLICodex CLI3/336,3s (31,9–44,2)94.1601363+4 / −4
T5 Incorporación de una función según especificaciones · Claude CodeT5 Incorporación de una función según especificacionesClaude Code3/390,1s (89,8–110,6)592.4857366+42 / −2
T5 Incorporación de una función según especificaciones · Codex CLICodex CLI3/347,8s (47–49,3)95.7452002+41 / −2
T6 Error de concurrencia + cambio de API · Claude CodeT6 Error de concurrencia + cambio de APIClaude Code3/3111,9s (104,4–147,4)660.1079554+87 / −16
T6 Error de concurrencia + cambio de API · Codex CLICodex CLI3/385s (79–93,1)162.1933818+49 / −18

La mayor parte de los tokens de entrada corresponde a reutilización de caché al releer conversaciones de pasos anteriores. Como los dos CLI no cuentan los tokens de la misma manera, estos datos solo sirven para comparar su magnitud aproximada.

El 'coste equivalente según la tarifa estándar de la API' indicado por Claude Code fue de unos 0.78~1.25 dólares por tarea. Las cuentas de suscripción no pagan este importe aparte; el uso se descuenta del límite del plan. Codex no informó de un valor equivalente, por lo que no lo comparamos.

3 tareas

T4 Corrección de errores en varios archivos

Solo proporcionamos 4 reportes de clientes en ISSUES.md (decimales en yenes, descuento por volumen que no se aplica al comprar exactamente 10 unidades, diferencia de 1 céntimo con un cupón del 15% y total negativo por un cupón) y pedimos buscar las reglas correctas en README. Las causas están repartidas entre money.js y cart.js.

T5 Incorporación de una función según especificaciones

La tarea consiste en implementar reembolsos parciales (refundOrder) según las especificaciones de README. Las pruebas ocultas comprueban la reducción del reembolso cuando una devolución invalida el descuento por volumen, el recálculo de cupones, la reposición del inventario, los reembolsos parciales sucesivos, el rechazo de reembolsos excesivos y que nada cambie si la operación falla.

T6 Error de concurrencia + cambio de API

La tarea consiste en corregir un error por el que varias personas pueden comprar simultáneamente la última unidad y todas tienen éxito, dejando el inventario en negativo. También se debe permitir el uso de await manteniendo las llamadas existentes mediante callbacks. Las pruebas ocultas comprueban 20 pedidos simultáneos, interbloqueos en pedidos de varios productos, operaciones de todo o nada y la propagación de errores.

Instrucciones usadas en todas las ejecuciones

En el texto siguiente, solo cambia la frase después de 'Task:' para cada tarea. A diferencia de la primera prueba, pedimos leer 'README.md y otros documentos'.

This folder is a small Node.js project (ES modules, no dependencies). Read the code, README.md and any other docs, and the tests. Task: {task} Do not modify existing test files. When you are done, make sure `node --test` passes.
  • T4 Corrección de errores en varios archivos — Fix the bugs reported in ISSUES.md. README.md describes the correct pricing rules.
  • T5 Incorporación de una función según especificaciones — Implement refundOrder in src/orders.js according to the Refunds section of README.md.
  • T6 Error de concurrencia + cambio de API — Fix the problems described in the Orders section of README.md (overselling, and supporting both the Promise and the callback style).

Cómo lo medimos

  • Fecha de ejecución: 2026-10-04 (por la noche, hora de Corea), Apple M1 Pro · macOS 26.6 · Node.js 22. Mismo equipo, versiones y configuración que en la primera prueba.
  • Claude Code 2.1.250 — modelo predeterminado Claude Opus 5 (también se invocó Claude Haiku 4.5 para tareas auxiliares breves). Codex CLI 0.159.2 — modelo GPT-6.1 Sol, nivel de razonamiento medium.
  • Ambas herramientas se ejecutaron con las cuentas de suscripción personales del responsable del sitio, en modo no interactivo (claude -p, codex exec), con autorización automática para modificar archivos y ejecutar node. Se usaron dentro de las suscripciones existentes, sin coste adicional.
  • Alternamos el orden de ejecución en cada tarea (Claude Code primero en la repetición 1, Codex primero en la 2 y Claude Code primero en la 3). Durante las ejecuciones no realizamos tareas pesadas, como compilaciones, en el mismo equipo.

Método de evaluación

  • Cada tarea incluía 3 pruebas visibles para el agente y pruebas ocultas (9~12) añadidas solo al evaluar. Primero verificamos las pruebas ocultas con el código de referencia escrito por el responsable del sitio. Ejecutamos 10 veces la solución de referencia de concurrencia para comprobar que el resultado fuera siempre el mismo.
  • Antes de evaluar, restauramos la carpeta test a su estado original. Los archivos de pruebas añadidos por los agentes no se usaron para la evaluación.
  • Como los errores de concurrencia pueden aparecer solo de forma ocasional, evaluamos cada resultado tres veces en momentos distintos y registramos la puntuación más baja.

En qué se diferenció el código de las dos herramientas

  • T4: ambas herramientas encontraron los 4 errores de money.js (decimales de yenes y redondeo) y cart.js (umbral de 10 unidades y límite del cupón). La cantidad de líneas fuente modificadas fue similar: 5~9 con Claude Code y 4~5 con Codex. Codex creó un archivo independiente de pruebas de regresión que reproducía los reportes en las tres ejecuciones.
  • T5: ambas herramientas implementaron la especificación de 'recalcular el precio de los productos restantes con las reglas originales y restarlo'. La cantidad de líneas fuente añadidas también fue similar: 40~47.
  • T6: en las 6 ejecuciones, ambas herramientas serializaron todo el procesamiento de pedidos en una única cola mediante un bloqueo global. En las repeticiones 2 y 3, Codex vinculó el bloqueo al almacenamiento para que varios servicios de pedidos que usan el mismo almacenamiento compartieran la cola. En la repetición 1, añadió una función transaction al almacenamiento y la documentó en README. Claude Code solo modificó orders.js. Ninguna herramienta utilizó bloqueos por producto.

Limitaciones de esta prueba

  • El proyecto es pequeño: unas 200 líneas en 6 archivos. Se acerca más al trabajo real que la primera ronda, pero es mucho menor que el repositorio de un servicio real.
  • Como ambas herramientas obtuvieron la máxima puntuación, no pudimos mostrar diferencias de precisión. Los resultados pueden variar en repositorios más grandes o en tareas con requisitos ambiguos.
  • El tiempo empleado varía según el estado del servidor y la red. Alternar las ejecuciones durante la misma noche redujo esta influencia, pero no la eliminó.
  • Codex usó el nivel de razonamiento medium y Claude Code la configuración predeterminada. No medimos cuánto se consumió de los límites de uso de las suscripciones.

Qué elegir

A continuación se presenta la opinión del responsable del sitio basada en los resultados de esta prueba.

  • Tampoco aparecieron diferencias de precisión en los resultados de estas tareas prácticas de este tamaño. Es razonable empezar por la herramienta incluida en la suscripción que ya pagas.
  • Si quieres ejecutar las tareas más rápido, Codex volvió a ser 1.3~1.9 veces más rápido.
  • Si prefieres limitar el alcance de los cambios, Claude Code tuvo ventaja: solo modificó archivos fuente. Codex añadió pruebas de regresión por iniciativa propia, pero también llegó a modificar README y el código de almacenamiento sin que se lo pidieran, por lo que conviene revisar los cambios.
  • En problemas que requieren decisiones de diseño, como concurrencia y rendimiento, ambas herramientas eligieron la solución correcta más sencilla. Si condiciones como la capacidad de procesamiento son importantes, indícalas en las instrucciones.

ClaudeChatGPT (Codex)Agentes

Registro completo de las 18 ejecuciones

TareaHerramientaRepeticiónSegundosPruebas superadasTokens de entradaTokens de salidaLíneas modificadas (+/−)
T4 · Claude Code · Repetición 1T4Claude Code159,715/15567.6944495+9 / −5
T4 · Claude Code · Repetición 2T4Claude Code275,215/15496.1744638+5 / −5
T4 · Claude Code · Repetición 3T4Claude Code360,615/15564.6184458+6 / −5
T4 · Codex CLI · Repetición 1T4Codex CLI144,215/1595.6061850+5 / −5
T4 · Codex CLI · Repetición 2T4Codex CLI236,315/1594.1601363+4 / −4
T4 · Codex CLI · Repetición 3T4Codex CLI331,915/1589.4211168+4 / −4
T5 · Claude Code · Repetición 1T5Claude Code189,812/12654.7177366+42 / −2
T5 · Claude Code · Repetición 2T5Claude Code290,112/12585.0627327+47 / −2
T5 · Claude Code · Repetición 3T5Claude Code3110,612/12592.4859232+40 / −2
T5 · Codex CLI · Repetición 1T5Codex CLI149,312/1295.7452054+40 / −2
T5 · Codex CLI · Repetición 2T5Codex CLI24712/1295.6831989+41 / −2
T5 · Codex CLI · Repetición 3T5Codex CLI347,812/12116.2032002+43 / −2
T6 · Claude Code · Repetición 1T6Claude Code1147,412/121.100.25910.403+105 / −16
T6 · Claude Code · Repetición 2T6Claude Code2111,912/12660.1079554+87 / −16
T6 · Claude Code · Repetición 3T6Claude Code3104,412/12646.6518335+63 / −16
T6 · Codex CLI · Repetición 1T6Codex CLI18512/12173.3813818+64 / −25
T6 · Codex CLI · Repetición 2T6Codex CLI293,112/12162.1934385+49 / −18
T6 · Codex CLI · Repetición 3T6Codex CLI37912/12157.8013694+44 / −17

Descargar los archivos de las tareas y la evaluación

El paquete incluye las tareas originales (código de la tienda), las pruebas ocultas, las soluciones de referencia, los scripts de ejecución, el resumen de los 18 resultados (JSON) y los diff de cada ejecución.

Descargar coding-agents-round2-2026-10.zip