Valumigo

Claude Code vs Codex : les mêmes 3 tâches de programmation, répétées 3 fois chacune

Pour choisir un agent de programmation, la question essentielle est : « À tâche identique, lequel travaille le mieux et le plus vite ? » Nous avons créé 3 petites tâches, soumis les mêmes consignes à Claude Code et Codex CLI 3 fois chacun, puis évalué les résultats avec des tests cachés auxquels les agents n’avaient pas accès.

Exécuté le 2026-10-04

En un coup d’œil

  • Exactitude : les deux outils ont réussi tous les tests cachés lors de chacune de leurs 9 exécutions. Pour des tâches de cette taille, aucune différence d’exactitude des résultats n’est apparue.
  • Vitesse : selon la médiane de chaque tâche, Codex (GPT-6.1 Sol) a terminé environ 1.8~2 fois plus vite que Claude Code (Claude Opus 5). L’écart était de 16~43 secondes selon la tâche.
  • Tokens : selon la médiane par tâche, Claude Code a traité environ 4.2~5.7 fois plus de tokens d’entrée (réutilisation du cache comprise) et environ 3.5~4.3 fois plus de tokens de sortie que Codex. Après avoir désactivé toutes les connexions aux outils MCP et exécuté T1 une nouvelle fois, le volume de tokens d’entrée est resté similaire (environ 397 000), mais nous n’avons pas pu déterminer avec certitude la cause de cet écart.
  • Code : pour la correction de bugs, les deux outils ont modifié les mêmes trois lignes. Pour l’optimisation, Codex a préservé jusqu’à un comportement très rare du code initial (lorsque id vaut NaN), tandis que Claude Code a produit un code plus court avec des commentaires explicatifs.
  • Gemini : Gemini CLI a également été exécuté dans les mêmes conditions, mais s’est arrêté immédiatement à l’authentification. Depuis le 18 juin 2026, Gemini CLI n’est plus disponible pour les comptes individuels, Google AI Pro et Ultra.

Résultats

Les durées correspondent à la médiane de 3 exécutions ; les valeurs entre parenthèses vont de la plus rapide à la plus lente.

TâcheOutilRéussite (sur les 3 exécutions)DuréeTokens d’entréeTokens de sortieLignes modifiées (+/−)
T1 Correction de bugs · Claude CodeT1 Correction de bugsClaude Code3/336,6s (36,1–48,7)356 1961 913+3 / −3
T1 Correction de bugs · Codex CLICodex CLI3/320,3s (19,1–32,5)85 176486+3 / −3
T2 Implémentation · Claude CodeT2 ImplémentationClaude Code3/369,8s (66–73,6)615 0195 379+64 / −2
T2 Implémentation · Codex CLICodex CLI3/338,2s (33,2–39,1)107 4281 265+53 / −2
T3 Optimisation des performances · Claude CodeT3 Optimisation des performancesClaude Code3/387,2s (85,3–104,3)561 7326 085+26 / −12
T3 Optimisation des performances · Codex CLICodex CLI3/344,2s (39,8–55,1)109 7491 742+21 / −6

Les tokens d’entrée comprennent principalement les tokens réutilisés via le cache pour relire les échanges précédents. Les deux CLI ne comptent pas les tokens de la même manière ; ces chiffres permettent seulement de comparer les ordres de grandeur.

Claude Code indique également pour chaque exécution un « coût calculé au tarif catalogue de l’API » (environ 0.53~1.04 USD par tâche dans ces mesures). Avec un abonnement, ce montant n’est pas facturé séparément : l’usage est déduit du quota du forfait. Codex ne rapporte pas cette valeur, nous ne l’avons donc pas comparée.

Les 3 tâches

T1 Correction de bugs

Le code de calcul des dates pour les réservations d’hébergement (dates.js) contient 3 bugs : les mois ne sont pas comptés à partir de 0, le nombre de nuitées inclut 1 jour de trop et le dernier jour est omis du calcul des jours ouvrés. Les tests cachés vérifient notamment les années bissextiles, les fins d’année et les changements d’heure.

T2 Implémentation

La tâche consiste à créer un parseur CSV de zéro selon la documentation (README). Les tests cachés vérifient les virgules et sauts de ligne entre guillemets, le traitement des doubles guillemets (""), les fins de ligne Windows (CRLF), les champs vides et les erreurs de guillemets non fermés.

T3 Optimisation des performances

Le code qui agrège 200 000 commandes (suppression des doublons, classement des clients, totaux quotidiens) est trop lent. La tâche consiste à le modifier pour terminer en moins de 1 seconde sans changer les résultats. Les tests cachés vérifient l’identité des résultats avec le code initial, le maintien de l’ordre en cas d’égalité et le traitement de 300 000 commandes en moins de 1 seconde.

Consigne utilisée pour toutes les exécutions

Dans le texte ci-dessous, seule la phrase après 'Task:' change selon la tâche.

This folder is a small Node.js project (ES modules, no dependencies). Read the code, README.md if present, and the tests. Task: {task} Do not modify existing test files. When you are done, make sure `node --test` passes.
  • T1 Correction de bugs — Fix the bugs in dates.js so that every function behaves as its comment describes and the tests pass.
  • T2 Implémentation — Implement parseCSV in csv.js according to README.md.
  • T3 Optimisation des performances — Make report.js fast enough as described in README.md, without changing any results.

Méthode de mesure

  • Exécution le 2026-10-04 (en soirée, heure de Corée), Apple M1 Pro · macOS 26.6 · Node.js 22.
  • Claude Code 2.1.250 — modèle par défaut Claude Opus 5 (Claude Haiku 4.5 a également été sollicité pour de courtes tâches auxiliaires). Codex CLI 0.159.2 — modèle GPT-6.1 Sol, niveau de raisonnement medium.
  • Les deux outils ont été exécutés en mode non interactif (claude -p, codex exec), avec connexion aux comptes d’abonnement personnels du responsable du site. Les modifications de fichiers et l’exécution de node étaient autorisées automatiquement.
  • Avant chaque exécution, la tâche initiale a été copiée dans un nouveau dossier. Pour réduire l’effet de l’ordre de passage, Claude Code a été exécuté en premier aux passages 1 et 3, et Codex au passage 2.
  • La durée a été mesurée du lancement de la commande à sa fin. Les nombres de tokens ont été repris tels quels des résultats rapportés par chaque CLI.

Méthode de notation

  • Chaque tâche comportait 3 tests visibles par l’agent et des tests cachés (9~14), ajoutés uniquement lors de la notation. Les tests cachés ont d’abord été validés avec une implémentation de référence écrite par le responsable du site.
  • Avant la notation, les fichiers de tests visibles ont été restaurés à leur état initial. Aucun agent n’a modifié les fichiers de tests lors des 18 exécutions.
  • Les bugs de dates pouvant apparaître uniquement dans les régions qui changent d’heure, les tests ont été exécutés dans les fuseaux horaires de New York et de Berlin, puis le score le plus faible a été retenu.

Quelles différences entre les codes produits ?

  • T1 : les deux outils ont chacun été exécutés 3 fois, soit 6 exécutions au total, et ont tous corrigé les trois mêmes lignes (calcul du mois, suppression du +1 dans le nombre de nuitées, inclusion du dernier jour). Le nombre de lignes modifiées était également identique à chaque fois : 3 lignes ajoutées et 3 lignes supprimées.
  • T2 : les deux outils ont utilisé un parseur lisant les caractères un par un. Claude Code a ajouté 63~67 lignes, contre 53~55 pour Codex, avec un peu plus de commentaires explicatifs du côté de Claude Code.
  • T3 : les deux outils ont remplacé les recherches répétées depuis le début des listes par des structures de hachage (Map·Set). Codex a même conservé le comportement du code initial qui ne considère pas les id valant NaN comme des doublons. Claude Code a ajouté un commentaire expliquant pourquoi l’ordre d’apparition est maintenu en cas d’égalité.

Pourquoi Gemini est-il absent ?

  • Gemini CLI 0.58.0 a également été exécuté avec les mêmes tâches et consignes, mais les trois tâches se sont terminées par une erreur d’authentification en moins de 4 secondes. Message d’erreur : "This client is no longer supported for Gemini Code Assist for individuals. To continue using Gemini, please migrate to the Antigravity suite of products".
  • Selon l’annonce officielle de Google, depuis le 18 juin 2026, Gemini CLI et l’extension IDE Gemini Code Assist ne traitent plus les requêtes des offres Gemini Code Assist pour les particuliers, Google AI Pro et Google AI Ultra. Google recommande d’utiliser à leur place Antigravity et Antigravity CLI (agy).
  • Pour effectuer les mêmes mesures avec Antigravity CLI, une connexion interactive initiale est nécessaire ; nous ne l’avons donc pas inclus dans cette session de mesures.

Notes de version officielles de Gemini Code Assist

Limites de ces mesures

  • Les 3 tâches sont petites et portent chacune sur un seul fichier ; elles n’ont été exécutées que 3 fois chacune. Les résultats peuvent différer pour de grands dépôts, des exigences ambiguës ou des modifications de plusieurs fichiers.
  • La durée dépend de la charge des serveurs, du réseau et des versions du modèle et du CLI. L’alternance des exécutions le même jour sur le même ordinateur a réduit ces effets sans les éliminer.
  • Codex a été exécuté avec le niveau de raisonnement medium (réglage du responsable du site), et Claude Code avec ses paramètres par défaut. Changer le niveau de raisonnement ou le modèle modifie la vitesse et les tokens utilisés.
  • Nous n’avons pas mesuré la réduction du quota d’utilisation des abonnements.

Quel outil choisir ?

Les avis ci-dessous sont ceux du responsable du site, fondés sur les résultats de ces mesures.

  • Pour des tâches bien délimitées, comme corriger un petit bug ou implémenter une fonction, ces mesures n’ont révélé aucune différence entre les résultats des deux outils. Il est raisonnable de commencer par celui inclus dans l’abonnement que vous payez déjà (ChatGPT ou Claude).
  • Si vous devez répéter rapidement une même tâche, Codex a été environ 2 fois plus rapide dans ces mesures et a utilisé moins de tokens.
  • Claude Code a eu tendance à effectuer davantage d’étapes de vérification et à expliquer ses choix dans les commentaires. Cela peut être un avantage si une personne doit lire et examiner le code produit.
  • Les particuliers qui utilisaient Gemini doivent passer à Antigravity CLI, car Gemini CLI ne fonctionne plus pour eux.

ClaudeChatGPT (Codex)Agents

Les 18 exécutions en détail

TâcheOutilPassageSecondesTests réussisTokens d’entréeTokens de sortieLignes modifiées (+/−)
T1 · Claude Code · Passage 1T1Claude Code148,715/15356 1962 540+3 / −3
T1 · Claude Code · Passage 2T1Claude Code236,115/15291 0261 913+3 / −3
T1 · Claude Code · Passage 3T1Claude Code336,615/15537 0291 781+3 / −3
T1 · Codex CLI · Passage 1T1Codex CLI132,515/15107 102776+3 / −3
T1 · Codex CLI · Passage 2T1Codex CLI219,115/1585 176485+3 / −3
T1 · Codex CLI · Passage 3T1Codex CLI320,315/1570 801486+3 / −3
T2 · Claude Code · Passage 1T2Claude Code16617/17551 8915 379+63 / −2
T2 · Claude Code · Passage 2T2Claude Code273,617/17618 6365 603+64 / −2
T2 · Claude Code · Passage 3T2Claude Code369,817/17615 0195 240+67 / −2
T2 · Codex CLI · Passage 1T2Codex CLI138,217/17107 4281 228+53 / −2
T2 · Codex CLI · Passage 2T2Codex CLI233,217/1787 4321 265+53 / −2
T2 · Codex CLI · Passage 3T2Codex CLI339,117/17107 4611 268+55 / −2
T3 · Claude Code · Passage 1T3Claude Code187,212/12428 5015 398+19 / −11
T3 · Claude Code · Passage 2T3Claude Code2104,312/12628 3096 880+29 / −15
T3 · Claude Code · Passage 3T3Claude Code385,312/12561 7326 085+26 / −12
T3 · Codex CLI · Passage 1T3Codex CLI144,212/1289 6781 742+20 / −8
T3 · Codex CLI · Passage 2T3Codex CLI255,112/12112 3932 561+21 / −6
T3 · Codex CLI · Passage 3T3Codex CLI339,812/12109 7491 593+21 / −5

Télécharger les tâches et les fichiers de notation

L’archive regroupe les tâches initiales, les tests cachés, les scripts d’exécution, un résumé des 18 résultats (JSON) et les modifications de code de chaque exécution (diff). Vous pouvez reproduire les mesures avec la même méthode.

Télécharger coding-agents-2026-10.zip