Claude Code vs Codex : les mêmes 3 tâches de programmation, répétées 3 fois chacune
Pour choisir un agent de programmation, la question essentielle est : « À tâche identique, lequel travaille le mieux et le plus vite ? » Nous avons créé 3 petites tâches, soumis les mêmes consignes à Claude Code et Codex CLI 3 fois chacun, puis évalué les résultats avec des tests cachés auxquels les agents n’avaient pas accès.
Exécuté le 2026-10-04
En un coup d’œil
- Exactitude : les deux outils ont réussi tous les tests cachés lors de chacune de leurs 9 exécutions. Pour des tâches de cette taille, aucune différence d’exactitude des résultats n’est apparue.
- Vitesse : selon la médiane de chaque tâche, Codex (GPT-6.1 Sol) a terminé environ 1.8~2 fois plus vite que Claude Code (Claude Opus 5). L’écart était de 16~43 secondes selon la tâche.
- Tokens : selon la médiane par tâche, Claude Code a traité environ 4.2~5.7 fois plus de tokens d’entrée (réutilisation du cache comprise) et environ 3.5~4.3 fois plus de tokens de sortie que Codex. Après avoir désactivé toutes les connexions aux outils MCP et exécuté T1 une nouvelle fois, le volume de tokens d’entrée est resté similaire (environ 397 000), mais nous n’avons pas pu déterminer avec certitude la cause de cet écart.
- Code : pour la correction de bugs, les deux outils ont modifié les mêmes trois lignes. Pour l’optimisation, Codex a préservé jusqu’à un comportement très rare du code initial (lorsque id vaut NaN), tandis que Claude Code a produit un code plus court avec des commentaires explicatifs.
- Gemini : Gemini CLI a également été exécuté dans les mêmes conditions, mais s’est arrêté immédiatement à l’authentification. Depuis le 18 juin 2026, Gemini CLI n’est plus disponible pour les comptes individuels, Google AI Pro et Ultra.
Résultats
Les durées correspondent à la médiane de 3 exécutions ; les valeurs entre parenthèses vont de la plus rapide à la plus lente.
| Tâche | Outil | Réussite (sur les 3 exécutions) | Durée | Tokens d’entrée | Tokens de sortie | Lignes modifiées (+/−) | |
|---|---|---|---|---|---|---|---|
| T1 Correction de bugs · Claude Code | T1 Correction de bugs | Claude Code | 3/3 | 36,6s (36,1–48,7) | 356 196 | 1 913 | +3 / −3 |
| T1 Correction de bugs · Codex CLI | Codex CLI | 3/3 | 20,3s (19,1–32,5) | 85 176 | 486 | +3 / −3 | |
| T2 Implémentation · Claude Code | T2 Implémentation | Claude Code | 3/3 | 69,8s (66–73,6) | 615 019 | 5 379 | +64 / −2 |
| T2 Implémentation · Codex CLI | Codex CLI | 3/3 | 38,2s (33,2–39,1) | 107 428 | 1 265 | +53 / −2 | |
| T3 Optimisation des performances · Claude Code | T3 Optimisation des performances | Claude Code | 3/3 | 87,2s (85,3–104,3) | 561 732 | 6 085 | +26 / −12 |
| T3 Optimisation des performances · Codex CLI | Codex CLI | 3/3 | 44,2s (39,8–55,1) | 109 749 | 1 742 | +21 / −6 |
Les tokens d’entrée comprennent principalement les tokens réutilisés via le cache pour relire les échanges précédents. Les deux CLI ne comptent pas les tokens de la même manière ; ces chiffres permettent seulement de comparer les ordres de grandeur.
Claude Code indique également pour chaque exécution un « coût calculé au tarif catalogue de l’API » (environ 0.53~1.04 USD par tâche dans ces mesures). Avec un abonnement, ce montant n’est pas facturé séparément : l’usage est déduit du quota du forfait. Codex ne rapporte pas cette valeur, nous ne l’avons donc pas comparée.
Les 3 tâches
T1 Correction de bugs
Le code de calcul des dates pour les réservations d’hébergement (dates.js) contient 3 bugs : les mois ne sont pas comptés à partir de 0, le nombre de nuitées inclut 1 jour de trop et le dernier jour est omis du calcul des jours ouvrés. Les tests cachés vérifient notamment les années bissextiles, les fins d’année et les changements d’heure.
T2 Implémentation
La tâche consiste à créer un parseur CSV de zéro selon la documentation (README). Les tests cachés vérifient les virgules et sauts de ligne entre guillemets, le traitement des doubles guillemets (""), les fins de ligne Windows (CRLF), les champs vides et les erreurs de guillemets non fermés.
T3 Optimisation des performances
Le code qui agrège 200 000 commandes (suppression des doublons, classement des clients, totaux quotidiens) est trop lent. La tâche consiste à le modifier pour terminer en moins de 1 seconde sans changer les résultats. Les tests cachés vérifient l’identité des résultats avec le code initial, le maintien de l’ordre en cas d’égalité et le traitement de 300 000 commandes en moins de 1 seconde.
Consigne utilisée pour toutes les exécutions
Dans le texte ci-dessous, seule la phrase après 'Task:' change selon la tâche.
This folder is a small Node.js project (ES modules, no dependencies). Read the code, README.md if present, and the tests. Task: {task} Do not modify existing test files. When you are done, make sure `node --test` passes.- T1 Correction de bugs —
Fix the bugs in dates.js so that every function behaves as its comment describes and the tests pass. - T2 Implémentation —
Implement parseCSV in csv.js according to README.md. - T3 Optimisation des performances —
Make report.js fast enough as described in README.md, without changing any results.
Méthode de mesure
- Exécution le 2026-10-04 (en soirée, heure de Corée), Apple M1 Pro · macOS 26.6 · Node.js 22.
- Claude Code 2.1.250 — modèle par défaut Claude Opus 5 (Claude Haiku 4.5 a également été sollicité pour de courtes tâches auxiliaires). Codex CLI 0.159.2 — modèle GPT-6.1 Sol, niveau de raisonnement medium.
- Les deux outils ont été exécutés en mode non interactif (claude -p, codex exec), avec connexion aux comptes d’abonnement personnels du responsable du site. Les modifications de fichiers et l’exécution de node étaient autorisées automatiquement.
- Avant chaque exécution, la tâche initiale a été copiée dans un nouveau dossier. Pour réduire l’effet de l’ordre de passage, Claude Code a été exécuté en premier aux passages 1 et 3, et Codex au passage 2.
- La durée a été mesurée du lancement de la commande à sa fin. Les nombres de tokens ont été repris tels quels des résultats rapportés par chaque CLI.
Méthode de notation
- Chaque tâche comportait 3 tests visibles par l’agent et des tests cachés (9~14), ajoutés uniquement lors de la notation. Les tests cachés ont d’abord été validés avec une implémentation de référence écrite par le responsable du site.
- Avant la notation, les fichiers de tests visibles ont été restaurés à leur état initial. Aucun agent n’a modifié les fichiers de tests lors des 18 exécutions.
- Les bugs de dates pouvant apparaître uniquement dans les régions qui changent d’heure, les tests ont été exécutés dans les fuseaux horaires de New York et de Berlin, puis le score le plus faible a été retenu.
Quelles différences entre les codes produits ?
- T1 : les deux outils ont chacun été exécutés 3 fois, soit 6 exécutions au total, et ont tous corrigé les trois mêmes lignes (calcul du mois, suppression du +1 dans le nombre de nuitées, inclusion du dernier jour). Le nombre de lignes modifiées était également identique à chaque fois : 3 lignes ajoutées et 3 lignes supprimées.
- T2 : les deux outils ont utilisé un parseur lisant les caractères un par un. Claude Code a ajouté 63~67 lignes, contre 53~55 pour Codex, avec un peu plus de commentaires explicatifs du côté de Claude Code.
- T3 : les deux outils ont remplacé les recherches répétées depuis le début des listes par des structures de hachage (Map·Set). Codex a même conservé le comportement du code initial qui ne considère pas les id valant NaN comme des doublons. Claude Code a ajouté un commentaire expliquant pourquoi l’ordre d’apparition est maintenu en cas d’égalité.
Pourquoi Gemini est-il absent ?
- Gemini CLI 0.58.0 a également été exécuté avec les mêmes tâches et consignes, mais les trois tâches se sont terminées par une erreur d’authentification en moins de 4 secondes. Message d’erreur : "This client is no longer supported for Gemini Code Assist for individuals. To continue using Gemini, please migrate to the Antigravity suite of products".
- Selon l’annonce officielle de Google, depuis le 18 juin 2026, Gemini CLI et l’extension IDE Gemini Code Assist ne traitent plus les requêtes des offres Gemini Code Assist pour les particuliers, Google AI Pro et Google AI Ultra. Google recommande d’utiliser à leur place Antigravity et Antigravity CLI (agy).
- Pour effectuer les mêmes mesures avec Antigravity CLI, une connexion interactive initiale est nécessaire ; nous ne l’avons donc pas inclus dans cette session de mesures.
Limites de ces mesures
- Les 3 tâches sont petites et portent chacune sur un seul fichier ; elles n’ont été exécutées que 3 fois chacune. Les résultats peuvent différer pour de grands dépôts, des exigences ambiguës ou des modifications de plusieurs fichiers.
- La durée dépend de la charge des serveurs, du réseau et des versions du modèle et du CLI. L’alternance des exécutions le même jour sur le même ordinateur a réduit ces effets sans les éliminer.
- Codex a été exécuté avec le niveau de raisonnement medium (réglage du responsable du site), et Claude Code avec ses paramètres par défaut. Changer le niveau de raisonnement ou le modèle modifie la vitesse et les tokens utilisés.
- Nous n’avons pas mesuré la réduction du quota d’utilisation des abonnements.
Quel outil choisir ?
Les avis ci-dessous sont ceux du responsable du site, fondés sur les résultats de ces mesures.
- Pour des tâches bien délimitées, comme corriger un petit bug ou implémenter une fonction, ces mesures n’ont révélé aucune différence entre les résultats des deux outils. Il est raisonnable de commencer par celui inclus dans l’abonnement que vous payez déjà (ChatGPT ou Claude).
- Si vous devez répéter rapidement une même tâche, Codex a été environ 2 fois plus rapide dans ces mesures et a utilisé moins de tokens.
- Claude Code a eu tendance à effectuer davantage d’étapes de vérification et à expliquer ses choix dans les commentaires. Cela peut être un avantage si une personne doit lire et examiner le code produit.
- Les particuliers qui utilisaient Gemini doivent passer à Antigravity CLI, car Gemini CLI ne fonctionne plus pour eux.
Les 18 exécutions en détail
| Tâche | Outil | Passage | Secondes | Tests réussis | Tokens d’entrée | Tokens de sortie | Lignes modifiées (+/−) | |
|---|---|---|---|---|---|---|---|---|
| T1 · Claude Code · Passage 1 | T1 | Claude Code | 1 | 48,7 | 15/15 | 356 196 | 2 540 | +3 / −3 |
| T1 · Claude Code · Passage 2 | T1 | Claude Code | 2 | 36,1 | 15/15 | 291 026 | 1 913 | +3 / −3 |
| T1 · Claude Code · Passage 3 | T1 | Claude Code | 3 | 36,6 | 15/15 | 537 029 | 1 781 | +3 / −3 |
| T1 · Codex CLI · Passage 1 | T1 | Codex CLI | 1 | 32,5 | 15/15 | 107 102 | 776 | +3 / −3 |
| T1 · Codex CLI · Passage 2 | T1 | Codex CLI | 2 | 19,1 | 15/15 | 85 176 | 485 | +3 / −3 |
| T1 · Codex CLI · Passage 3 | T1 | Codex CLI | 3 | 20,3 | 15/15 | 70 801 | 486 | +3 / −3 |
| T2 · Claude Code · Passage 1 | T2 | Claude Code | 1 | 66 | 17/17 | 551 891 | 5 379 | +63 / −2 |
| T2 · Claude Code · Passage 2 | T2 | Claude Code | 2 | 73,6 | 17/17 | 618 636 | 5 603 | +64 / −2 |
| T2 · Claude Code · Passage 3 | T2 | Claude Code | 3 | 69,8 | 17/17 | 615 019 | 5 240 | +67 / −2 |
| T2 · Codex CLI · Passage 1 | T2 | Codex CLI | 1 | 38,2 | 17/17 | 107 428 | 1 228 | +53 / −2 |
| T2 · Codex CLI · Passage 2 | T2 | Codex CLI | 2 | 33,2 | 17/17 | 87 432 | 1 265 | +53 / −2 |
| T2 · Codex CLI · Passage 3 | T2 | Codex CLI | 3 | 39,1 | 17/17 | 107 461 | 1 268 | +55 / −2 |
| T3 · Claude Code · Passage 1 | T3 | Claude Code | 1 | 87,2 | 12/12 | 428 501 | 5 398 | +19 / −11 |
| T3 · Claude Code · Passage 2 | T3 | Claude Code | 2 | 104,3 | 12/12 | 628 309 | 6 880 | +29 / −15 |
| T3 · Claude Code · Passage 3 | T3 | Claude Code | 3 | 85,3 | 12/12 | 561 732 | 6 085 | +26 / −12 |
| T3 · Codex CLI · Passage 1 | T3 | Codex CLI | 1 | 44,2 | 12/12 | 89 678 | 1 742 | +20 / −8 |
| T3 · Codex CLI · Passage 2 | T3 | Codex CLI | 2 | 55,1 | 12/12 | 112 393 | 2 561 | +21 / −6 |
| T3 · Codex CLI · Passage 3 | T3 | Codex CLI | 3 | 39,8 | 12/12 | 109 749 | 1 593 | +21 / −5 |
Télécharger les tâches et les fichiers de notation
L’archive regroupe les tâches initiales, les tests cachés, les scripts d’exécution, un résumé des 18 résultats (JSON) et les modifications de code de chaque exécution (diff). Vous pouvez reproduire les mesures avec la même méthode.
Télécharger coding-agents-2026-10.zip