Valumigo

Claude Code vs Codex: dieselben 3 Coding-Aufgaben jeweils 3-mal getestet

Bei der Wahl eines Coding-Agenten interessiert vor allem: „Wer erledigt dieselbe Aufgabe besser und schneller?“ Wir haben 3 kleine Aufgaben erstellt, Claude Code und Codex CLI jeweils 3-mal dieselben Anweisungen gegeben und die Ergebnisse mit verborgenen Tests bewertet, die die Agenten nicht einsehen konnten.

Ausgeführt am 2026-10-04

Auf einen Blick

  • Korrektheit: Beide Tools bestanden in allen 9 Durchläufen sämtliche verborgenen Tests. Bei Aufgaben dieser Größe zeigte sich kein Unterschied in der Korrektheit der Ergebnisse.
  • Geschwindigkeit: Gemessen am Median je Aufgabe war Codex (GPT-6.1 Sol) etwa 1.8~2-mal so schnell wie Claude Code (Claude Opus 5). Der Unterschied betrug je nach Aufgabe 16~43 Sekunden.
  • Tokens: Gemessen am Median pro Aufgabe verarbeitete Claude Code etwa 4.2~5.7-mal so viele Eingabetokens (einschließlich wiederverwendeter Cache-Tokens) und etwa 3.5~4.3-mal so viele Ausgabetokens wie Codex. Auch bei einer erneuten Ausführung von T1 mit deaktivierten MCP-Tool-Verbindungen war die Anzahl der Eingabetokens ähnlich (etwa 397.000), doch die Ursache des Unterschieds ließ sich nicht eindeutig feststellen.
  • Code: Bei der Fehlerbehebung änderten beide Tools dieselben drei Zeilen. Bei der Leistungsaufgabe schrieb Codex Code, der auch ein sehr seltenes Verhalten des Originalcodes beibehielt (wenn id NaN ist). Claude Code schrieb kürzeren Code und ergänzte erklärende Kommentare.
  • Gemini: Auch Gemini CLI wurde unter denselben Bedingungen ausgeführt, brach jedoch sofort bei der Authentifizierung ab. Grund ist die Einstellung des Gemini CLI-Dienstes für persönliche Konten sowie Konten mit Google AI Pro und Google AI Ultra seit dem 18. Juni 2026.

Ergebnisse

Die Zeit ist der Median aus 3 Durchläufen; in Klammern stehen der schnellste~langsamste Wert.

AufgabeToolBestanden (in allen 3 Durchläufen)LaufzeitEingabetokensAusgabetokensGeänderte Zeilen (+/−)
T1 FehlerbehebungClaude Code3/336,6s (36,1–48,7)356.1961.913+3 / −3
Codex CLI3/320,3s (19,1–32,5)85.176486+3 / −3
T2 FunktionsimplementierungClaude Code3/369,8s (66–73,6)615.0195.379+64 / −2
Codex CLI3/338,2s (33,2–39,1)107.4281.265+53 / −2
T3 LeistungsoptimierungClaude Code3/387,2s (85,3–104,3)561.7326.085+26 / −12
Codex CLI3/344,2s (39,8–55,1)109.7491.742+21 / −6

Die Eingabetokens bestehen größtenteils aus per Cache wiederverwendeten Tokens beim erneuten Lesen vorheriger Gesprächsschritte. Da die beiden CLIs Tokens unterschiedlich zählen, dienen die Werte nur zum ungefähren Größenvergleich.

Claude Code meldet bei jedem Durchlauf auch die auf reguläre API-Preise umgerechneten Kosten (in diesem Praxistest etwa 0.53~1.04 USD je Aufgabe). Bei Abonnementkonten wird dieser Betrag nicht zusätzlich berechnet; die Nutzung wird auf das Kontingent des Tarifs angerechnet. Codex meldet keinen entsprechenden Wert, daher haben wir diese Kosten nicht verglichen.

Die 3 Aufgaben

T1 Fehlerbehebung

Der Code zur Datumsberechnung für Unterkunftsbuchungen (dates.js) enthält 3 Fehler: Monate werden nicht ab 0 gezählt, die Anzahl der Übernachtungen ist um 1 zu hoch und bei der Berechnung der Geschäftstage fehlt der letzte Tag. Die verborgenen Tests prüfen unter anderem Schaltjahre, Jahreswechsel und Tage mit Zeitumstellung.

T2 Funktionsimplementierung

Aufgabe ist, einen CSV-Parser gemäß der Anleitung (README) von Grund auf zu erstellen. Verborgene Tests prüfen Kommas und Zeilenumbrüche innerhalb von Anführungszeichen, die Verarbeitung doppelter Anführungszeichen (""), Windows-Zeilenumbrüche (CRLF), leere Felder und Fehler bei nicht geschlossenen Anführungszeichen.

T3 Leistungsoptimierung

Der Code zur Auswertung von 200.000 Bestellungen (Entfernen von Duplikaten, Kundenrangliste, Tagessummen) ist zu langsam. Er soll bei unveränderten Ergebnissen in weniger als 1 Sekunde fertig werden. Verborgene Tests prüfen, ob die Ergebnisse dem Originalcode entsprechen, die Reihenfolge bei Gleichständen erhalten bleibt und auch 300.000 Bestellungen in weniger als 1 Sekunde verarbeitet werden.

Anweisung für alle Durchläufe

Im folgenden Text ändert sich je Aufgabe nur der eine Satz nach „Task:“.

This folder is a small Node.js project (ES modules, no dependencies). Read the code, README.md if present, and the tests. Task: {task} Do not modify existing test files. When you are done, make sure `node --test` passes.
  • T1 Fehlerbehebung — Fix the bugs in dates.js so that every function behaves as its comment describes and the tests pass.
  • T2 Funktionsimplementierung — Implement parseCSV in csv.js according to README.md.
  • T3 Leistungsoptimierung — Make report.js fast enough as described in README.md, without changing any results.

So haben wir gemessen

  • Ausgeführt am 2026-10-04 (abends, koreanische Zeit), Apple M1 Pro · macOS 26.6 · Node.js 22.
  • Claude Code 2.1.250 — Standardmodell Claude Opus 5 (für kurze Nebenaufgaben wurde zusätzlich Claude Haiku 4.5 aufgerufen). Codex CLI 0.159.2 — Modell GPT-6.1 Sol, Reasoning-Stufe medium.
  • Beide Tools wurden mit den persönlichen Abonnementkonten des Betreibers im nicht interaktiven Modus (claude -p, codex exec) ausgeführt. Dateiänderungen und die Ausführung von node waren automatisch erlaubt.
  • Vor jedem Durchlauf kopierten wir die Originalaufgabe in einen neuen Ordner. Um den Einfluss der Reihenfolge zu verringern, lief in Durchlauf 1 und 3 Claude Code zuerst, in Durchlauf 2 Codex.
  • Die Zeit wurde vom Start bis zum Ende des Befehls gemessen. Die Tokenwerte wurden unverändert aus den Ergebnisangaben der jeweiligen CLI übernommen.

Bewertungsmethode

  • Jede Aufgabe enthielt 3 für den Agenten sichtbare Tests und verborgene Tests (9~14), die erst bei der Bewertung hinzugefügt wurden. Die verborgenen Tests wurden vorab mit einer vom Betreiber selbst geschriebenen Referenzlösung überprüft.
  • Vor der Bewertung wurden die sichtbaren Testdateien auf den Originalstand zurückgesetzt. In keinem der 18 Durchläufe änderten die Agenten eine Testdatei.
  • Da Datumsfehler möglicherweise nur in Regionen mit Sommerzeit auftreten, wurden die Tests jeweils in den Zeitzonen von New York und Berlin ausgeführt und die niedrigere Bewertung erfasst.

Wie unterschied sich der Code der beiden Tools?

  • T1: Beide Tools korrigierten bei jeweils 3 Durchläufen, also insgesamt 6 Durchläufen, dieselben drei Zeilen (Monatsberechnung, Entfernung von +1 bei der Anzahl der Übernachtungen, Einbeziehung des letzten Tages). Auch die Anzahl der geänderten Zeilen war jedes Mal gleich: 3 hinzugefügte und 3 gelöschte Zeilen.
  • T2: Beide verwendeten einen Parser, der die Zeichen einzeln liest. Claude Code fügte 63~67 Zeilen hinzu, Codex 53~55 Zeilen. Claude Code enthielt etwas mehr erklärende Kommentare.
  • T3: Beide ersetzten die wiederholte Suche vom Listenanfang durch Hash-Strukturen (Map·Set). Codex übernahm auch das Verhalten des Originalcodes, Einträge mit id gleich NaN nicht als Duplikate zu behandeln. Claude Code erklärte in einem Kommentar, warum bei Gleichständen die ursprüngliche Reihenfolge erhalten bleibt.

Warum fehlt Gemini?

  • Gemini CLI 0.58.0 wurde ebenfalls mit denselben Aufgaben und Anweisungen ausgeführt, brach aber bei allen drei Aufgaben innerhalb von 4 Sekunden mit einem Authentifizierungsfehler ab. Fehlermeldung: "This client is no longer supported for Gemini Code Assist for individuals. To continue using Gemini, please migrate to the Antigravity suite of products".
  • Laut offizieller Mitteilung von Google bearbeiten Gemini CLI und die IDE-Erweiterung Gemini Code Assist seit dem 18. Juni 2026 keine Anfragen mehr aus den Stufen Gemini Code Assist für Privatpersonen, Google AI Pro und Google AI Ultra. Stattdessen empfiehlt Google Antigravity und Antigravity CLI (agy).
  • Für dieselbe Messung mit Antigravity CLI ist zunächst eine einmalige interaktive Anmeldung erforderlich. Deshalb wurde es in diese Messung nicht einbezogen.

Offizielle Versionshinweise zu Gemini Code Assist

Grenzen dieses Praxistests

  • Der Test umfasst 3 kleine Aufgaben mit jeweils einer Datei und nur 3 Durchläufen. Bei großen Repositories, unklaren Anforderungen oder Änderungen an mehreren Dateien können die Ergebnisse anders ausfallen.
  • Die Laufzeit hängt von Serverauslastung, Netzwerk sowie Modell- und CLI-Version ab. Durch abwechselnde Ausführung am selben Tag auf demselben Computer haben wir diese Einflüsse verringert, aber nicht beseitigt.
  • Codex lief mit der Reasoning-Stufe medium (Einstellung des Betreibers), Claude Code mit den Standardeinstellungen. Andere Reasoning-Stufen oder Modelle verändern Geschwindigkeit und Tokenverbrauch.
  • Wie stark das Nutzungskontingent der Abonnementtarife abnahm, haben wir nicht gemessen.

Welches Tool eignet sich also?

Die folgenden Einschätzungen des Betreibers beruhen auf diesen Messergebnissen.

  • Bei klar abgegrenzten Aufgaben wie kleinen Fehlerbehebungen oder der Implementierung einzelner Funktionen zeigte dieser Praxistest keinen Unterschied in den Ergebnissen der beiden Tools. Es ist sinnvoll, zuerst das Tool zu nutzen, das im bereits bezahlten Abonnement (ChatGPT oder Claude) enthalten ist.
  • Wenn Sie dieselbe Aufgabe häufig und schnell ausführen müssen, war Codex in diesem Praxistest etwa 2-mal so schnell und verbrauchte weniger Tokens.
  • Claude Code prüfte tendenziell in mehr Schritten und hinterließ erklärende Kommentare. Das kann hilfreich sein, wenn Menschen den erzeugten Code lesen und prüfen müssen.
  • Privatpersonen, die Gemini genutzt haben, müssen zu Antigravity CLI wechseln, da Gemini CLI nicht mehr funktioniert.

ClaudeChatGPT (Codex)Agenten

Alle 18 Durchläufe

AufgabeToolDurchlaufSekundenBestandene TestsEingabetokensAusgabetokensGeänderte Zeilen (+/−)
T1Claude Code148,715/15356.1962.540+3 / −3
T1Claude Code236,115/15291.0261.913+3 / −3
T1Claude Code336,615/15537.0291.781+3 / −3
T1Codex CLI132,515/15107.102776+3 / −3
T1Codex CLI219,115/1585.176485+3 / −3
T1Codex CLI320,315/1570.801486+3 / −3
T2Claude Code16617/17551.8915.379+63 / −2
T2Claude Code273,617/17618.6365.603+64 / −2
T2Claude Code369,817/17615.0195.240+67 / −2
T2Codex CLI138,217/17107.4281.228+53 / −2
T2Codex CLI233,217/1787.4321.265+53 / −2
T2Codex CLI339,117/17107.4611.268+55 / −2
T3Claude Code187,212/12428.5015.398+19 / −11
T3Claude Code2104,312/12628.3096.880+29 / −15
T3Claude Code385,312/12561.7326.085+26 / −12
T3Codex CLI144,212/1289.6781.742+20 / −8
T3Codex CLI255,112/12112.3932.561+21 / −6
T3Codex CLI339,812/12109.7491.593+21 / −5

Aufgaben und Bewertungsdateien herunterladen

Das Paket enthält die Originalaufgaben, verborgenen Tests, Ausführungsskripte, eine Zusammenfassung der 18 Durchläufe (JSON) und die Codeänderungen jedes Durchlaufs (diff). Damit können Sie die Messungen selbst auf dieselbe Weise wiederholen.

coding-agents-2026-10.zip herunterladen