Claude Code vs Codex:同じコーディング課題3個を3回ずつ実行させてみました
コーディングエージェントを選ぶ際、最も気になるのは「同じ仕事を頼むと、どちらがより正確に、より速くこなすか」です。小さな課題3個を作り、Claude CodeとCodex CLIに同じ文章で3回ずつ実行させ、エージェントが見られない非公開テストで採点しました。
実行日 2026-10-04
ひと目でわかる結果
- 正答率:両ツールとも9回すべての実行で、非公開テストにすべて合格しました。この規模の課題では、成果物の正確さに差は見られませんでした。
- 速度:課題別の中央値では、Codex(GPT-6.1 Sol)がClaude Code(Claude Opus 5)より約1.8~2倍速く完了しました。差は課題ごとに16~43秒でした。
- トークン:課題ごとの中央値では、Claude Codeが処理した入力トークン(キャッシュ再利用を含む)はCodexの約4.2~5.7倍、出力トークンは約3.5~4.3倍でした。MCPツール接続をすべて無効にしてT1をもう一度実行した際も、入力トークン数(約39.7万)は同程度でしたが、差の原因は特定できませんでした。
- コード:バグ修正課題では、両ツールが同じ3行を修正しました。性能課題では、Codexは元のコードの非常にまれな動作(idがNaNの場合)まで維持するコードを書き、Claude Codeはより短いコードに理由を説明するコメントを付けました。
- Gemini:Gemini CLIも同じ条件で実行しましたが、認証段階ですぐに停止しました。2026年6月18日から、個人・Google AI Pro・Ultraアカウント向けのGemini CLIサービスが終了したためです。
結果
時間は3回の中央値、括弧内は最速~最遅の値です。
| 課題 | ツール | 合格(3回すべて) | 所要時間 | 入力トークン | 出力トークン | 変更行数(+/−) | |
|---|---|---|---|---|---|---|---|
| T1 バグ修正 · Claude Code | T1 バグ修正 | Claude Code | 3/3 | 36.6s (36.1–48.7) | 356,196 | 1,913 | +3 / −3 |
| T1 バグ修正 · Codex CLI | Codex CLI | 3/3 | 20.3s (19.1–32.5) | 85,176 | 486 | +3 / −3 | |
| T2 機能実装 · Claude Code | T2 機能実装 | Claude Code | 3/3 | 69.8s (66–73.6) | 615,019 | 5,379 | +64 / −2 |
| T2 機能実装 · Codex CLI | Codex CLI | 3/3 | 38.2s (33.2–39.1) | 107,428 | 1,265 | +53 / −2 | |
| T3 性能改善 · Claude Code | T3 性能改善 | Claude Code | 3/3 | 87.2s (85.3–104.3) | 561,732 | 6,085 | +26 / −12 |
| T3 性能改善 · Codex CLI | Codex CLI | 3/3 | 44.2s (39.8–55.1) | 109,749 | 1,742 | +21 / −6 |
入力トークンの大部分には、前段階の会話を再読するキャッシュ再利用分が含まれます。両CLIのトークンの数え方は同じではないため、おおよその規模の比較としてご覧ください。
Claude Codeは実行ごとに「APIの通常料金に換算した費用」も報告します(今回の実測では課題あたり約0.53~1.04米ドル)。サブスクリプションアカウントでは、この金額を別途支払うのではなく、プランの利用上限から差し引かれます。Codexは同じ値を報告しないため、比較していません。
3個の課題
T1 バグ修正
宿泊予約用の日付計算コード(dates.js)に3個のバグがあります。月を0から数えていない問題、宿泊日数を1日多く数える問題、営業日計算で最終日が抜ける問題です。非公開テストでは、うるう年、年末、夏時間への切り替え日などを確認します。
T2 機能実装
説明書(README)に従ってCSVパーサーを一から作る課題です。引用符内のカンマ・改行、二重引用符2個("")の処理、Windowsの改行(CRLF)、空欄、閉じられていない引用符のエラーを非公開テストで確認します。
T3 性能改善
注文20万件を集計するコード(重複除去、顧客ランキング、日別合計)が遅すぎます。結果を変えずに1秒以内で完了するよう修正する課題です。非公開テストでは、元のコードと結果が同じか、同点時の順序が維持されるか、30万件でも1秒以内に完了するかを確認します。
すべての実行で使った指示文
以下の文章では、「Task:」の後の1文だけが課題ごとに変わります。
This folder is a small Node.js project (ES modules, no dependencies). Read the code, README.md if present, and the tests. Task: {task} Do not modify existing test files. When you are done, make sure `node --test` passes.- T1 バグ修正 —
Fix the bugs in dates.js so that every function behaves as its comment describes and the tests pass. - T2 機能実装 —
Implement parseCSV in csv.js according to README.md. - T3 性能改善 —
Make report.js fast enough as described in README.md, without changing any results.
測定方法
- 実行日2026-10-04(韓国時間の夕方)、Apple M1 Pro · macOS 26.6 · Node.js 22。
- Claude Code 2.1.250 — デフォルトモデルClaude Opus 5(短い補助作業ではClaude Haiku 4.5も呼び出されました)。Codex CLI 0.159.2 — モデルGPT-6.1 Sol、推論強度medium。
- 両ツールとも運営者個人のサブスクリプションアカウントでログインし、非対話モード(claude -p、codex exec)で実行しました。ファイルの変更とnodeの実行は自動で許可しました。
- 実行のたびに元の課題を新しいフォルダーにコピーしました。順序の影響を抑えるため、1・3回目はClaude Codeを先に、2回目はCodexを先に実行しました。
- 時間はコマンドの開始から終了までを測定した値です。トークンは各CLIが実行結果で報告した値をそのまま記載しました。
採点方法
- 各課題に、エージェントが見られるテスト3個と、採点時だけ追加する非公開テスト(9~14個)を用意しました。非公開テストは、運営者が自分で書いた正解コードで事前に検証しました。
- 採点前に、公開テストのファイルを元の状態に戻しました。18回すべてで、エージェントはテストファイルを変更していませんでした。
- 日付のバグは夏時間のある地域でのみ発生する場合があるため、ニューヨークとベルリンのタイムゾーンでそれぞれ実行し、低い方の点数を記録しました。
両ツールが書いたコードの違い
- T1:両ツールがそれぞれ3回、計6回すべてで同じ3行(月の計算、宿泊日数の+1の削除、最終日の算入)を修正しました。変更行数も毎回3行追加・3行削除で同じでした。
- T2:どちらも文字を1文字ずつ読み取る方式のパーサーを使用しました。追加行数はClaude Codeが63~67行、Codexが53~55行で、Claude Codeのほうが説明コメントがやや多めでした。
- T3:どちらも「毎回リストを先頭から検索する」部分をハッシュ(Map・Set)に置き換えました。Codexは、idがNaNの場合に元のコードが重複とみなさない動作まで再現しました。Claude Codeは、同点時に最初に出現した順序が維持される理由をコメントに残しました。
Geminiを除外した理由
- Gemini CLI 0.58.0も同じ課題・同じ指示文で実行しましたが、3課題すべてが4秒以内に認証エラーで終了しました。エラー内容:"This client is no longer supported for Gemini Code Assist for individuals. To continue using Gemini, please migrate to the Antigravity suite of products"。
- Googleの公式発表によると、2026年6月18日からGemini CLIとGemini Code Assist IDE拡張機能は、個人向けGemini Code Assist、Google AI Pro、Google AI Ultraの各プランからのリクエストを処理しません。代わりにAntigravityとAntigravity CLI (agy)の利用を案内しています。
- Antigravity CLIで同じ実測を行うには初回に対話形式のログインが必要なため、今回の実測には含めませんでした。
この実測の限界
- 課題は小規模な単一ファイルの課題3個で、それぞれ3回しか実行していません。大きなリポジトリ、要件が曖昧な仕事、複数のファイルを修正する仕事では、結果が異なる可能性があります。
- 所要時間はサーバーの混雑、ネットワーク、モデル・CLIのバージョンによって変わります。同じ日に同じコンピューターで交互に実行して影響を抑えましたが、なくすことはできませんでした。
- Codexは推論強度medium(運営者の設定値)、Claude Codeはデフォルト設定で実行しました。推論強度やモデルを変えると、速度とトークン数も変わります。
- サブスクリプションプランの利用上限がどれだけ減ったかは測定していません。
では、何を使うか
以下は、この実測結果に基づく運営者の意見です。
- 小さなバグ修正や関数実装のように範囲が明確な仕事では、今回の実測で両ツールの成果物に差は見られませんでした。すでに契約しているサブスクリプション(ChatGPTまたはClaude)に含まれる方から試すのが合理的です。
- 同じ仕事を何度も速く実行する必要があるなら、今回の実測ではCodexが約2倍速く、トークンも少なく使いました。
- Claude Codeは、より多くの段階を経て確認し、理由をコメントに残す傾向が見られました。生成されたコードを人が読んでレビューする場合、この点が利点になる可能性があります。
- Geminiを使っていた個人ユーザーは、Gemini CLIがもう動作しないため、Antigravity CLIへ移行する必要があります。
18回すべての実行記録
| 課題 | ツール | 実行回 | 秒 | 合格したテスト | 入力トークン | 出力トークン | 変更行数(+/−) | |
|---|---|---|---|---|---|---|---|---|
| T1 · Claude Code · 実行回 1 | T1 | Claude Code | 1 | 48.7 | 15/15 | 356,196 | 2,540 | +3 / −3 |
| T1 · Claude Code · 実行回 2 | T1 | Claude Code | 2 | 36.1 | 15/15 | 291,026 | 1,913 | +3 / −3 |
| T1 · Claude Code · 実行回 3 | T1 | Claude Code | 3 | 36.6 | 15/15 | 537,029 | 1,781 | +3 / −3 |
| T1 · Codex CLI · 実行回 1 | T1 | Codex CLI | 1 | 32.5 | 15/15 | 107,102 | 776 | +3 / −3 |
| T1 · Codex CLI · 実行回 2 | T1 | Codex CLI | 2 | 19.1 | 15/15 | 85,176 | 485 | +3 / −3 |
| T1 · Codex CLI · 実行回 3 | T1 | Codex CLI | 3 | 20.3 | 15/15 | 70,801 | 486 | +3 / −3 |
| T2 · Claude Code · 実行回 1 | T2 | Claude Code | 1 | 66 | 17/17 | 551,891 | 5,379 | +63 / −2 |
| T2 · Claude Code · 実行回 2 | T2 | Claude Code | 2 | 73.6 | 17/17 | 618,636 | 5,603 | +64 / −2 |
| T2 · Claude Code · 実行回 3 | T2 | Claude Code | 3 | 69.8 | 17/17 | 615,019 | 5,240 | +67 / −2 |
| T2 · Codex CLI · 実行回 1 | T2 | Codex CLI | 1 | 38.2 | 17/17 | 107,428 | 1,228 | +53 / −2 |
| T2 · Codex CLI · 実行回 2 | T2 | Codex CLI | 2 | 33.2 | 17/17 | 87,432 | 1,265 | +53 / −2 |
| T2 · Codex CLI · 実行回 3 | T2 | Codex CLI | 3 | 39.1 | 17/17 | 107,461 | 1,268 | +55 / −2 |
| T3 · Claude Code · 実行回 1 | T3 | Claude Code | 1 | 87.2 | 12/12 | 428,501 | 5,398 | +19 / −11 |
| T3 · Claude Code · 実行回 2 | T3 | Claude Code | 2 | 104.3 | 12/12 | 628,309 | 6,880 | +29 / −15 |
| T3 · Claude Code · 実行回 3 | T3 | Claude Code | 3 | 85.3 | 12/12 | 561,732 | 6,085 | +26 / −12 |
| T3 · Codex CLI · 実行回 1 | T3 | Codex CLI | 1 | 44.2 | 12/12 | 89,678 | 1,742 | +20 / −8 |
| T3 · Codex CLI · 実行回 2 | T3 | Codex CLI | 2 | 55.1 | 12/12 | 112,393 | 2,561 | +21 / −6 |
| T3 · Codex CLI · 実行回 3 | T3 | Codex CLI | 3 | 39.8 | 12/12 | 109,749 | 1,593 | +21 / −5 |
課題・採点ファイルをダウンロード
元の課題、非公開テスト、実行スクリプト、18回の結果概要(JSON)、各実行で変更されたコード(diff)をまとめました。同じ方法で自分でも再測定できます。
coding-agents-2026-10.zipをダウンロード