Epoch AI · 自律的なコンピューター作業(Terminal-Bench)
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: ターミナル環境で複数のステップを経てタスクを完了するTerminal-Bench 2.0です。プログラムの使用、インストール・設定・デバッグなどのコマンドライン作業を扱います。
スコアの読み方: 採点テストを通過したタスクの割合(%)で、複数回の実行の平均として報告される場合もあります。Claude Code・Codex CLIなどのツールとモデルの組み合わせを評価します。
注意点: エージェントのツールや設定によってスコアが変わります。Epochのモデルごとの代表値は、最も高いスコアを出したモデルとエージェントの組み合わせなので、実行ツールも確認してください。
今回のランキングから読み取れること
- 最高スコアはGPT-5.5の84.7%です。
- 1位と5位の差は4.9%pです。
- 上位10モデルのうち、OpenAIのモデルが5モデルで最も多くなっています。
- この試験の結果が公開されているモデルは30件です。
自律的なコンピューター作業(Terminal-Bench) Epoch AI
Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04
棒は正答率(%)を示し、0%から描画しています。
表で見る(上位30件)
| 順位 | モデル | 開発元 | リリース日 | スコア |
|---|---|---|---|---|
| 1 | #1OGPT-5.5(unknown thinking) | OpenAI | 2026-04-23 | 84.7% |
| 2 | #2OGPT-5.4(unknown thinking) | OpenAI | 2026-03-05 | 81.8% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 80.2% | |
| 4 | #4Claude Opus 4.7(unknown) | Anthropic | 2026-04-16 | 80.2% |
| 5 | #5Claude Opus 4.6(unknown thinking) | Anthropic | 2026-02-05 | 79.8% |
| 6 | #6OGPT-5.3 Codex | OpenAI | 2026-02-05 | 78.4% |
| 7 | #7Gemini 3 Pro Preview | 2025-11-18 | 69.4% | |
| 8 | #8OGPT-5.2 Codex | OpenAI | 2025-12-18 | 66.5% |
| 9 | #9OGPT-5.2(unknown thinking) | OpenAI | 2025-12-11 | 64.9% |
| 10 | #10Gemini 3 Flash Preview | 2025-12-17 | 64.3% | |
| 11 | #11Claude Opus 4.5(unknown thinking) | Anthropic | 2025-11-24 | 63.1% |
| 12 | #12OGPT-5.1 Codex Mini | OpenAI | 2025-11-12 | 61.6% |
| 13 | #13? | ? | 61.2% | |
| 14 | #14OGPT-5.1-Codex-Max | OpenAI | 2025-11-19 | 60.4% |
| 15 | #15OGPT-5.1 Codex | OpenAI | 2025-11-12 | 57.8% |
| 16 | #16xgrok-4-20 | xAI | 2026-02-17 | 57.3% |
| 17 | #17Claude Sonnet 4.6(unknown thinking) | Anthropic | 2026-02-17 | 53.4% |
| 18 | #18ZGLM-5 | Z.ai | 2026-02-11 | 52.4% |
| 19 | #19OGPT-5(unknown thinking) | OpenAI | 2025-08-07 | 49.6% |
| 20 | #20OGPT-5.1(medium) | OpenAI | 2025-11-13 | 47.6% |
| 21 | #21Claude Sonnet 4.5(unknown thinking) | Anthropic | 2025-09-29 | 46.5% |
| 22 | #22MiniMax-M2.7 | MiniMax | 2026-03-18 | 45.1% |
| 23 | #23OGPT-5-codex | OpenAI | 2025-09-15 | 44.3% |
| 24 | #24Kimi K2.5 | Moonshot AI | 2026-01-27 | 43.2% |
| 25 | #25MiniMax-M2.5 | MiniMax | 2026-02-12 | 42.7% |
| 26 | #26DeepSeek-V3.2(Thinking; Novita) | DeepSeek | 2025-12-01 | 39.6% |
| 27 | #27claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 38.0% |
| 28 | #28Claude Opus 4.1(unknown thinking) | Anthropic | 2025-08-05 | 38.0% |
| 29 | #29MiniMax-M2.1 | MiniMax | 2025-12-23 | 36.6% |
| 30 | #30Kimi K2 Thinking | Moonshot AI | 2025-11-06 | 35.7% |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings