Valumigo

Epoch AI · 自律的なコンピューター作業(Terminal-Bench)

公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

このランキングの読み方

測定する能力: ターミナル環境で複数のステップを経てタスクを完了するTerminal-Bench 2.0です。プログラムの使用、インストール・設定・デバッグなどのコマンドライン作業を扱います。

スコアの読み方: 採点テストを通過したタスクの割合(%)で、複数回の実行の平均として報告される場合もあります。Claude Code・Codex CLIなどのツールとモデルの組み合わせを評価します。

注意点: エージェントのツールや設定によってスコアが変わります。Epochのモデルごとの代表値は、最も高いスコアを出したモデルとエージェントの組み合わせなので、実行ツールも確認してください。

今回のランキングから読み取れること

  • 最高スコアはGPT-5.5の84.7%です。
  • 1位と5位の差は4.9%pです。
  • 上位10モデルのうち、OpenAIのモデルが5モデルで最も多くなっています。
  • この試験の結果が公開されているモデルは30件です。

自律的なコンピューター作業(Terminal-Bench) Epoch AI

Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04

OGPT-5.5
84.7%
OGPT-5.4
81.8%
GoogleGemini 3.1 Pro Preview
80.2%
AnthropicClaude Opus 4.7
80.2%
AnthropicClaude Opus 4.6
79.8%
OGPT-5.3 Codex
78.4%
GoogleGemini 3 Pro Preview
69.4%
OGPT-5.2 Codex
66.5%
OGPT-5.2
64.9%
GoogleGemini 3 Flash Preview
64.3%
AnthropicClaude Opus 4.5
63.1%
OGPT-5.1 Codex Mini
61.6%
?
61.2%
OGPT-5.1-Codex-Max
60.4%
OGPT-5.1 Codex
57.8%
xgrok-4-20
57.3%
AnthropicClaude Sonnet 4.6
53.4%
ZGLM-5
52.4%
OGPT-5
49.6%
OGPT-5.1
47.6%

棒は正答率(%)を示し、0%から描画しています。

表で見る(上位30件)
順位モデル開発元リリース日スコア
1#1OGPT-5.5(unknown thinking)OpenAI2026-04-2384.7%
2#2OGPT-5.4(unknown thinking)OpenAI2026-03-0581.8%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1980.2%
4#4AnthropicClaude Opus 4.7(unknown)Anthropic2026-04-1680.2%
5#5AnthropicClaude Opus 4.6(unknown thinking)Anthropic2026-02-0579.8%
6#6OGPT-5.3 CodexOpenAI2026-02-0578.4%
7#7GoogleGemini 3 Pro PreviewGoogle2025-11-1869.4%
8#8OGPT-5.2 CodexOpenAI2025-12-1866.5%
9#9OGPT-5.2(unknown thinking)OpenAI2025-12-1164.9%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1764.3%
11#11AnthropicClaude Opus 4.5(unknown thinking)Anthropic2025-11-2463.1%
12#12OGPT-5.1 Codex MiniOpenAI2025-11-1261.6%
13#13??61.2%
14#14OGPT-5.1-Codex-MaxOpenAI2025-11-1960.4%
15#15OGPT-5.1 CodexOpenAI2025-11-1257.8%
16#16xgrok-4-20xAI2026-02-1757.3%
17#17AnthropicClaude Sonnet 4.6(unknown thinking)Anthropic2026-02-1753.4%
18#18ZGLM-5Z.ai2026-02-1152.4%
19#19OGPT-5(unknown thinking)OpenAI2025-08-0749.6%
20#20OGPT-5.1(medium)OpenAI2025-11-1347.6%
21#21AnthropicClaude Sonnet 4.5(unknown thinking)Anthropic2025-09-2946.5%
22#22MiniMaxMiniMax-M2.7MiniMax2026-03-1845.1%
23#23OGPT-5-codexOpenAI2025-09-1544.3%
24#24Moonshot AIKimi K2.5Moonshot AI2026-01-2743.2%
25#25MiniMaxMiniMax-M2.5MiniMax2026-02-1242.7%
26#26DeepSeekDeepSeek-V3.2(Thinking; Novita)DeepSeek2025-12-0139.6%
27#27Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0538.0%
28#28AnthropicClaude Opus 4.1(unknown thinking)Anthropic2025-08-0538.0%
29#29MiniMaxMiniMax-M2.1MiniMax2025-12-2336.6%
30#30Moonshot AIKimi K2 ThinkingMoonshot AI2025-11-0635.7%

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings