Epoch AI · 自主完成计算机任务(Terminal-Bench)
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
如何解读此排行榜
衡量什么: Terminal-Bench 2.0 评估在终端环境中通过多个步骤完成任务的能力。涵盖程序使用、安装、配置和调试等命令行任务。
如何解读分数: 通过评分测试的任务比例(%),有时以多次重复运行的平均值报告。评估 Claude Code、Codex CLI 等工具与模型的组合。
注意事项: 分数因智能体工具和设置而异。Epoch 为每个模型展示的代表值来自得分最高的模型与智能体组合,因此请同时查看运行工具。
本次排名的解读要点
- 最高分为 GPT-5.5 的 84.7%。
- 第 1 名与第 5 名的差距为 4.9%p。
- 前 10 个模型中,OpenAI 的模型有 5 个,数量最多。
- 已有 30 个模型公开了此测试的结果。
自主完成计算机任务(Terminal-Bench) Epoch AI
数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04
柱状条表示正确率(%),从 0% 起绘制。
查看表格(前 30 名)
| 排名 | 模型 | 开发方 | 发布日期 | 分数 |
|---|---|---|---|---|
| 1 | #1OGPT-5.5(unknown thinking) | OpenAI | 2026-04-23 | 84.7% |
| 2 | #2OGPT-5.4(unknown thinking) | OpenAI | 2026-03-05 | 81.8% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 80.2% | |
| 4 | #4Claude Opus 4.7(unknown) | Anthropic | 2026-04-16 | 80.2% |
| 5 | #5Claude Opus 4.6(unknown thinking) | Anthropic | 2026-02-05 | 79.8% |
| 6 | #6OGPT-5.3 Codex | OpenAI | 2026-02-05 | 78.4% |
| 7 | #7Gemini 3 Pro Preview | 2025-11-18 | 69.4% | |
| 8 | #8OGPT-5.2 Codex | OpenAI | 2025-12-18 | 66.5% |
| 9 | #9OGPT-5.2(unknown thinking) | OpenAI | 2025-12-11 | 64.9% |
| 10 | #10Gemini 3 Flash Preview | 2025-12-17 | 64.3% | |
| 11 | #11Claude Opus 4.5(unknown thinking) | Anthropic | 2025-11-24 | 63.1% |
| 12 | #12OGPT-5.1 Codex Mini | OpenAI | 2025-11-12 | 61.6% |
| 13 | #13? | ? | 61.2% | |
| 14 | #14OGPT-5.1-Codex-Max | OpenAI | 2025-11-19 | 60.4% |
| 15 | #15OGPT-5.1 Codex | OpenAI | 2025-11-12 | 57.8% |
| 16 | #16xgrok-4-20 | xAI | 2026-02-17 | 57.3% |
| 17 | #17Claude Sonnet 4.6(unknown thinking) | Anthropic | 2026-02-17 | 53.4% |
| 18 | #18ZGLM-5 | Z.ai | 2026-02-11 | 52.4% |
| 19 | #19OGPT-5(unknown thinking) | OpenAI | 2025-08-07 | 49.6% |
| 20 | #20OGPT-5.1(medium) | OpenAI | 2025-11-13 | 47.6% |
| 21 | #21Claude Sonnet 4.5(unknown thinking) | Anthropic | 2025-09-29 | 46.5% |
| 22 | #22MiniMax-M2.7 | MiniMax | 2026-03-18 | 45.1% |
| 23 | #23OGPT-5-codex | OpenAI | 2025-09-15 | 44.3% |
| 24 | #24Kimi K2.5 | Moonshot AI | 2026-01-27 | 43.2% |
| 25 | #25MiniMax-M2.5 | MiniMax | 2026-02-12 | 42.7% |
| 26 | #26DeepSeek-V3.2(Thinking; Novita) | DeepSeek | 2025-12-01 | 39.6% |
| 27 | #27claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 38.0% |
| 28 | #28Claude Opus 4.1(unknown thinking) | Anthropic | 2025-08-05 | 38.0% |
| 29 | #29MiniMax-M2.1 | MiniMax | 2025-12-23 | 36.6% |
| 30 | #30Kimi K2 Thinking | Moonshot AI | 2025-11-06 | 35.7% |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings