Epoch AI · 电脑界面操作(OSWorld 2.0)
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
如何解读此排行榜
衡量什么: XLANG Lab 的 OSWorld 2.0 由在真实操作系统中执行的 108 项长时桌面与网页任务组成。这是一项独立于原版 OSWorld、难度更高的测试。
如何解读分数: Epoch 的默认指标是通过任务全部评分检查点的完全成功率(%),不同于仅完成部分任务的部分得分。
注意事项: 分数因运行环境、工具设置和允许的步骤数而异。Epoch 显示默认 500 步预算下的结果,请确认比较条件是否相同。
本次排名的解读要点
- 最高分为 Claude Opus 5 的 31.4%。
- 第 1 名与第 5 名的差距为 18.4%p。
- 前 9 个模型中,Anthropic 的模型有 4 个,数量最多。
- 已有 9 个模型公开了此测试的结果。
电脑界面操作(OSWorld 2.0) Epoch AI
数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04
柱状条表示正确率(%),从 0% 起绘制。
查看表格(前 9 名)
| 排名 | 模型 | 开发方 | 发布日期 | 分数 |
|---|---|---|---|---|
| 1 | #1Claude Opus 5(max) | Anthropic | 2026-07-24 | 31.4% |
| 2 | #2OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 27.3% |
| 3 | #3Claude Opus 4.8 | Anthropic | 2026-05-28 | 20.6% |
| 4 | #4Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 18.2% |
| 5 | #5OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 13.0% |
| 6 | #6Claude Sonnet 4.6(medium) | Anthropic | 2026-02-17 | 9.3% |
| 7 | #7MiniMax-M3 | MiniMax | 2026-06-01 | 4.6% |
| 8 | #8Kimi K2.6 | Moonshot AI | 2026-04-20 | 4.6% |
| 9 | #9Qwen3.7 Plus | Alibaba | 2026-06-02 | 2.8% |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings