Valumigo

Epoch AI · 电脑界面操作(OSWorld 2.0)

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: XLANG Lab 的 OSWorld 2.0 由在真实操作系统中执行的 108 项长时桌面与网页任务组成。这是一项独立于原版 OSWorld、难度更高的测试。

如何解读分数: Epoch 的默认指标是通过任务全部评分检查点的完全成功率(%),不同于仅完成部分任务的部分得分。

注意事项: 分数因运行环境、工具设置和允许的步骤数而异。Epoch 显示默认 500 步预算下的结果,请确认比较条件是否相同。

本次排名的解读要点

  • 最高分为 Claude Opus 5 的 31.4%。
  • 第 1 名与第 5 名的差距为 18.4%p。
  • 前 9 个模型中,Anthropic 的模型有 4 个,数量最多。
  • 已有 9 个模型公开了此测试的结果。

电脑界面操作(OSWorld 2.0) Epoch AI

数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04

AnthropicClaude Opus 5
31.4%
OGPT-5.6 Sol
27.3%
AnthropicClaude Opus 4.8
20.6%
AnthropicClaude Opus 4.7
18.2%
OGPT-5.5
13.0%
AnthropicClaude Sonnet 4.6
9.3%
MiniMaxMiniMax-M3
4.6%
Moonshot AIKimi K2.6
4.6%
AlibabaQwen3.7 Plus
2.8%

柱状条表示正确率(%),从 0% 起绘制。

查看表格(前 9 名)
排名模型开发方发布日期分数
1#1AnthropicClaude Opus 5(max)Anthropic2026-07-2431.4%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0927.3%
3#3AnthropicClaude Opus 4.8Anthropic2026-05-2820.6%
4#4AnthropicClaude Opus 4.7(max)Anthropic2026-04-1618.2%
5#5OGPT-5.5(xhigh)OpenAI2026-04-2313.0%
6#6AnthropicClaude Sonnet 4.6(medium)Anthropic2026-02-179.3%
7#7MiniMaxMiniMax-M3MiniMax2026-06-014.6%
8#8Moonshot AIKimi K2.6Moonshot AI2026-04-204.6%
9#9AlibabaQwen3.7 PlusAlibaba2026-06-022.8%

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings