Valumigo

Claude Opus 5

Anthropic · 2026-07-24

基本信息

开发机构
AnthropicAnthropic
发布日期
2026-07-24
综合能力指数(ECI)
162.9

测试分数(Epoch AI)

同时显示模型在每项测试的参评模型中的排名。

Anthropic博士级科学问题(GPQA Diamond) · 共 30 个,排名第 12
93.9%
Anthropic顶级难度数学(FrontierMath) · 共 30 个,排名第 11
85.6%
Anthropic陌生谜题推理(ARC-AGI-2) · 共 30 个,排名第 4
90.4%
Anthropic事实问答准确率(SimpleQA Verified) · 共 30 个,排名第 16
59.9%
Anthropic电脑界面操作(OSWorld 2.0) · 共 9 个,排名第 1
31.4%

柱状条表示正确率(%),从 0% 起绘制。

用户投票排名(LMArena)

该排名基于用户比较两个模型的回答后进行的投票。模型不会出现在投票数尚不足的排行榜中。

  • 综合共 413 个,排名第 4 · 1504
  • 中文共 389 个,排名第 2 · 1571
  • 网页开发共 50 个,排名第 1 · 1815
  • 文档理解共 44 个,排名第 1 · 1516
  • 创意写作共 411 个,排名第 2 · 1516
  • 智能体综合共 50 个,排名第 2 · 0.138
  • 数学共 396 个,排名第 3 · 1521
  • 韩语共 278 个,排名第 3 · 1498
  • 日语共 274 个,排名第 4 · 1506
  • 智能体任务成功共 50 个,排名第 4 · 0.141
  • 英语共 413 个,排名第 6 · 1506
  • 德语共 307 个,排名第 6 · 1506
  • 西班牙语共 295 个,排名第 10 · 1484
  • 编程共 408 个,排名第 12 · 1538
  • 图像理解(视觉)共 50 个,排名第 14 · 1289
  • 法语共 290 个,排名第 17 · 1506

在哪里使用

Anthropic 的模型主要可在 Claude 中使用。各订阅方案可使用的模型和用量不同,请在价格与免费额度页面查看。

查看 Claude 价格与免费额度 →

实测记录

针对第 1 轮任务过于简单的反馈,我们在小型商城代码中设置了多文件错误、按规格实现功能及并发错误任务。公开 18 次运行记录和任务文件。

Claude Code vs Codex 第 2 轮:3 个多文件实务任务,各运行 3 次
分数和排名均原样转载自公开资料,并非本站自行测评的结果。由于各资料中的模型名称略有差异,本站采用自动匹配,因此偶尔可能混入其他版本的数据。

来源: Epoch AI (CC BY 4.0) · 核实日期 2026-10-04 · LMArena (CC BY 4.0) · 核实日期 2026-10-04