Claude Opus 5
Anthropic · 2026-07-24
基本信息
- 开发机构
- Anthropic
- 发布日期
- 2026-07-24
- 综合能力指数(ECI)
- 162.9
测试分数(Epoch AI)
同时显示模型在每项测试的参评模型中的排名。
博士级科学问题(GPQA Diamond) · 共 30 个,排名第 12
93.9%
顶级难度数学(FrontierMath) · 共 30 个,排名第 11
85.6%
陌生谜题推理(ARC-AGI-2) · 共 30 个,排名第 4
90.4%
事实问答准确率(SimpleQA Verified) · 共 30 个,排名第 16
59.9%
电脑界面操作(OSWorld 2.0) · 共 9 个,排名第 1
31.4%
柱状条表示正确率(%),从 0% 起绘制。
用户投票排名(LMArena)
该排名基于用户比较两个模型的回答后进行的投票。模型不会出现在投票数尚不足的排行榜中。
- 综合共 413 个,排名第 4 · 1504
- 中文共 389 个,排名第 2 · 1571
- 网页开发共 50 个,排名第 1 · 1815
- 文档理解共 44 个,排名第 1 · 1516
- 创意写作共 411 个,排名第 2 · 1516
- 智能体综合共 50 个,排名第 2 · 0.138
- 数学共 396 个,排名第 3 · 1521
- 韩语共 278 个,排名第 3 · 1498
- 日语共 274 个,排名第 4 · 1506
- 智能体任务成功共 50 个,排名第 4 · 0.141
- 英语共 413 个,排名第 6 · 1506
- 德语共 307 个,排名第 6 · 1506
- 西班牙语共 295 个,排名第 10 · 1484
- 编程共 408 个,排名第 12 · 1538
- 图像理解(视觉)共 50 个,排名第 14 · 1289
- 法语共 290 个,排名第 17 · 1506
在哪里使用
Anthropic 的模型主要可在 Claude 中使用。各订阅方案可使用的模型和用量不同,请在价格与免费额度页面查看。
实测记录
针对第 1 轮任务过于简单的反馈,我们在小型商城代码中设置了多文件错误、按规格实现功能及并发错误任务。公开 18 次运行记录和任务文件。
Claude Code vs Codex 第 2 轮:3 个多文件实务任务,各运行 3 次分数和排名均原样转载自公开资料,并非本站自行测评的结果。由于各资料中的模型名称略有差异,本站采用自动匹配,因此偶尔可能混入其他版本的数据。
来源: Epoch AI (CC BY 4.0) · 核实日期 2026-10-04 · LMArena (CC BY 4.0) · 核实日期 2026-10-04