GPT-6.1 Sol
OpenAI · 2026-09-29
基本信息
- 开发机构
- OOpenAI
- 发布日期
- 2026-09-29
- 综合能力指数(ECI)
- 尚未测评
官方视频
测试分数(Epoch AI)
同时显示模型在每项测试的参评模型中的排名。
O博士级科学问题(GPQA Diamond) · 共 30 个,排名第 3
95.4%
O顶级难度数学(FrontierMath) · 共 30 个,排名第 1
93.7%
O事实问答准确率(SimpleQA Verified) · 共 30 个,排名第 2
73.9%
柱状条表示正确率(%),从 0% 起绘制。
用户投票排名(LMArena)
该排名基于用户比较两个模型的回答后进行的投票。模型不会出现在投票数尚不足的排行榜中。
- 综合共 413 个,排名第 21 · 1483
- 中文共 389 个,排名第 59 · 1500
- 智能体任务成功共 50 个,排名第 2 · 0.155
- 网页开发共 50 个,排名第 4 · 1758
- 智能体综合共 50 个,排名第 5 · 0.112
- 编程共 408 个,排名第 8 · 1542
- 图像理解(视觉)共 50 个,排名第 10 · 1291
- 英语共 413 个,排名第 13 · 1496
- 创意写作共 411 个,排名第 27 · 1460
在哪里使用
OpenAI 的模型主要可在 ChatGPT 中使用。各订阅方案可使用的模型和用量不同,请在价格与免费额度页面查看。
实测记录
针对第 1 轮任务过于简单的反馈,我们在小型商城代码中设置了多文件错误、按规格实现功能及并发错误任务。公开 18 次运行记录和任务文件。
Claude Code vs Codex 第 2 轮:3 个多文件实务任务,各运行 3 次分数和排名均原样转载自公开资料,并非本站自行测评的结果。由于各资料中的模型名称略有差异,本站采用自动匹配,因此偶尔可能混入其他版本的数据。
来源: Epoch AI (CC BY 4.0) · 核实日期 2026-10-04 · LMArena (CC BY 4.0) · 核实日期 2026-10-04