Valumigo

GPT-6.1 Sol

OpenAI · 2026-09-29

基本信息

开发机构
OOpenAI
发布日期
2026-09-29
综合能力指数(ECI)
尚未测评

官方视频

OpenAI DevDay 2026 Keynote (FULL) · OpenAI

测试分数(Epoch AI)

同时显示模型在每项测试的参评模型中的排名。

O博士级科学问题(GPQA Diamond) · 共 30 个,排名第 3
95.4%
O顶级难度数学(FrontierMath) · 共 30 个,排名第 1
93.7%
O事实问答准确率(SimpleQA Verified) · 共 30 个,排名第 2
73.9%

柱状条表示正确率(%),从 0% 起绘制。

用户投票排名(LMArena)

该排名基于用户比较两个模型的回答后进行的投票。模型不会出现在投票数尚不足的排行榜中。

  • 综合共 413 个,排名第 21 · 1483
  • 中文共 389 个,排名第 59 · 1500
  • 智能体任务成功共 50 个,排名第 2 · 0.155
  • 网页开发共 50 个,排名第 4 · 1758
  • 智能体综合共 50 个,排名第 5 · 0.112
  • 编程共 408 个,排名第 8 · 1542
  • 图像理解(视觉)共 50 个,排名第 10 · 1291
  • 英语共 413 个,排名第 13 · 1496
  • 创意写作共 411 个,排名第 27 · 1460

在哪里使用

OpenAI 的模型主要可在 ChatGPT 中使用。各订阅方案可使用的模型和用量不同,请在价格与免费额度页面查看。

查看 ChatGPT 价格与免费额度 →

实测记录

针对第 1 轮任务过于简单的反馈,我们在小型商城代码中设置了多文件错误、按规格实现功能及并发错误任务。公开 18 次运行记录和任务文件。

Claude Code vs Codex 第 2 轮:3 个多文件实务任务,各运行 3 次
分数和排名均原样转载自公开资料,并非本站自行测评的结果。由于各资料中的模型名称略有差异,本站采用自动匹配,因此偶尔可能混入其他版本的数据。

来源: Epoch AI (CC BY 4.0) · 核实日期 2026-10-04 · LMArena (CC BY 4.0) · 核实日期 2026-10-04