Epoch AI · 实际工作成果(GDPval)
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
如何解读此排行榜
衡量什么: OpenAI 创建的 GDPval 要求模型完成多个职业的工作成果,再由领域专家匿名比较模型与人类专家的成果。
如何解读分数: 胜率指模型成果被判定优于人类专家成果的比例(%)。胜出+平局比例指被判定相当或更好的比例,目前 Epoch 默认图表使用胜率。
注意事项: 此评估基于专家判断和选定的工作任务。不同任务的结果可能不同,请确认显示指标是胜率还是胜出+平局比例。
本次排名的解读要点
- 最高分为 GPT-5.2 的 49.7%。
- 第 1 名与第 5 名的差距为 9.4%p。
- 前 10 个模型中,OpenAI 的模型有 4 个,数量最多。
- 已有 11 个模型公开了此测试的结果。
实际工作成果(GDPval) Epoch AI
数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04
柱状条表示正确率(%),从 0% 起绘制。
查看表格(前 11 名)
| 排名 | 模型 | 开发方 | 发布日期 | 分数 |
|---|---|---|---|---|
| 1 | #1OGPT-5.2(none) | OpenAI | 2025-12-11 | 49.7% |
| 2 | #2Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 45.5% |
| 3 | #3claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 43.6% |
| 4 | #4Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 42.5% |
| 5 | #5Gemini 3 Pro Preview | 2025-11-18 | 40.3% | |
| 6 | #6OGPT-5(medium) | OpenAI | 2025-08-07 | 34.8% |
| 7 | #7Oo3(medium) | OpenAI | 2025-04-16 | 30.8% |
| 8 | #8Oo4-mini(high) | OpenAI | 2025-04-16 | 25.3% |
| 9 | #9gemini-2.5-pro | 2025-06-05 | 23.3% | |
| 10 | #10xgrok-4-0709_high | xAI | 2025-07-09 | 21.1% |
| 11 | #11OGPT-4o(Nov 2024) | OpenAI | 2024-11-20 | 9.9% |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings