Valumigo

Epoch AI · 实际工作成果(GDPval)

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: OpenAI 创建的 GDPval 要求模型完成多个职业的工作成果,再由领域专家匿名比较模型与人类专家的成果。

如何解读分数: 胜率指模型成果被判定优于人类专家成果的比例(%)。胜出+平局比例指被判定相当或更好的比例,目前 Epoch 默认图表使用胜率。

注意事项: 此评估基于专家判断和选定的工作任务。不同任务的结果可能不同,请确认显示指标是胜率还是胜出+平局比例。

本次排名的解读要点

  • 最高分为 GPT-5.2 的 49.7%。
  • 第 1 名与第 5 名的差距为 9.4%p。
  • 前 10 个模型中,OpenAI 的模型有 4 个,数量最多。
  • 已有 11 个模型公开了此测试的结果。

实际工作成果(GDPval) Epoch AI

数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04

OGPT-5.2
49.7%
AnthropicClaude Opus 4.5
45.5%
Anthropicclaude-opus-4-1-20250805
43.6%
AnthropicClaude Sonnet 4.5
42.5%
GoogleGemini 3 Pro Preview
40.3%
OGPT-5
34.8%
Oo3
30.8%
Oo4-mini
25.3%
Googlegemini-2.5-pro
23.3%
xgrok-4-0709_high
21.1%
OGPT-4o
9.9%

柱状条表示正确率(%),从 0% 起绘制。

查看表格(前 11 名)
排名模型开发方发布日期分数
1#1OGPT-5.2(none)OpenAI2025-12-1149.7%
2#2AnthropicClaude Opus 4.5(no thinking)Anthropic2025-11-2445.5%
3#3Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0543.6%
4#4AnthropicClaude Sonnet 4.5(no thinking)Anthropic2025-09-2942.5%
5#5GoogleGemini 3 Pro PreviewGoogle2025-11-1840.3%
6#6OGPT-5(medium)OpenAI2025-08-0734.8%
7#7Oo3(medium)OpenAI2025-04-1630.8%
8#8Oo4-mini(high)OpenAI2025-04-1625.3%
9#9Googlegemini-2.5-proGoogle2025-06-0523.3%
10#10xgrok-4-0709_highxAI2025-07-0921.1%
11#11OGPT-4o(Nov 2024)OpenAI2024-11-209.9%

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings