Valumigo

Epoch AI · 研究报告(DeepResearch Bench)

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: Epoch 收录的 FutureSearch 的 Deep Research Bench 评估从网上查找、综合信息并回答研究问题的能力。需与另一个评估长篇报告质量的同名基准区分。

如何解读分数: 汇总基于各项任务的精确率、召回率、F1、答案是否正确及概率判断误差等计算的 0~1 分数。即使以百分比显示,也不代表全部任务的解决率。

注意事项: 使用检索已存储网页资料的 RetroSearch,以及固定的智能体条件。部分评分包含 AI 辅助判断,因此解读细微差异时需结合评估条件。

本次排名的解读要点

  • 最高分为 Claude Opus 4.6 的 55.3%。
  • 第 1 名与第 5 名的差距为 2.7%p。
  • 前 10 个模型中,Anthropic 的模型有 6 个,数量最多。
  • 已有 25 个模型公开了此测试的结果。

研究报告(DeepResearch Bench) Epoch AI

数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04

AnthropicClaude Opus 4.6
55.3%
AnthropicClaude Sonnet 4.6
54.9%
AnthropicClaude Opus 4.5
54.8%
OGPT-5.5
54.0%
AnthropicClaude Sonnet 4.5
52.6%
AnthropicClaude Opus 4.8
50.2%
GoogleGemini 3 Flash Preview
49.8%
OGPT-5
49.6%
Anthropicclaude-opus-4-1-20250805
48.3%
GoogleGemini 3.1 Pro Preview
47.8%
xgrok-4-0709
47.3%
AnthropicClaude Opus 4
46.8%
Anthropicclaude-sonnet-4-20250514_2K
46.6%
GoogleGemini 3 Pro Preview
46.3%
AnthropicClaude Haiku 4.5
45.5%
Oo3
45.2%
AnthropicClaude 3.7 Sonnet
43.6%
GoogleGemini 2.5 Pro Preview
42.8%
OGPT-5.1
42.8%
Googlegemini-2.5-pro
41.5%

柱状条表示正确率(%),从 0% 起绘制。

查看表格(前 25 名)
排名模型开发方发布日期分数
1#1AnthropicClaude Opus 4.6(high)Anthropic2026-02-0555.3%
2#2AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1754.9%
3#3AnthropicClaude Opus 4.5(high)Anthropic2025-11-2454.8%
4#4OGPT-5.5(high)OpenAI2026-04-2354.0%
5#5AnthropicClaude Sonnet 4.5(2k thinking)Anthropic2025-09-2952.6%
6#6AnthropicClaude Opus 4.8Anthropic2026-05-2850.2%
7#7GoogleGemini 3 Flash PreviewGoogle2025-12-1749.8%
8#8OGPT-5(low)OpenAI2025-08-0749.6%
9#9Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0548.3%
10#10GoogleGemini 3.1 Pro PreviewGoogle2026-02-1947.8%
11#11xgrok-4-0709xAI2025-07-0947.3%
12#12AnthropicClaude Opus 4Anthropic2025-05-2246.8%
13#13Anthropicclaude-sonnet-4-20250514_2KAnthropic2025-05-2246.6%
14#14GoogleGemini 3 Pro Preview(low)Google2025-11-1846.3%
15#15AnthropicClaude Haiku 4.5(low)Anthropic2025-10-1545.5%
16#16Oo3(medium)OpenAI2025-04-1645.2%
17#17AnthropicClaude 3.7 Sonnet(2k thinking)Anthropic2025-02-2443.6%
18#18GoogleGemini 2.5 Pro Preview(Jun 2025)Google2025-06-0542.8%
19#19OGPT-5.1(low)OpenAI2025-11-1342.8%
20#20Googlegemini-2.5-proGoogle2025-06-0541.5%
21#21OGPT-5.2(low)OpenAI2025-12-1141.1%
22#22GoogleGemini 3.1 Flash-LiteGoogle2026-03-0337.3%
23#23OGPT-5.4 mini(low)OpenAI2026-03-1736.3%
24#24OGPT-5.4(low)OpenAI2026-03-0535.1%
25#25DeepSeekDeepSeek-R1(May 2025)DeepSeek2025-05-2835.1%

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings