Valumigo

Epoch AI · リサーチレポート(DeepResearch Bench)

公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

このランキングの読み方

測定する能力: Epochが掲載するFutureSearchのDeep Research Benchは、ウェブで情報を探してまとめ、調査質問に答える能力を評価します。長いレポートの品質を評価する同名の別のベンチマークとは区別する必要があります。

スコアの読み方: 課題ごとの適合率・再現率・F1・正誤・確率判断の誤差などを用いた0~1のスコアを集計します。百分率で表示されていても、全課題の解決率を意味するわけではありません。

注意点: 保存済みのウェブ資料を検索するRetroSearchと、所定のエージェント条件を使用します。一部の採点にはAIによる補助的な判断が含まれるため、小さな差は評価条件と併せて解釈してください。

今回のランキングから読み取れること

  • 最高スコアはClaude Opus 4.6の55.3%です。
  • 1位と5位の差は2.7%pです。
  • 上位10モデルのうち、Anthropicのモデルが6モデルで最も多くなっています。
  • この試験の結果が公開されているモデルは25件です。

リサーチレポート(DeepResearch Bench) Epoch AI

Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04

AnthropicClaude Opus 4.6
55.3%
AnthropicClaude Sonnet 4.6
54.9%
AnthropicClaude Opus 4.5
54.8%
OGPT-5.5
54.0%
AnthropicClaude Sonnet 4.5
52.6%
AnthropicClaude Opus 4.8
50.2%
GoogleGemini 3 Flash Preview
49.8%
OGPT-5
49.6%
Anthropicclaude-opus-4-1-20250805
48.3%
GoogleGemini 3.1 Pro Preview
47.8%
xgrok-4-0709
47.3%
AnthropicClaude Opus 4
46.8%
Anthropicclaude-sonnet-4-20250514_2K
46.6%
GoogleGemini 3 Pro Preview
46.3%
AnthropicClaude Haiku 4.5
45.5%
Oo3
45.2%
AnthropicClaude 3.7 Sonnet
43.6%
GoogleGemini 2.5 Pro Preview
42.8%
OGPT-5.1
42.8%
Googlegemini-2.5-pro
41.5%

棒は正答率(%)を示し、0%から描画しています。

表で見る(上位25件)
順位モデル開発元リリース日スコア
1#1AnthropicClaude Opus 4.6(high)Anthropic2026-02-0555.3%
2#2AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1754.9%
3#3AnthropicClaude Opus 4.5(high)Anthropic2025-11-2454.8%
4#4OGPT-5.5(high)OpenAI2026-04-2354.0%
5#5AnthropicClaude Sonnet 4.5(2k thinking)Anthropic2025-09-2952.6%
6#6AnthropicClaude Opus 4.8Anthropic2026-05-2850.2%
7#7GoogleGemini 3 Flash PreviewGoogle2025-12-1749.8%
8#8OGPT-5(low)OpenAI2025-08-0749.6%
9#9Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0548.3%
10#10GoogleGemini 3.1 Pro PreviewGoogle2026-02-1947.8%
11#11xgrok-4-0709xAI2025-07-0947.3%
12#12AnthropicClaude Opus 4Anthropic2025-05-2246.8%
13#13Anthropicclaude-sonnet-4-20250514_2KAnthropic2025-05-2246.6%
14#14GoogleGemini 3 Pro Preview(low)Google2025-11-1846.3%
15#15AnthropicClaude Haiku 4.5(low)Anthropic2025-10-1545.5%
16#16Oo3(medium)OpenAI2025-04-1645.2%
17#17AnthropicClaude 3.7 Sonnet(2k thinking)Anthropic2025-02-2443.6%
18#18GoogleGemini 2.5 Pro Preview(Jun 2025)Google2025-06-0542.8%
19#19OGPT-5.1(low)OpenAI2025-11-1342.8%
20#20Googlegemini-2.5-proGoogle2025-06-0541.5%
21#21OGPT-5.2(low)OpenAI2025-12-1141.1%
22#22GoogleGemini 3.1 Flash-LiteGoogle2026-03-0337.3%
23#23OGPT-5.4 mini(low)OpenAI2026-03-1736.3%
24#24OGPT-5.4(low)OpenAI2026-03-0535.1%
25#25DeepSeekDeepSeek-R1(May 2025)DeepSeek2025-05-2835.1%

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings