Epoch AI · リサーチレポート(DeepResearch Bench)
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: Epochが掲載するFutureSearchのDeep Research Benchは、ウェブで情報を探してまとめ、調査質問に答える能力を評価します。長いレポートの品質を評価する同名の別のベンチマークとは区別する必要があります。
スコアの読み方: 課題ごとの適合率・再現率・F1・正誤・確率判断の誤差などを用いた0~1のスコアを集計します。百分率で表示されていても、全課題の解決率を意味するわけではありません。
注意点: 保存済みのウェブ資料を検索するRetroSearchと、所定のエージェント条件を使用します。一部の採点にはAIによる補助的な判断が含まれるため、小さな差は評価条件と併せて解釈してください。
今回のランキングから読み取れること
- 最高スコアはClaude Opus 4.6の55.3%です。
- 1位と5位の差は2.7%pです。
- 上位10モデルのうち、Anthropicのモデルが6モデルで最も多くなっています。
- この試験の結果が公開されているモデルは25件です。
リサーチレポート(DeepResearch Bench) Epoch AI
Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04
棒は正答率(%)を示し、0%から描画しています。
表で見る(上位25件)
| 順位 | モデル | 開発元 | リリース日 | スコア |
|---|---|---|---|---|
| 1 | #1Claude Opus 4.6(high) | Anthropic | 2026-02-05 | 55.3% |
| 2 | #2Claude Sonnet 4.6(high) | Anthropic | 2026-02-17 | 54.9% |
| 3 | #3Claude Opus 4.5(high) | Anthropic | 2025-11-24 | 54.8% |
| 4 | #4OGPT-5.5(high) | OpenAI | 2026-04-23 | 54.0% |
| 5 | #5Claude Sonnet 4.5(2k thinking) | Anthropic | 2025-09-29 | 52.6% |
| 6 | #6Claude Opus 4.8 | Anthropic | 2026-05-28 | 50.2% |
| 7 | #7Gemini 3 Flash Preview | 2025-12-17 | 49.8% | |
| 8 | #8OGPT-5(low) | OpenAI | 2025-08-07 | 49.6% |
| 9 | #9claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 48.3% |
| 10 | #10Gemini 3.1 Pro Preview | 2026-02-19 | 47.8% | |
| 11 | #11xgrok-4-0709 | xAI | 2025-07-09 | 47.3% |
| 12 | #12Claude Opus 4 | Anthropic | 2025-05-22 | 46.8% |
| 13 | #13claude-sonnet-4-20250514_2K | Anthropic | 2025-05-22 | 46.6% |
| 14 | #14Gemini 3 Pro Preview(low) | 2025-11-18 | 46.3% | |
| 15 | #15Claude Haiku 4.5(low) | Anthropic | 2025-10-15 | 45.5% |
| 16 | #16Oo3(medium) | OpenAI | 2025-04-16 | 45.2% |
| 17 | #17Claude 3.7 Sonnet(2k thinking) | Anthropic | 2025-02-24 | 43.6% |
| 18 | #18Gemini 2.5 Pro Preview(Jun 2025) | 2025-06-05 | 42.8% | |
| 19 | #19OGPT-5.1(low) | OpenAI | 2025-11-13 | 42.8% |
| 20 | #20gemini-2.5-pro | 2025-06-05 | 41.5% | |
| 21 | #21OGPT-5.2(low) | OpenAI | 2025-12-11 | 41.1% |
| 22 | #22Gemini 3.1 Flash-Lite | 2026-03-03 | 37.3% | |
| 23 | #23OGPT-5.4 mini(low) | OpenAI | 2026-03-17 | 36.3% |
| 24 | #24OGPT-5.4(low) | OpenAI | 2026-03-05 | 35.1% |
| 25 | #25DeepSeek-R1(May 2025) | DeepSeek | 2025-05-28 | 35.1% |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings