Epoch AI · Rechercheberichte (DeepResearch Bench)
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: Der von Epoch erfasste Deep Research Bench von FutureSearch bewertet die Fähigkeit, Informationen im Web zu finden und zusammenzuführen, um Recherchefragen zu beantworten. Er ist von einem gleichnamigen Benchmark zu unterscheiden, der die Qualität langer Berichte bewertet.
So lesen Sie die Werte: Zusammengefasst werden Werte von 0~1, die je nach Aufgabe auf Präzision, Trefferquote, F1, Antwortkorrektheit, Fehlern bei Wahrscheinlichkeitseinschätzungen und weiteren Kriterien beruhen. Auch als Prozentwert entspricht das Ergebnis nicht dem Anteil vollständig gelöster Aufgaben.
Zu beachten: Verwendet werden RetroSearch zum Durchsuchen gespeicherter Webinhalte und festgelegte Agentenbedingungen. Einige Bewertungen enthalten unterstützende KI-Urteile. Interpretieren Sie kleine Unterschiede daher im Zusammenhang mit den Evaluationsbedingungen.
Was diese Rangliste zeigt
- Den höchsten Wert erreicht Claude Opus 4.6 mit 55.3%.
- Der Abstand zwischen Platz 1 und Platz 5 beträgt 2.7%p.
- Unter den besten 10 Modellen ist Anthropic mit 6 Modellen am häufigsten vertreten.
- Für 25 Modelle sind Ergebnisse dieses Tests veröffentlicht.
Rechercheberichte (DeepResearch Bench) Epoch AI
Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04
Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.
Als Tabelle anzeigen (Top 25)
| Rang | Modell | Anbieter | Veröffentlicht | Punkte |
|---|---|---|---|---|
| 1 | #1Claude Opus 4.6(high) | Anthropic | 2026-02-05 | 55.3% |
| 2 | #2Claude Sonnet 4.6(high) | Anthropic | 2026-02-17 | 54.9% |
| 3 | #3Claude Opus 4.5(high) | Anthropic | 2025-11-24 | 54.8% |
| 4 | #4OGPT-5.5(high) | OpenAI | 2026-04-23 | 54.0% |
| 5 | #5Claude Sonnet 4.5(2k thinking) | Anthropic | 2025-09-29 | 52.6% |
| 6 | #6Claude Opus 4.8 | Anthropic | 2026-05-28 | 50.2% |
| 7 | #7Gemini 3 Flash Preview | 2025-12-17 | 49.8% | |
| 8 | #8OGPT-5(low) | OpenAI | 2025-08-07 | 49.6% |
| 9 | #9claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 48.3% |
| 10 | #10Gemini 3.1 Pro Preview | 2026-02-19 | 47.8% | |
| 11 | #11xgrok-4-0709 | xAI | 2025-07-09 | 47.3% |
| 12 | #12Claude Opus 4 | Anthropic | 2025-05-22 | 46.8% |
| 13 | #13claude-sonnet-4-20250514_2K | Anthropic | 2025-05-22 | 46.6% |
| 14 | #14Gemini 3 Pro Preview(low) | 2025-11-18 | 46.3% | |
| 15 | #15Claude Haiku 4.5(low) | Anthropic | 2025-10-15 | 45.5% |
| 16 | #16Oo3(medium) | OpenAI | 2025-04-16 | 45.2% |
| 17 | #17Claude 3.7 Sonnet(2k thinking) | Anthropic | 2025-02-24 | 43.6% |
| 18 | #18Gemini 2.5 Pro Preview(Jun 2025) | 2025-06-05 | 42.8% | |
| 19 | #19OGPT-5.1(low) | OpenAI | 2025-11-13 | 42.8% |
| 20 | #20gemini-2.5-pro | 2025-06-05 | 41.5% | |
| 21 | #21OGPT-5.2(low) | OpenAI | 2025-12-11 | 41.1% |
| 22 | #22Gemini 3.1 Flash-Lite | 2026-03-03 | 37.3% | |
| 23 | #23OGPT-5.4 mini(low) | OpenAI | 2026-03-17 | 36.3% |
| 24 | #24OGPT-5.4(low) | OpenAI | 2026-03-05 | 35.1% |
| 25 | #25DeepSeek-R1(May 2025) | DeepSeek | 2025-05-28 | 35.1% |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings