Valumigo

Epoch AI · Rechercheberichte (DeepResearch Bench)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Der von Epoch erfasste Deep Research Bench von FutureSearch bewertet die Fähigkeit, Informationen im Web zu finden und zusammenzuführen, um Recherchefragen zu beantworten. Er ist von einem gleichnamigen Benchmark zu unterscheiden, der die Qualität langer Berichte bewertet.

So lesen Sie die Werte: Zusammengefasst werden Werte von 0~1, die je nach Aufgabe auf Präzision, Trefferquote, F1, Antwortkorrektheit, Fehlern bei Wahrscheinlichkeitseinschätzungen und weiteren Kriterien beruhen. Auch als Prozentwert entspricht das Ergebnis nicht dem Anteil vollständig gelöster Aufgaben.

Zu beachten: Verwendet werden RetroSearch zum Durchsuchen gespeicherter Webinhalte und festgelegte Agentenbedingungen. Einige Bewertungen enthalten unterstützende KI-Urteile. Interpretieren Sie kleine Unterschiede daher im Zusammenhang mit den Evaluationsbedingungen.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht Claude Opus 4.6 mit 55.3%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 2.7%p.
  • Unter den besten 10 Modellen ist Anthropic mit 6 Modellen am häufigsten vertreten.
  • Für 25 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Rechercheberichte (DeepResearch Bench) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

AnthropicClaude Opus 4.6
55.3%
AnthropicClaude Sonnet 4.6
54.9%
AnthropicClaude Opus 4.5
54.8%
OGPT-5.5
54.0%
AnthropicClaude Sonnet 4.5
52.6%
AnthropicClaude Opus 4.8
50.2%
GoogleGemini 3 Flash Preview
49.8%
OGPT-5
49.6%
Anthropicclaude-opus-4-1-20250805
48.3%
GoogleGemini 3.1 Pro Preview
47.8%
xgrok-4-0709
47.3%
AnthropicClaude Opus 4
46.8%
Anthropicclaude-sonnet-4-20250514_2K
46.6%
GoogleGemini 3 Pro Preview
46.3%
AnthropicClaude Haiku 4.5
45.5%
Oo3
45.2%
AnthropicClaude 3.7 Sonnet
43.6%
GoogleGemini 2.5 Pro Preview
42.8%
OGPT-5.1
42.8%
Googlegemini-2.5-pro
41.5%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 25)
RangModellAnbieterVeröffentlichtPunkte
1#1AnthropicClaude Opus 4.6(high)Anthropic2026-02-0555.3%
2#2AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1754.9%
3#3AnthropicClaude Opus 4.5(high)Anthropic2025-11-2454.8%
4#4OGPT-5.5(high)OpenAI2026-04-2354.0%
5#5AnthropicClaude Sonnet 4.5(2k thinking)Anthropic2025-09-2952.6%
6#6AnthropicClaude Opus 4.8Anthropic2026-05-2850.2%
7#7GoogleGemini 3 Flash PreviewGoogle2025-12-1749.8%
8#8OGPT-5(low)OpenAI2025-08-0749.6%
9#9Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0548.3%
10#10GoogleGemini 3.1 Pro PreviewGoogle2026-02-1947.8%
11#11xgrok-4-0709xAI2025-07-0947.3%
12#12AnthropicClaude Opus 4Anthropic2025-05-2246.8%
13#13Anthropicclaude-sonnet-4-20250514_2KAnthropic2025-05-2246.6%
14#14GoogleGemini 3 Pro Preview(low)Google2025-11-1846.3%
15#15AnthropicClaude Haiku 4.5(low)Anthropic2025-10-1545.5%
16#16Oo3(medium)OpenAI2025-04-1645.2%
17#17AnthropicClaude 3.7 Sonnet(2k thinking)Anthropic2025-02-2443.6%
18#18GoogleGemini 2.5 Pro Preview(Jun 2025)Google2025-06-0542.8%
19#19OGPT-5.1(low)OpenAI2025-11-1342.8%
20#20Googlegemini-2.5-proGoogle2025-06-0541.5%
21#21OGPT-5.2(low)OpenAI2025-12-1141.1%
22#22GoogleGemini 3.1 Flash-LiteGoogle2026-03-0337.3%
23#23OGPT-5.4 mini(low)OpenAI2026-03-1736.3%
24#24OGPT-5.4(low)OpenAI2026-03-0535.1%
25#25DeepSeekDeepSeek-R1(May 2025)DeepSeek2025-05-2835.1%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings