Valumigo

Epoch AI · Wissenschaftsfragen auf Promotionsniveau (GPQA Diamond)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: GPQA Diamond umfasst 198 Multiple-Choice-Fragen auf Graduiertenniveau aus Biologie, Chemie und Physik. Sie wurden von Fachleuten erstellt und geprüft und sind so gestaltet, dass sie für Nichtfachleute auch mit Internetzugang schwer zu lösen sind.

So lesen Sie die Werte: Gemessen wird die Quote korrekter Antworten (%). Bei gleichverteilter Zufallsauswahl aus 4 Antwortmöglichkeiten beträgt die erwartete Quote 25%.

Zu beachten: Je näher die Werte führender Modelle an die Höchstpunktzahl kommen, desto schwieriger kann es sein, Leistungsunterschiede allein mit diesem Test zu erkennen. Er bewertet wissenschaftliches Wissen und Schlussfolgern; die Leistung bei alltäglichen Aufgaben kann davon abweichen.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht GPT-6 Astra mit 95.8%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 1.0%p.
  • Unter den besten 10 Modellen ist OpenAI mit 4 Modellen am häufigsten vertreten.
  • Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Wissenschaftsfragen auf Promotionsniveau (GPQA Diamond) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

OGPT-6 Astra
95.8%
AnthropicClaude Sonnet 5.5
95.6%
OGPT-6.1 Sol
95.4%
GoogleGemini 3.8 Flash
95.4%
GoogleGemini 3.7 Flash
94.8%
OGPT-5.4 Pro
94.6%
GoogleGemini 3.1 Pro Preview
94.4%
OGPT-6 Sol
94.3%
GoogleGemini 3.6 Flash
94.1%
xGrok 4.6
94.0%
OGPT-5.5
94.0%
OGPT-5.5 Pro
93.9%
AnthropicClaude Opus 5
93.9%
OGPT-5.6 Sol
93.5%
xGrok 4.5
93.4%
OGPT-5.6 Terra
93.3%
OGPT-5.4
93.3%
Moonshot AIKimi K3
93.1%
GoogleGemini 3.5 Flash
92.8%
xGrok 4.7
92.7%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 30)
RangModellAnbieterVeröffentlichtPunkte
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.8%
2#2AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2895.6%
3#3OGPT-6.1 Sol(max)OpenAI2026-09-2995.4%
4#4GoogleGemini 3.8 Flash(high)Google2026-09-0295.4%
5#5GoogleGemini 3.7 Flash(high)Google2026-08-1394.8%
6#6OGPT-5.4 Pro(xhigh)OpenAI2026-03-0594.6%
7#7GoogleGemini 3.1 Pro PreviewGoogle2026-02-1994.4%
8#8OGPT-6 Sol(max)OpenAI2026-09-2294.3%
9#9GoogleGemini 3.6 FlashGoogle2026-07-2194.1%
10#10xGrok 4.6(high)xAI2026-08-1294.0%
11#11OGPT-5.5(xhigh)OpenAI2026-04-2394.0%
12#12OGPT-5.5 Pro(xhigh)OpenAI2026-04-2393.9%
13#13AnthropicClaude Opus 5(max)Anthropic2026-07-2493.9%
14#14OGPT-5.6 Sol(max)OpenAI2026-07-0993.5%
15#15xGrok 4.5(high)xAI2026-07-0893.4%
16#16OGPT-5.6 Terra(max)OpenAI2026-07-0993.3%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0593.3%
18#18Moonshot AIKimi K3(max)Moonshot AI2026-07-1693.1%
19#19GoogleGemini 3.5 FlashGoogle2026-05-1992.8%
20#20xGrok 4.7(xhigh)xAI2026-09-2192.7%
21#21AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0292.7%
22#22GoogleGemini 3 Pro PreviewGoogle2025-11-1892.6%
23#23AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0192.3%
24#24ZGLM-5.2Z.ai2026-06-1691.9%
25#25DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1391.7%
26#26OGPT-5.6 Luna(max)OpenAI2026-07-0991.6%
27#27OGPT-5.2(xhigh)OpenAI2025-12-1191.4%
28#28AnthropicClaude Opus 4.8Anthropic2026-05-2891.0%
29#29DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3191.0%
30#30ZGLM-5.3(max)Z.ai2026-08-1490.9%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings