Valumigo

OpenRouter · Naturwissenschaftliche Fragen auf Graduiertenniveau (GPQA Diamond)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Die Trefferquote bei GPQA Diamond, von OpenRouter selbst ermittelt: Multiple-Choice-Fragen zu Biologie, Chemie und Physik auf Graduiertenniveau. Auch die durchschnittlichen Kosten pro Aufgabe werden veröffentlicht.

So lesen Sie die Werte: Eine höhere Trefferquote (%) ist besser. Die „durchschnittlichen Kosten pro Aufgabe“ geben den durchschnittlichen Betrag für die Lösung einer Aufgabe zu OpenRouter-Tarifen an und ermöglichen einen Vergleich von Leistung und Kosten.

Zu beachten: Die Testbedingungen unterscheiden sich von denen der GPQA-Bewertung von Epoch AI, sodass die Werte abweichen können. Die Kosten basieren auf OpenRouter-Tarifen.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht Gemini 3.8 Flash mit 95.6%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 1.2%p.
  • Unter den besten 10 Modellen ist OpenAI mit 5 Modellen am häufigsten vertreten.
  • Unter den Top 10 hat Jev Router die niedrigsten durchschnittlichen Kosten pro Aufgabe ($0.0159, Punktzahl 93.9%).

Naturwissenschaftliche Fragen auf Graduiertenniveau (GPQA Diamond) OpenRouter

Veröffentlicht am 2026-10-04 · Abgerufen am 2026-10-05

GoogleGemini 3.8 Flash
95.6%
OGPT-6 Astra Pro
95.5%
SFugu Ultra
94.6%
GoogleGemini 3.1 Pro Preview
94.5%
OGPT-6 Astra
94.4%
OGPT-6.1 Sol
94.4%
TJev Router
93.9%
OGPT-5.6 Sol Pro
93.9%
GoogleGemini 3.7 Flash
93.9%
OGPT-5.5
93.7%
SFugu Ultra V2
93.3%
xGrok 4.6
92.8%
GoogleGemini 3.6 Flash
92.6%
GoogleGemini 3.5 Flash
92.6%
UPareto
92.4%
OGPT-5.6 Sol
92.1%
AnthropicClaude Sonnet 5.5
92.1%
OGPT-6 Sol
91.9%
Moonshot AIKimi K3
91.9%
NVIDIASwitchyard
91.4%

Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen.

Als Tabelle anzeigen (Top 60)
RangModellAnbieterPunkteDurchschnittliche Kosten pro Aufgabe
1#1GoogleGemini 3.8 FlashGoogle95.6%$0.0682
2#2OGPT-6 Astra ProOpenAI95.5%$0.3326
3#3SFugu UltraSakana94.6%$1.1487
4#4GoogleGemini 3.1 Pro PreviewGoogle94.5%$0.202
5#5OGPT-6 AstraOpenAI94.4%$0.1133
6#6OGPT-6.1 SolOpenAI94.4%$0.0214
7#7TJev RouterTypesafe93.9%$0.0159
8#8OGPT-5.6 Sol ProOpenAI93.9%$0.2979
9#9GoogleGemini 3.7 FlashGoogle93.9%$0.0293
10#10OGPT-5.5OpenAI93.7%$0.3093
11#11SFugu Ultra V2Sakana93.3%$0.5026
12#12xGrok 4.6xAI92.8%$0.1233
13#13GoogleGemini 3.6 FlashGoogle92.6%$0.0596
14#14GoogleGemini 3.5 FlashGoogle92.6%$0.1413
15#15UParetoUnbiased92.4%$0.0338
16#16OGPT-5.6 SolOpenAI92.1%$0.0604
17#17AnthropicClaude Sonnet 5.5Anthropic92.1%$0.0253
18#18OGPT-6 SolOpenAI91.9%$0.0253
19#19Moonshot AIKimi K3Moonshot AI91.9%$0.1323
20#20NVIDIASwitchyardNVIDIA91.4%$0.0179
21#21ZGLM 5.3 FlashZ.ai90.9%$0.0054
22#22AlibabaQwen3.7 MaxAlibaba90.9%$0.2222
23#23MiniMaxMiniMax M3MiniMax90.3%$0.0348
24#24OGPT-5.4OpenAI90.3%$0.1467
25#25AnthropicClaude Opus 5.5Anthropic90.2%$0.0542
26#26OGPT-5.6 Luna ProOpenAI90%$0.0412
27#27AnthropicClaude Fable 5.1Anthropic89.9%$0.1305
28#28DeepSeekDeepSeek V4 Pro 0813DeepSeek89.8%$0.1143
29#29AnthropicClaude Opus 4.8Anthropic89.7%$0.2016
30#30AnthropicClaude Opus 4.7Anthropic89.4%$0.2239
31#31THy4 previewTencent89.1%$0.1253
32#32ANova Micro 1.0Amazon89%$0.2165
33#33DeepSeekDeepSeek V4.1 FlashDeepSeek88.9%$0.0244
34#34OGPT-5.6 TerraOpenAI88.8%$0.0344
35#35XiaomiMiMo-V2.6-ProXiaomi88.6%$0.0319
36#36SFugu MaxSakana88.6%$0.0756
37#37AlibabaQwen3.8 FlashAlibaba88.6%$0.0215
38#38GoogleGemini 3 Flash PreviewGoogle88.4%$0.1318
39#39OGPT-6 Luna ProOpenAI88.4%$0.0083
40#40DeepSeekDeepSeek V4 Flash Vision ExpDeepSeek88%$0.0228
41#41OAuto RouterOpenrouter88%$0.0892
42#42OGPT-5.2OpenAI87.9%$0.1333
43#43AlibabaQwen3.7 PlusAlibaba87.9%$0.044
44#44OGPT-5.6 LunaOpenAI87.9%$0.0079
45#45AnthropicClaude Opus 5Anthropic87.5%$0.1306
46#46OGPT-6 LunaOpenAI87.4%$0.003
47#47Moonshot AIKimi K2 ThinkingMoonshot AI87.3%$0.1062
48#48AlibabaQwen3.8 2.4T A95BAlibaba86.9%$0.0824
49#49TInkling SmallThinkingmachines86.6%$0.0253
50#50OGPT-5.1OpenAI86.4%$0.2213
51#51DeepSeekDeepSeek V4 Flash 0731DeepSeek86.3%$0.008
52#52MiniMaxMiniMax M2.1MiniMax86.2%$0.0403
53#53AnthropicClaude Opus 4.5Anthropic86.2%$0.8454
54#54DeepSeekDeepSeek V4 Pro 0423DeepSeek86.2%$0.0544
55#55AnthropicClaude Opus 4.6Anthropic86%$0.7469
56#56DeepSeekDeepSeek V4 Flash 0423DeepSeek85.8%$0.0062
57#57ZGLM 5.3 FlashZ.ai85.7%$0.0123
58#58OGPT-5OpenAI85.7%$0.2099
59#59AnthropicClaude Fable 5Anthropic85.5%$0.1754
60#60ZGLM 5.3Z.ai85.4%$0.0925

Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings