Valumigo

Epoch AI · Genauigkeit bei Faktenfragen (SimpleQA Verified)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: SimpleQA Verified bewertet, ob kurze Faktenfragen korrekt beantwortet werden. Die Evaluation mit 1,000 Fragen wurde von Google DeepMind und Google Research auf Grundlage von SimpleQA von OpenAI entwickelt, um unter anderem Duplikate und Fehler in Referenzantworten zu reduzieren.

So lesen Sie die Werte: Epoch zeigt den Anteil korrekt beantworteter Fragen an allen Fragen (%) an. Dieser Wert unterscheidet sich von der F1-Kennzahl der offiziellen Google-Evaluation und kann allein weder Halluzinationen noch die Neigung zur Antwortverweigerung umfassend bewerten.

Zu beachten: Die Modelle antworten ohne Suchwerkzeuge aus ihrem internen Wissen. Die Genauigkeit kann daher von Diensten mit aktivierter Suche abweichen. Epoch verwendet zusätzliche Anweisungen, um Antwortverweigerungen zu reduzieren.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht GPT-6 Astra mit 75.6%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 4.8%p.
  • Unter den besten 10 Modellen ist Google mit 4 Modellen am häufigsten vertreten.
  • Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Genauigkeit bei Faktenfragen (SimpleQA Verified) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

OGPT-6 Astra
75.6%
OGPT-6.1 Sol
73.9%
GoogleGemini 3.1 Pro Preview
73.5%
AnthropicClaude Opus 5.5
72.2%
AnthropicClaude Fable 5.1
70.8%
AnthropicClaude Fable 5
70.7%
GoogleGemini 3.8 Flash
69.7%
OGPT-5.6 Sol
69.7%
GoogleGemini 3.7 Flash
69.2%
GoogleGemini 3 Flash Preview
66.8%
GoogleGemini 3.5 Flash
66.2%
GoogleGemini 3.6 Flash
66.2%
OGPT-5.5
63.0%
OGPT-6 Sol
60.7%
MetaMuse Spark 1.2
60.3%
AnthropicClaude Opus 5
59.9%
MetaMuse Spark 1.1
57.8%
xGrok 4.7
56.0%
AlibabaQwen3.7 Max
55.8%
AnthropicClaude Opus 4.8
53.0%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 30)
RangModellAnbieterVeröffentlichtPunkte
1#1OGPT-6 Astra(max)OpenAI2026-09-0375.6%
2#2OGPT-6.1 Sol(max)OpenAI2026-09-2973.9%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1973.5%
4#4AnthropicClaude Opus 5.5(max)Anthropic2026-09-2272.2%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0170.8%
6#6AnthropicClaude Fable 5(xhigh)Anthropic2026-06-0970.7%
7#7GoogleGemini 3.8 Flash(high)Google2026-09-0269.7%
8#8OGPT-5.6 Sol(max)OpenAI2026-07-0969.7%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1369.2%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1766.8%
11#11GoogleGemini 3.5 FlashGoogle2026-05-1966.2%
12#12GoogleGemini 3.6 FlashGoogle2026-07-2166.2%
13#13OGPT-5.5(xhigh)OpenAI2026-04-2363.0%
14#14OGPT-6 Sol(max)OpenAI2026-09-2260.7%
15#15MetaMuse Spark 1.2(xhigh)Meta2026-08-0560.3%
16#16AnthropicClaude Opus 5(max)Anthropic2026-07-2459.9%
17#17MetaMuse Spark 1.1Meta2026-07-0957.8%
18#18xGrok 4.7(xhigh)xAI2026-09-2156.0%
19#19AlibabaQwen3.7 MaxAlibaba2026-05-1955.8%
20#20AnthropicClaude Opus 4.8Anthropic2026-05-2853.0%
21#21DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1352.9%
22#22AlibabaQwen 3.6 Max(Preview)Alibaba2026-04-2052.0%
23#23AnthropicClaude Opus 4.7(xhigh)Anthropic2026-04-1651.7%
24#24Moonshot AIKimi K3(max)Moonshot AI2026-07-1650.6%
25#25OGPT-5(high)OpenAI2025-08-0750.1%
26#26Oo3(high)OpenAI2025-04-1649.4%
27#27xGrok 4.6(high)xAI2026-08-1249.3%
28#28AlibabaQwen3-Max-InstructAlibaba2025-09-2448.7%
29#29xGrok 4.5(high)xAI2026-07-0848.3%
30#30OGPT-5.1(high)OpenAI2025-11-1348.0%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings