Valumigo

Epoch AI · Schwierigste Fragen verschiedener Fachgebiete (HLE)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Humanity's Last Exam wurde vom Center for AI Safety und Scale AI entwickelt. Es umfasst 2,500 öffentliche Fragen, die Fachleute aus verschiedenen Bereichen erstellt haben, und entstand als Reaktion auf die Sättigung bestehender Benchmarks.

So lesen Sie die Werte: Gemessen wird die Quote korrekter Antworten (%). Bewertet werden anspruchsvolles Wissen und Schlussfolgern. Die Werte variieren je nach Modell und Bedingungen für den Werkzeugeinsatz.

Zu beachten: Es wurden Fehler in Fragen, Referenzantworten und Bewertungen festgestellt. Interpretieren Sie kleine Punktunterschiede unter Berücksichtigung von Aufgabenmängeln, Evaluationsbedingungen und statistischer Unsicherheit.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht GPT-6 Astra mit 54.8%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 10.5%p.
  • Unter den besten 10 Modellen ist OpenAI mit 3 Modellen am häufigsten vertreten.
  • Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Schwierigste Fragen verschiedener Fachgebiete (HLE) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

OGPT-6 Astra
54.8%
AnthropicClaude Fable 5.1
46.5%
GoogleGemini 3.1 Pro Preview
46.4%
GoogleGemini 3.8 Flash
44.5%
OGPT-5.4 Pro
44.3%
MetaMuse Spark
40.6%
GoogleGemini 3 Pro Preview
37.5%
OGPT-5.4
36.2%
AnthropicClaude Opus 4.7
36.2%
AnthropicClaude Opus 4.6
34.4%
OGPT-5 Pro
31.6%
OGPT-5.2
27.8%
OGPT-5
25.3%
AnthropicClaude Opus 4.5
25.2%
Moonshot AIKimi K2.5
24.4%
OGPT-5.1
23.7%
GoogleGemini 2.5 Pro Preview
21.6%
Oo3
20.3%
OGPT-5 mini
19.4%
GoogleGemini 2.5 Pro Exp
18.2%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 30)
RangModellAnbieterVeröffentlichtPunkte
1#1OGPT-6 Astra(unknown thinking)OpenAI2026-09-0354.8%
2#2AnthropicClaude Fable 5.1(xhigh)Anthropic2026-09-0146.5%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1946.4%
4#4GoogleGemini 3.8 Flash(unknown)Google2026-09-0244.5%
5#5OGPT-5.4 ProOpenAI2026-03-0544.3%
6#6MetaMuse SparkMeta2026-04-0840.6%
7#7GoogleGemini 3 Pro PreviewGoogle2025-11-1837.5%
8#8OGPT-5.4(xhigh)OpenAI2026-03-0536.2%
9#9AnthropicClaude Opus 4.7(unknown)Anthropic2026-04-1636.2%
10#10AnthropicClaude Opus 4.6(max)Anthropic2026-02-0534.4%
11#11OGPT-5 ProOpenAI2025-10-0731.6%
12#12OGPT-5.2(unknown thinking)OpenAI2025-12-1127.8%
13#13OGPT-5(high)OpenAI2025-08-0725.3%
14#14AnthropicClaude Opus 4.5(unknown thinking)Anthropic2025-11-2425.2%
15#15Moonshot AIKimi K2.5Moonshot AI2026-01-2724.4%
16#16OGPT-5.1(unknown thinking)OpenAI2025-11-1323.7%
17#17GoogleGemini 2.5 Pro Preview(Jun 2025)Google2025-06-0521.6%
18#18Oo3(high)OpenAI2025-04-1620.3%
19#19OGPT-5 mini(unknown thinking)OpenAI2025-08-0719.4%
20#20GoogleGemini 2.5 Pro Exp(Mar 2025)Google2025-03-2518.2%
21#21Oo4-mini(high)OpenAI2025-04-1618.1%
22#22AnthropicClaude Sonnet 4.5(unknown thinking)Anthropic2025-09-2913.7%
23#23GoogleGemini 2.5 Flash Preview(Apr 2025)Google2025-04-1712.1%
24#24AnthropicClaude Opus 4.1(unknown thinking)Anthropic2025-08-0511.5%
25#25Googlegemini-2.5-flash-preview-05-20Google2025-05-2011.0%
26#26AnthropicClaude Opus 4Anthropic2025-05-2210.7%
27#27GoogleGemini 3.1 Flash-LiteGoogle2026-03-038.6%
28#28Zglm-4.5Z.ai2025-08-038.3%
29#29ZGLM-4.5-AirZ.ai2025-07-208.1%
30#30Oo1 ProOpenAI2025-03-198.1%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings