Epoch AI · Schwierigste Fragen verschiedener Fachgebiete (HLE)
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: Humanity's Last Exam wurde vom Center for AI Safety und Scale AI entwickelt. Es umfasst 2,500 öffentliche Fragen, die Fachleute aus verschiedenen Bereichen erstellt haben, und entstand als Reaktion auf die Sättigung bestehender Benchmarks.
So lesen Sie die Werte: Gemessen wird die Quote korrekter Antworten (%). Bewertet werden anspruchsvolles Wissen und Schlussfolgern. Die Werte variieren je nach Modell und Bedingungen für den Werkzeugeinsatz.
Zu beachten: Es wurden Fehler in Fragen, Referenzantworten und Bewertungen festgestellt. Interpretieren Sie kleine Punktunterschiede unter Berücksichtigung von Aufgabenmängeln, Evaluationsbedingungen und statistischer Unsicherheit.
Was diese Rangliste zeigt
- Den höchsten Wert erreicht GPT-6 Astra mit 54.8%.
- Der Abstand zwischen Platz 1 und Platz 5 beträgt 10.5%p.
- Unter den besten 10 Modellen ist OpenAI mit 3 Modellen am häufigsten vertreten.
- Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.
Schwierigste Fragen verschiedener Fachgebiete (HLE) Epoch AI
Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04
Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.
Als Tabelle anzeigen (Top 30)
| Rang | Modell | Anbieter | Veröffentlicht | Punkte |
|---|---|---|---|---|
| 1 | #1OGPT-6 Astra(unknown thinking) | OpenAI | 2026-09-03 | 54.8% |
| 2 | #2Claude Fable 5.1(xhigh) | Anthropic | 2026-09-01 | 46.5% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 46.4% | |
| 4 | #4Gemini 3.8 Flash(unknown) | 2026-09-02 | 44.5% | |
| 5 | #5OGPT-5.4 Pro | OpenAI | 2026-03-05 | 44.3% |
| 6 | #6Muse Spark | Meta | 2026-04-08 | 40.6% |
| 7 | #7Gemini 3 Pro Preview | 2025-11-18 | 37.5% | |
| 8 | #8OGPT-5.4(xhigh) | OpenAI | 2026-03-05 | 36.2% |
| 9 | #9Claude Opus 4.7(unknown) | Anthropic | 2026-04-16 | 36.2% |
| 10 | #10Claude Opus 4.6(max) | Anthropic | 2026-02-05 | 34.4% |
| 11 | #11OGPT-5 Pro | OpenAI | 2025-10-07 | 31.6% |
| 12 | #12OGPT-5.2(unknown thinking) | OpenAI | 2025-12-11 | 27.8% |
| 13 | #13OGPT-5(high) | OpenAI | 2025-08-07 | 25.3% |
| 14 | #14Claude Opus 4.5(unknown thinking) | Anthropic | 2025-11-24 | 25.2% |
| 15 | #15Kimi K2.5 | Moonshot AI | 2026-01-27 | 24.4% |
| 16 | #16OGPT-5.1(unknown thinking) | OpenAI | 2025-11-13 | 23.7% |
| 17 | #17Gemini 2.5 Pro Preview(Jun 2025) | 2025-06-05 | 21.6% | |
| 18 | #18Oo3(high) | OpenAI | 2025-04-16 | 20.3% |
| 19 | #19OGPT-5 mini(unknown thinking) | OpenAI | 2025-08-07 | 19.4% |
| 20 | #20Gemini 2.5 Pro Exp(Mar 2025) | 2025-03-25 | 18.2% | |
| 21 | #21Oo4-mini(high) | OpenAI | 2025-04-16 | 18.1% |
| 22 | #22Claude Sonnet 4.5(unknown thinking) | Anthropic | 2025-09-29 | 13.7% |
| 23 | #23Gemini 2.5 Flash Preview(Apr 2025) | 2025-04-17 | 12.1% | |
| 24 | #24Claude Opus 4.1(unknown thinking) | Anthropic | 2025-08-05 | 11.5% |
| 25 | #25gemini-2.5-flash-preview-05-20 | 2025-05-20 | 11.0% | |
| 26 | #26Claude Opus 4 | Anthropic | 2025-05-22 | 10.7% |
| 27 | #27Gemini 3.1 Flash-Lite | 2026-03-03 | 8.6% | |
| 28 | #28Zglm-4.5 | Z.ai | 2025-08-03 | 8.3% |
| 29 | #29ZGLM-4.5-Air | Z.ai | 2025-07-20 | 8.1% |
| 30 | #30Oo1 Pro | OpenAI | 2025-03-19 | 8.1% |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings