Epoch AI · Ergebnisse realer Arbeitsaufgaben (GDPval)
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: Bei GDPval von OpenAI erstellen Modelle Arbeitsergebnisse für Aufgaben aus verschiedenen Berufen. Fachleute vergleichen die Ergebnisse der Modelle und menschlicher Experten anonym miteinander.
So lesen Sie die Werte: Die Siegquote ist der Anteil (%), bei dem das Modellergebnis als besser als das Ergebnis eines menschlichen Experten beurteilt wurde. Die Quote für Siege plus Gleichstände umfasst Ergebnisse, die als gleich gut oder besser gelten. Die Standardgrafik von Epoch verwendet derzeit die Siegquote.
Zu beachten: Die Bewertung basiert auf Expertenurteilen und ausgewählten beruflichen Aufgaben. Die Ergebnisse können je nach Aufgabe variieren. Prüfen Sie daher, ob die angezeigte Kennzahl Siege oder Siege plus Gleichstände umfasst.
Was diese Rangliste zeigt
- Den höchsten Wert erreicht GPT-5.2 mit 49.7%.
- Der Abstand zwischen Platz 1 und Platz 5 beträgt 9.4%p.
- Unter den besten 10 Modellen ist OpenAI mit 4 Modellen am häufigsten vertreten.
- Für 11 Modelle sind Ergebnisse dieses Tests veröffentlicht.
Ergebnisse realer Arbeitsaufgaben (GDPval) Epoch AI
Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04
Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.
Als Tabelle anzeigen (Top 11)
| Rang | Modell | Anbieter | Veröffentlicht | Punkte |
|---|---|---|---|---|
| 1 | #1OGPT-5.2(none) | OpenAI | 2025-12-11 | 49.7% |
| 2 | #2Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 45.5% |
| 3 | #3claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 43.6% |
| 4 | #4Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 42.5% |
| 5 | #5Gemini 3 Pro Preview | 2025-11-18 | 40.3% | |
| 6 | #6OGPT-5(medium) | OpenAI | 2025-08-07 | 34.8% |
| 7 | #7Oo3(medium) | OpenAI | 2025-04-16 | 30.8% |
| 8 | #8Oo4-mini(high) | OpenAI | 2025-04-16 | 25.3% |
| 9 | #9gemini-2.5-pro | 2025-06-05 | 23.3% | |
| 10 | #10xgrok-4-0709_high | xAI | 2025-07-09 | 21.1% |
| 11 | #11OGPT-4o(Nov 2024) | OpenAI | 2024-11-20 | 9.9% |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings