Valumigo

Epoch AI · Mathematik auf höchstem Niveau (FrontierMath)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Dies ist der nicht öffentliche Evaluationsdatensatz der Tiers 1~3 von FrontierMath, den Epoch AI gemeinsam mit professionellen Mathematikern entwickelt hat. Er reicht vom fortgeschrittenen Bachelor-Niveau bis zum Niveau angehender Forschender. Die Aufgaben bleiben unveröffentlicht, um das Risiko einer Kontamination der Trainingsdaten zu verringern.

So lesen Sie die Werte: Gemessen wird die Quote korrekter Antworten (%). Antworten werden in einem vorgegebenen Format als Python-Objekte eingereicht und automatisch auf Korrektheit geprüft.

Zu beachten: Dieser Maßstab unterscheidet sich von Fähigkeiten bei alltäglichen Berechnungen oder Hausaufgabenhilfe. Ein nicht öffentlicher Datensatz beseitigt das Risiko einer Kontamination nicht vollständig. Prüfen Sie bei Vergleichen die Datensatzversion und die Evaluationsbedingungen.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht GPT-6.1 Sol mit 93.7%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 3.9%p.
  • Unter den besten 10 Modellen ist OpenAI mit 6 Modellen am häufigsten vertreten.
  • Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Mathematik auf höchstem Niveau (FrontierMath) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

OGPT-6.1 Sol
93.7%
OGPT-6 Astra
93.7%
AnthropicClaude Opus 5.5
91.2%
AnthropicClaude Fable 5.1
90.2%
OGPT-6 Sol
89.8%
OGPT-5.6 Sol
89.1%
AnthropicClaude Sonnet 5.5
88.8%
OGPT-5.5 Pro
87.7%
AnthropicClaude Fable 5
87.0%
OGPT-5.6 Terra
86.0%
AnthropicClaude Opus 5
85.6%
OGPT-5.5
85.3%
OGPT-5.4 Pro
82.5%
OGPT-5.6 Luna
82.1%
AnthropicClaude Opus 4.8
80.0%
OGPT-6 Luna
78.9%
OGPT-5.4
78.6%
AlibabaQwen3.8 Max
74.7%
MetaMuse Spark 1.3
74.4%
OGPT-5.2 Pro
74.0%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 30)
RangModellAnbieterVeröffentlichtPunkte
1#1OGPT-6.1 Sol(max)OpenAI2026-09-2993.7%
2#2OGPT-6 Astra(max)OpenAI2026-09-0393.7%
3#3AnthropicClaude Opus 5.5(max)Anthropic2026-09-2291.2%
4#4AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.2%
5#5OGPT-6 Sol(max)OpenAI2026-09-2289.8%
6#6OGPT-5.6 Sol(max)OpenAI2026-07-0989.1%
7#7AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2888.8%
8#8OGPT-5.5 Pro(xhigh)OpenAI2026-04-2387.7%
9#9AnthropicClaude Fable 5(max)Anthropic2026-06-0987.0%
10#10OGPT-5.6 Terra(max)OpenAI2026-07-0986.0%
11#11AnthropicClaude Opus 5(max)Anthropic2026-07-2485.6%
12#12OGPT-5.5(xhigh)OpenAI2026-04-2385.3%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0582.5%
14#14OGPT-5.6 Luna(max)OpenAI2026-07-0982.1%
15#15AnthropicClaude Opus 4.8Anthropic2026-05-2880.0%
16#16OGPT-6 Luna(max)OpenAI2026-09-2278.9%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0578.6%
18#18AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0274.7%
19#19MetaMuse Spark 1.3(xhigh)Meta2026-09-0274.4%
20#20OGPT-5.2 ProOpenAI2025-12-1174.0%
21#21Moonshot AIKimi K3(max)Moonshot AI2026-07-1672.2%
22#22GoogleGemini 3.7 Flash(high)Google2026-08-1371.6%
23#23AnthropicClaude Opus 4.7(max)Anthropic2026-04-1670.2%
24#24ZGLM-5.3(max)Z.ai2026-08-1468.8%
25#25GoogleGemini 3.8 Flash(high)Google2026-09-0268.4%
26#26OGPT-5.2(xhigh)OpenAI2025-12-1167.4%
27#27xGrok 4.6(xhigh)xAI2026-08-1266.0%
28#28AnthropicClaude Opus 4.6(max)Anthropic2026-02-0566.0%
29#29AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0165.6%
30#30AnthropicClaude Sonnet 5(max)Anthropic2026-06-3065.6%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings