Valumigo

Epoch AI · Unbekannte Rätsel durch Schlussfolgern lösen (ARC-AGI-2)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: ARC-AGI-2 wurde von der ARC Prize Foundation entwickelt. Aus Eingabe- und Ausgabebeispielen farbiger Raster müssen Transformationsregeln abgeleitet und auf neue Eingaben angewendet werden. Die Aufgaben sind so gestaltet, dass Menschen sie lösen können, sie für KI aber schwierig sind.

So lesen Sie die Werte: Gemessen wird der Anteil korrekt gelöster Raster (%). Die Bewertung erfolgt mit pass@2: Pro Testeingabe dürfen zwei Antworten eingereicht werden.

Zu beachten: Die Werte können je nach Rechenaufwand für die Schlussfolgerung und Lösungsverfahren variieren. Prüfen Sie auch den Evaluationsdatensatz, die Versuchsbedingungen und die Kosten pro Aufgabe.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht GPT-6 Astra mit 95.0%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 5.0%p.
  • Unter den besten 10 Modellen ist OpenAI mit 4 Modellen am häufigsten vertreten.
  • Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Unbekannte Rätsel durch Schlussfolgern lösen (ARC-AGI-2) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

OGPT-6 Astra
95.0%
OGPT-5.6 Sol
92.5%
AnthropicClaude Opus 5.5
92.5%
AnthropicClaude Opus 5
90.4%
AnthropicClaude Fable 5.1
90.0%
OGPT-6 Sol
89.6%
AnthropicClaude Fable 5
89.2%
OGPT-5.5
85.0%
GoogleGemini 3.7 Flash
84.6%
GoogleGemini 3 Deep Think
84.6%
OGPT-5.5 Pro
84.6%
OGPT-5.6 Terra
83.9%
OGPT-5.4 Pro
83.3%
GoogleGemini 3.1 Pro Preview
77.1%
AnthropicClaude Opus 4.7
75.8%
OGPT-5.4
74.0%
GoogleGemini 3.5 Flash
72.1%
AnthropicClaude Opus 4.8
72.1%
AnthropicClaude Opus 4.6
69.2%
xGrok 4.6
67.1%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 30)
RangModellAnbieterVeröffentlichtPunkte
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.0%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0992.5%
3#3AnthropicClaude Opus 5.5(xhigh)Anthropic2026-09-2292.5%
4#4AnthropicClaude Opus 5(max)Anthropic2026-07-2490.4%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.0%
6#6OGPT-6 Sol(max)OpenAI2026-09-2289.6%
7#7AnthropicClaude Fable 5(max)Anthropic2026-06-0989.2%
8#8OGPT-5.5(xhigh)OpenAI2026-04-2385.0%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1384.6%
10#10GoogleGemini 3 Deep ThinkGoogle2026-02-1284.6%
11#11OGPT-5.5 Pro(high)OpenAI2026-04-2384.6%
12#12OGPT-5.6 Terra(max)OpenAI2026-07-0983.9%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0583.3%
14#14GoogleGemini 3.1 Pro PreviewGoogle2026-02-1977.1%
15#15AnthropicClaude Opus 4.7(max)Anthropic2026-04-1675.8%
16#16OGPT-5.4(xhigh)OpenAI2026-03-0574.0%
17#17GoogleGemini 3.5 FlashGoogle2026-05-1972.1%
18#18AnthropicClaude Opus 4.8Anthropic2026-05-2872.1%
19#19AnthropicClaude Opus 4.6(120k thinking)Anthropic2026-02-0569.2%
20#20xGrok 4.6(xhigh)xAI2026-08-1267.1%
21#21xgrok-4-20xAI2026-02-1765.1%
22#22DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3161.4%
23#23DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1361.3%
24#24AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1760.4%
25#25Moonshot AIKimi K3(max)Moonshot AI2026-07-1660.4%
26#26GoogleGemini 3.6 FlashGoogle2026-07-2160.4%
27#27OGPT-5.6 Luna(max)OpenAI2026-07-0959.5%
28#28OGPT-6 Luna(max)OpenAI2026-09-2259.3%
29#29OGPT-5.2 ProOpenAI2025-12-1154.2%
30#30OGPT-5.2(xhigh)OpenAI2025-12-1152.9%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings