Valumigo

Epoch AI · Reale Codefehler beheben (SWE-bench Verified)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: SWE-bench Verified bewertet das Lösen von GitHub-Issues aus realen Python-Open-Source-Repositories. Der ursprüngliche Datensatz umfasst 500 Issues aus 12 Repositories. Epoch verwendet für seine eigene Evaluation 484 Issues, die in der Ausführungsumgebung validiert wurden.

So lesen Sie die Werte: Gemessen wird der Anteil (%) der Issues, die sowohl die vorgegebenen Tests zur Lösungsprüfung als auch die Tests zum Erhalt bestehender Funktionen bestehen. Nutzen Sie den Wert zum Vergleich der Fähigkeit, Issues in realen Repositories zu lösen.

Zu beachten: Die Werte hängen neben dem Modell auch von den Werkzeugen und der Agentenkonfiguration ab. Der Schwerpunkt liegt auf Python-Repositories. Prüfen Sie auch die Anzahl der bewerteten Issues und die Ausführungsbedingungen.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht Claude Opus 4.7 mit 83.5%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 4.8%p.
  • Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Reale Codefehler beheben (SWE-bench Verified) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

AnthropicClaude Opus 4.7
83.5%
OGPT-5.5
80.6%
GoogleGemini 3.5 Flash
79.3%
AnthropicClaude Opus 4.6
78.7%
ZGLM-5.2
78.7%
DeepSeekDeepSeek v4 Pro
77.6%
AlibabaQwen3.7 Max
77.3%
OGPT-5.4
76.9%
AlibabaQwen 3.6 Max
76.7%
Moonshot AIKimi K2.6
76.7%
AnthropicClaude Opus 4.5
76.7%
GoogleGemini 3.1 Pro Preview
75.6%
GoogleGemini 3 Flash Preview
75.4%
AnthropicClaude Sonnet 4.6
75.2%
OGPT-5.3 Codex
74.8%
ZGLM-5.1
74.2%
Moonshot AIKimi K2.5
73.8%
OGPT-5.2
73.8%
OGPT-5
73.6%
Anthropicclaude-opus-4-1-20250805
73.3%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 30)
RangModellAnbieterVeröffentlichtPunkte
1#1AnthropicClaude Opus 4.7(max)Anthropic2026-04-1683.5%
2#2OGPT-5.5(xhigh)OpenAI2026-04-2380.6%
3#3GoogleGemini 3.5 FlashGoogle2026-05-1979.3%
4#4AnthropicClaude Opus 4.6(no thinking)Anthropic2026-02-0578.7%
5#5ZGLM-5.2Z.ai2026-06-1678.7%
6#6DeepSeekDeepSeek v4 Pro(max)DeepSeek2026-04-2477.6%
7#7AlibabaQwen3.7 MaxAlibaba2026-05-1977.3%
8#8OGPT-5.4(high)OpenAI2026-03-0576.9%
9#9AlibabaQwen 3.6 Max(Preview)Alibaba2026-04-2076.7%
10#10Moonshot AIKimi K2.6Moonshot AI2026-04-2076.7%
11#11AnthropicClaude Opus 4.5(no thinking)Anthropic2025-11-2476.7%
12#12GoogleGemini 3.1 Pro PreviewGoogle2026-02-1975.6%
13#13GoogleGemini 3 Flash PreviewGoogle2025-12-1775.4%
14#14AnthropicClaude Sonnet 4.6(no thinking)Anthropic2026-02-1775.2%
15#15OGPT-5.3 Codex(high)OpenAI2026-02-0574.8%
16#16ZGLM-5.1Z.ai2026-04-0774.2%
17#17Moonshot AIKimi K2.5Moonshot AI2026-01-2773.8%
18#18OGPT-5.2(high)OpenAI2025-12-1173.8%
19#19OGPT-5(high)OpenAI2025-08-0773.6%
20#20Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0573.3%
21#21GoogleGemini 3 Pro PreviewGoogle2025-11-1872.9%
22#22ZGLM-5Z.ai2026-02-1172.1%
23#23AnthropicClaude Sonnet 4.5(no thinking)Anthropic2025-09-2971.3%
24#24AnthropicClaude Opus 4Anthropic2025-05-2270.7%
25#25OGPT-5.1(high)OpenAI2025-11-1368.0%
26#26OGPT-5 mini(medium)OpenAI2025-08-0764.7%
27#27Oo3(medium)OpenAI2025-04-1662.3%
28#28Anthropicclaude-3-7-sonnet-20250219Anthropic2025-02-2461.0%
29#29AlibabaQwen 3.6 Plus(2026-04-02)Alibaba2026-03-3157.9%
30#30Googlegemini-2.5-proGoogle2025-06-0557.6%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings