Valumigo

Epoch AI · Computeraufgaben selbstständig erledigen (Terminal-Bench)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Terminal-Bench 2.0 bewertet das Erledigen mehrstufiger Aufgaben in einer Terminalumgebung. Dazu gehören Befehlszeilenaufgaben wie die Nutzung von Programmen, Installation, Konfiguration und Debugging.

So lesen Sie die Werte: Gemessen wird der Anteil (%) der Aufgaben, die die Bewertungstests bestehen. Teilweise wird der Durchschnitt mehrerer Durchläufe angegeben. Bewertet werden Kombinationen aus Modellen und Werkzeugen wie Claude Code oder Codex CLI.

Zu beachten: Die Werte variieren je nach Agentenwerkzeugen und Konfiguration. Der repräsentative Wert von Epoch für jedes Modell stammt aus der Modell-Agenten-Kombination mit dem höchsten Ergebnis. Prüfen Sie daher auch die eingesetzten Werkzeuge.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht GPT-5.5 mit 84.7%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 4.9%p.
  • Unter den besten 10 Modellen ist OpenAI mit 5 Modellen am häufigsten vertreten.
  • Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Computeraufgaben selbstständig erledigen (Terminal-Bench) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

OGPT-5.5
84.7%
OGPT-5.4
81.8%
GoogleGemini 3.1 Pro Preview
80.2%
AnthropicClaude Opus 4.7
80.2%
AnthropicClaude Opus 4.6
79.8%
OGPT-5.3 Codex
78.4%
GoogleGemini 3 Pro Preview
69.4%
OGPT-5.2 Codex
66.5%
OGPT-5.2
64.9%
GoogleGemini 3 Flash Preview
64.3%
AnthropicClaude Opus 4.5
63.1%
OGPT-5.1 Codex Mini
61.6%
?
61.2%
OGPT-5.1-Codex-Max
60.4%
OGPT-5.1 Codex
57.8%
xgrok-4-20
57.3%
AnthropicClaude Sonnet 4.6
53.4%
ZGLM-5
52.4%
OGPT-5
49.6%
OGPT-5.1
47.6%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 30)
RangModellAnbieterVeröffentlichtPunkte
1#1OGPT-5.5(unknown thinking)OpenAI2026-04-2384.7%
2#2OGPT-5.4(unknown thinking)OpenAI2026-03-0581.8%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1980.2%
4#4AnthropicClaude Opus 4.7(unknown)Anthropic2026-04-1680.2%
5#5AnthropicClaude Opus 4.6(unknown thinking)Anthropic2026-02-0579.8%
6#6OGPT-5.3 CodexOpenAI2026-02-0578.4%
7#7GoogleGemini 3 Pro PreviewGoogle2025-11-1869.4%
8#8OGPT-5.2 CodexOpenAI2025-12-1866.5%
9#9OGPT-5.2(unknown thinking)OpenAI2025-12-1164.9%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1764.3%
11#11AnthropicClaude Opus 4.5(unknown thinking)Anthropic2025-11-2463.1%
12#12OGPT-5.1 Codex MiniOpenAI2025-11-1261.6%
13#13??61.2%
14#14OGPT-5.1-Codex-MaxOpenAI2025-11-1960.4%
15#15OGPT-5.1 CodexOpenAI2025-11-1257.8%
16#16xgrok-4-20xAI2026-02-1757.3%
17#17AnthropicClaude Sonnet 4.6(unknown thinking)Anthropic2026-02-1753.4%
18#18ZGLM-5Z.ai2026-02-1152.4%
19#19OGPT-5(unknown thinking)OpenAI2025-08-0749.6%
20#20OGPT-5.1(medium)OpenAI2025-11-1347.6%
21#21AnthropicClaude Sonnet 4.5(unknown thinking)Anthropic2025-09-2946.5%
22#22MiniMaxMiniMax-M2.7MiniMax2026-03-1845.1%
23#23OGPT-5-codexOpenAI2025-09-1544.3%
24#24Moonshot AIKimi K2.5Moonshot AI2026-01-2743.2%
25#25MiniMaxMiniMax-M2.5MiniMax2026-02-1242.7%
26#26DeepSeekDeepSeek-V3.2(Thinking; Novita)DeepSeek2025-12-0139.6%
27#27Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0538.0%
28#28AnthropicClaude Opus 4.1(unknown thinking)Anthropic2025-08-0538.0%
29#29MiniMaxMiniMax-M2.1MiniMax2025-12-2336.6%
30#30Moonshot AIKimi K2 ThinkingMoonshot AI2025-11-0635.7%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings