Epoch AI · Computeraufgaben selbstständig erledigen (Terminal-Bench)
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: Terminal-Bench 2.0 bewertet das Erledigen mehrstufiger Aufgaben in einer Terminalumgebung. Dazu gehören Befehlszeilenaufgaben wie die Nutzung von Programmen, Installation, Konfiguration und Debugging.
So lesen Sie die Werte: Gemessen wird der Anteil (%) der Aufgaben, die die Bewertungstests bestehen. Teilweise wird der Durchschnitt mehrerer Durchläufe angegeben. Bewertet werden Kombinationen aus Modellen und Werkzeugen wie Claude Code oder Codex CLI.
Zu beachten: Die Werte variieren je nach Agentenwerkzeugen und Konfiguration. Der repräsentative Wert von Epoch für jedes Modell stammt aus der Modell-Agenten-Kombination mit dem höchsten Ergebnis. Prüfen Sie daher auch die eingesetzten Werkzeuge.
Was diese Rangliste zeigt
- Den höchsten Wert erreicht GPT-5.5 mit 84.7%.
- Der Abstand zwischen Platz 1 und Platz 5 beträgt 4.9%p.
- Unter den besten 10 Modellen ist OpenAI mit 5 Modellen am häufigsten vertreten.
- Für 30 Modelle sind Ergebnisse dieses Tests veröffentlicht.
Computeraufgaben selbstständig erledigen (Terminal-Bench) Epoch AI
Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04
Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.
Als Tabelle anzeigen (Top 30)
| Rang | Modell | Anbieter | Veröffentlicht | Punkte |
|---|---|---|---|---|
| 1 | #1OGPT-5.5(unknown thinking) | OpenAI | 2026-04-23 | 84.7% |
| 2 | #2OGPT-5.4(unknown thinking) | OpenAI | 2026-03-05 | 81.8% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 80.2% | |
| 4 | #4Claude Opus 4.7(unknown) | Anthropic | 2026-04-16 | 80.2% |
| 5 | #5Claude Opus 4.6(unknown thinking) | Anthropic | 2026-02-05 | 79.8% |
| 6 | #6OGPT-5.3 Codex | OpenAI | 2026-02-05 | 78.4% |
| 7 | #7Gemini 3 Pro Preview | 2025-11-18 | 69.4% | |
| 8 | #8OGPT-5.2 Codex | OpenAI | 2025-12-18 | 66.5% |
| 9 | #9OGPT-5.2(unknown thinking) | OpenAI | 2025-12-11 | 64.9% |
| 10 | #10Gemini 3 Flash Preview | 2025-12-17 | 64.3% | |
| 11 | #11Claude Opus 4.5(unknown thinking) | Anthropic | 2025-11-24 | 63.1% |
| 12 | #12OGPT-5.1 Codex Mini | OpenAI | 2025-11-12 | 61.6% |
| 13 | #13? | ? | 61.2% | |
| 14 | #14OGPT-5.1-Codex-Max | OpenAI | 2025-11-19 | 60.4% |
| 15 | #15OGPT-5.1 Codex | OpenAI | 2025-11-12 | 57.8% |
| 16 | #16xgrok-4-20 | xAI | 2026-02-17 | 57.3% |
| 17 | #17Claude Sonnet 4.6(unknown thinking) | Anthropic | 2026-02-17 | 53.4% |
| 18 | #18ZGLM-5 | Z.ai | 2026-02-11 | 52.4% |
| 19 | #19OGPT-5(unknown thinking) | OpenAI | 2025-08-07 | 49.6% |
| 20 | #20OGPT-5.1(medium) | OpenAI | 2025-11-13 | 47.6% |
| 21 | #21Claude Sonnet 4.5(unknown thinking) | Anthropic | 2025-09-29 | 46.5% |
| 22 | #22MiniMax-M2.7 | MiniMax | 2026-03-18 | 45.1% |
| 23 | #23OGPT-5-codex | OpenAI | 2025-09-15 | 44.3% |
| 24 | #24Kimi K2.5 | Moonshot AI | 2026-01-27 | 43.2% |
| 25 | #25MiniMax-M2.5 | MiniMax | 2026-02-12 | 42.7% |
| 26 | #26DeepSeek-V3.2(Thinking; Novita) | DeepSeek | 2025-12-01 | 39.6% |
| 27 | #27claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 38.0% |
| 28 | #28Claude Opus 4.1(unknown thinking) | Anthropic | 2025-08-05 | 38.0% |
| 29 | #29MiniMax-M2.1 | MiniMax | 2025-12-23 | 36.6% |
| 30 | #30Kimi K2 Thinking | Moonshot AI | 2025-11-06 | 35.7% |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings