Epoch AI · Bedienung grafischer Oberflächen (OSWorld 2.0)
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: OSWorld 2.0 von XLANG Lab umfasst 108 langwierige Desktop- und Webaufgaben, die in einem echten Betriebssystem ausgeführt werden. Es ist ein eigenständiger, schwierigerer Test als das ursprüngliche OSWorld.
So lesen Sie die Werte: Die Standardkennzahl von Epoch ist die vollständige Erfolgsquote (%): Alle bewerteten Kontrollpunkte einer Aufgabe müssen bestanden sein. Sie unterscheidet sich von Teilwertungen für teilweise erledigte Aufgaben.
Zu beachten: Die Werte variieren je nach Ausführungsumgebung, Werkzeugkonfiguration und erlaubter Schrittzahl. Epoch zeigt Ergebnisse mit einem Standardbudget von 500 Schritten an. Prüfen Sie daher, ob die Bedingungen übereinstimmen.
Was diese Rangliste zeigt
- Den höchsten Wert erreicht Claude Opus 5 mit 31.4%.
- Der Abstand zwischen Platz 1 und Platz 5 beträgt 18.4%p.
- Unter den besten 9 Modellen ist Anthropic mit 4 Modellen am häufigsten vertreten.
- Für 9 Modelle sind Ergebnisse dieses Tests veröffentlicht.
Bedienung grafischer Oberflächen (OSWorld 2.0) Epoch AI
Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04
Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.
Als Tabelle anzeigen (Top 9)
| Rang | Modell | Anbieter | Veröffentlicht | Punkte |
|---|---|---|---|---|
| 1 | #1Claude Opus 5(max) | Anthropic | 2026-07-24 | 31.4% |
| 2 | #2OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 27.3% |
| 3 | #3Claude Opus 4.8 | Anthropic | 2026-05-28 | 20.6% |
| 4 | #4Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 18.2% |
| 5 | #5OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 13.0% |
| 6 | #6Claude Sonnet 4.6(medium) | Anthropic | 2026-02-17 | 9.3% |
| 7 | #7MiniMax-M3 | MiniMax | 2026-06-01 | 4.6% |
| 8 | #8Kimi K2.6 | Moonshot AI | 2026-04-20 | 4.6% |
| 9 | #9Qwen3.7 Plus | Alibaba | 2026-06-02 | 2.8% |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings