Valumigo

Epoch AI · Bedienung grafischer Oberflächen (OSWorld 2.0)

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: OSWorld 2.0 von XLANG Lab umfasst 108 langwierige Desktop- und Webaufgaben, die in einem echten Betriebssystem ausgeführt werden. Es ist ein eigenständiger, schwierigerer Test als das ursprüngliche OSWorld.

So lesen Sie die Werte: Die Standardkennzahl von Epoch ist die vollständige Erfolgsquote (%): Alle bewerteten Kontrollpunkte einer Aufgabe müssen bestanden sein. Sie unterscheidet sich von Teilwertungen für teilweise erledigte Aufgaben.

Zu beachten: Die Werte variieren je nach Ausführungsumgebung, Werkzeugkonfiguration und erlaubter Schrittzahl. Epoch zeigt Ergebnisse mit einem Standardbudget von 500 Schritten an. Prüfen Sie daher, ob die Bedingungen übereinstimmen.

Was diese Rangliste zeigt

  • Den höchsten Wert erreicht Claude Opus 5 mit 31.4%.
  • Der Abstand zwischen Platz 1 und Platz 5 beträgt 18.4%p.
  • Unter den besten 9 Modellen ist Anthropic mit 4 Modellen am häufigsten vertreten.
  • Für 9 Modelle sind Ergebnisse dieses Tests veröffentlicht.

Bedienung grafischer Oberflächen (OSWorld 2.0) Epoch AI

Die Daten umfassen eigene Messungen von Epoch AI sowie Ergebnisse von Entwicklern und Bewertungsinstituten. Je nach Test wurden unterschiedliche Modelle bewertet; die neuesten Modelle fehlen daher bei manchen Tests noch. Für jedes Modell zeigen wir das beste Ergebnis über alle getesteten Stufen des Denkaufwands. · Abgerufen am 2026-10-04

AnthropicClaude Opus 5
31.4%
OGPT-5.6 Sol
27.3%
AnthropicClaude Opus 4.8
20.6%
AnthropicClaude Opus 4.7
18.2%
OGPT-5.5
13.0%
AnthropicClaude Sonnet 4.6
9.3%
MiniMaxMiniMax-M3
4.6%
Moonshot AIKimi K2.6
4.6%
AlibabaQwen3.7 Plus
2.8%

Balken zeigen den Anteil korrekter Antworten (%) und beginnen bei 0%.

Als Tabelle anzeigen (Top 9)
RangModellAnbieterVeröffentlichtPunkte
1#1AnthropicClaude Opus 5(max)Anthropic2026-07-2431.4%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0927.3%
3#3AnthropicClaude Opus 4.8Anthropic2026-05-2820.6%
4#4AnthropicClaude Opus 4.7(max)Anthropic2026-04-1618.2%
5#5OGPT-5.5(xhigh)OpenAI2026-04-2313.0%
6#6AnthropicClaude Sonnet 4.6(medium)Anthropic2026-02-179.3%
7#7MiniMaxMiniMax-M3MiniMax2026-06-014.6%
8#8Moonshot AIKimi K2.6Moonshot AI2026-04-204.6%
9#9AlibabaQwen3.7 PlusAlibaba2026-06-022.8%

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings