LMArena · Aufgabenerfolg von Agenten
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: Diese Rangliste betrachtet ausschließlich das Signal „Bestätigung des Aufgabenerfolgs“ aus der Agent Arena. Sie verwendet Ergebnisse, die Nutzer nach Abschluss der Agentenaufgabe ausdrücklich als Erfolg oder Misserfolg markiert haben.
So lesen Sie die Werte: Der IPS(τ̂)-Wert hat 0 als Basislinie. Höhere Werte bedeuten, dass die von Nutzern als erfolgreich markierten Ergebnisse gegenüber der Basislinie besser ausfielen.
Zu beachten: Es werden nur ausdrücklich von Nutzern markierte Ergebnisse berücksichtigt; Aufgaben ohne Markierung bleiben unberücksichtigt. Die Reihenfolge kann von der Gesamtrangliste abweichen.
Was diese Rangliste zeigt
- Die 95%-Konfidenzintervalle von Claude Fable 5.1 (Max) auf Platz 1 und GPT 6.1 Sol (Max) auf Platz 2 überlappen sich. Aus dieser Auswertung allein lässt sich die Reihenfolge der beiden Modelle schwer eindeutig bestimmen.
- Bei 5 weiteren Modellen überlappt das Konfidenzintervall mit dem von Platz 1. Interpretieren Sie kleine Rangunterschiede vorsichtig und unter Berücksichtigung der Stimmenzahl.
- Unter den besten 10 Modellen ist Anthropic mit 5 Modellen am häufigsten vertreten.
- Für das erstplatzierte Modell liegen 7,868 Beobachtungen vor. Diese Rangliste umfasst 50 Modelle.
Aufgabenerfolg von Agenten LMArena
Veröffentlicht am 2026-10-02 · Abgerufen am 2026-10-04
Der Wert wird als IPS(τ̂) angegeben. 0 ist die Basislinie; höhere Werte sind besser. Die Linien zeigen 95%-Konfidenzintervalle. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen.
Beste Platzierung je Unternehmen
- AnthropicClaude Fable 5.1 (Max)#1
- OOpenAIGPT 6.1 Sol (Max)#2
- GoogleGemini 4 Argon (High)#3
- DeepSeekDeepseek V4.1 Flash (Max)#8
- Moonshot AIKimi K3 (Max)#9
- TTencentHy4 preview#14
- XiaomiMiMo V2.6 Flash#15
- xxAIGrok 4.7 (xHigh)#16
- ZZ.aiGLM 5.3 (Max)#17
Als Tabelle anzeigen (Top 50)
| Rang | Modell | Anbieter | Punkte | 95%-Konfidenzintervall | Beobachtungen |
|---|---|---|---|---|---|
| 1 | #1Claude Fable 5.1 (Max) | Anthropic | 0.176 | 0.148–0.205 | 7,868 |
| 2 | #2OGPT 6.1 Sol (Max) | OpenAI | 0.155 | 0.114–0.196 | 2,270 |
| 3 | #3Gemini 4 Argon (High) | 0.154 | 0.125–0.184 | 4,422 | |
| 4 | #4Claude Opus 5.5 (High) | Anthropic | 0.141 | 0.101–0.182 | 3,425 |
| 5 | #5Claude Sonnet 5.5 (Max) | Anthropic | 0.139 | 0.086–0.193 | 1,195 |
| 6 | #6OGPT 6 Astra (Max) | OpenAI | 0.132 | 0.095–0.169 | 5,954 |
| 7 | #7Claude Opus 5 (Max) | Anthropic | 0.095 | 0.064–0.126 | 15,453 |
| 8 | #8Deepseek V4.1 Flash (Max) | DeepSeek | 0.084 | 0.074–0.095 | 60,410 |
| 9 | #9Kimi K3 (Max) | Moonshot AI | 0.076 | 0.064–0.088 | 99,685 |
| 10 | #10Claude Opus 5 (High) | Anthropic | 0.076 | 0.046–0.106 | 20,843 |
| 11 | #11OGPT 6 Sol (Max) | OpenAI | 0.071 | 0.028–0.114 | 3,312 |
| 12 | #12Gemini 3.8 Flash (High) | 0.069 | 0.05–0.087 | 22,497 | |
| 13 | #13Claude Fable 5 (High) | Anthropic | 0.061 | 0.035–0.087 | 33,005 |
| 14 | #14THy4 preview | Tencent | 0.058 | 0.042–0.075 | 24,238 |
| 15 | #15MiMo V2.6 Flash | Xiaomi | 0.056 | 0.03–0.082 | 7,967 |
| 16 | #16xGrok 4.7 (xHigh) | xAI | 0.055 | 0.021–0.089 | 5,906 |
| 17 | #17ZGLM 5.3 (Max) | Z.ai | 0.053 | 0.037–0.068 | 62,886 |
| 18 | #18OGPT 5.6 Sol (xHigh) | OpenAI | 0.05 | 0.024–0.077 | 28,118 |
| 19 | #19Muse Spark 1.3 (Max) | Meta | 0.05 | 0.037–0.064 | 45,563 |
| 20 | #20ZGLM 5.2 (Max) | Z.ai | 0.048 | 0.032–0.063 | 55,555 |
| 21 | #21Qwen3.8 Max | Alibaba | 0.047 | 0.033–0.061 | 35,416 |
| 22 | #22SStep 5 Preview | StepFun | 0.045 | 0.012–0.078 | 4,266 |
| 23 | #23ZGLM 5.3 Flash | Z.ai | 0.044 | 0.032–0.055 | 60,370 |
| 24 | #24Claude Opus 4.8 (High) | Anthropic | 0.042 | 0.016–0.069 | 30,039 |
| 25 | #25Qwen3.8 Flash Next | Alibaba | 0.036 | 0.021–0.051 | 38,898 |
| 26 | #26xGrok 4.5 | xAI | 0.013 | -0.01–0.037 | 29,109 |
| 27 | #27Claude Sonnet 5 (High) | Anthropic | 0.012 | -0.023–0.047 | 22,551 |
| 28 | #28Gemini 3.7 Flash (High) | 0.012 | -0.006–0.029 | 48,036 | |
| 29 | #29Qwen 3.8 27B | Alibaba | 0.01 | -0.005–0.024 | 36,984 |
| 30 | #30OGPT 6 Luna (Max) | OpenAI | -0.001 | -0.025–0.023 | 14,416 |
| 31 | #31xGrok 4.6 (xHigh) | xAI | -0.006 | -0.029–0.018 | 20,463 |
| 32 | #32OGPT 5.5 (xHigh) | OpenAI | -0.009 | -0.031–0.014 | 43,172 |
| 33 | #33DeepSeek V4 Pro (High) (0813) | DeepSeek | -0.017 | -0.057–0.023 | 3,790 |
| 34 | #34OGPT 5.4 (High) | OpenAI | -0.025 | -0.046–-0.004 | 57,450 |
| 35 | #35OGPT 5.6 Luna (xHigh) | OpenAI | -0.033 | -0.049–-0.017 | 33,799 |
| 36 | #36OGPT 5.6 Terra (xHigh) | OpenAI | -0.039 | -0.065–-0.013 | 18,613 |
| 37 | #37Muse Spark 1.1 | Meta | -0.043 | -0.054–-0.031 | 95,130 |
| 38 | #38OGPT 5.5 | OpenAI | -0.047 | -0.068–-0.026 | 64,950 |
| 39 | #39Muse Spark 1.2 (xHigh) | Meta | -0.054 | -0.072–-0.036 | 33,552 |
| 40 | #40Gemini 3.6 Flash (High) | -0.057 | -0.083–-0.031 | 18,029 | |
| 41 | #41Qwen3.7 Max | Alibaba | -0.091 | -0.115–-0.066 | 30,156 |
| 42 | #42Qwen3.7 Plus | Alibaba | -0.093 | -0.126–-0.06 | 15,130 |
| 43 | #43Mimo V2.5 Pro | Xiaomi | -0.096 | -0.119–-0.073 | 29,517 |
| 44 | #44Gemini 3.1 Pro Preview | -0.099 | -0.121–-0.078 | 69,866 | |
| 45 | #45THy3 | Tencent | -0.112 | -0.14–-0.084 | 14,238 |
| 46 | #46Minimax M3 | MiniMax | -0.137 | -0.162–-0.112 | 28,148 |
| 47 | #47Mistral Medium 3.5 | Mistral AI | -0.145 | -0.183–-0.108 | 6,629 |
| 48 | #48TInkling Small | Thinky | -0.201 | -0.244–-0.158 | 7,271 |
| 49 | #49USolar Pro 4 | Upstage | -0.205 | -0.259–-0.152 | 4,788 |
| 50 | #50TInkling | Thinky | -0.207 | -0.237–-0.177 | 24,644 |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings