Artificial Analysis · Agentenindex
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: Ein Index, für den Artificial Analysis Bewertungen mehrstufiger Agentenaufgaben mit Werkzeugnutzung zusammenfasst.
So lesen Sie die Werte: Höhere Werte bedeuten bessere Ergebnisse bei der Werkzeugnutzung und bei mehrstufigen Aufgaben.
Zu beachten: Die Ergebnisse können je nach Testumgebung und verfügbaren Werkzeugen variieren. Sie lassen sich daher nur bedingt mit der Leistung der tatsächlich verwendeten Agentenwerkzeuge gleichsetzen.
Was diese Rangliste zeigt
- Den höchsten Wert erreicht Claude Fable 5.1 (Max, Default Fallback) mit 57.9.
- Der Abstand zwischen Platz 1 und Platz 5 beträgt 4.9.
- Unter den besten 10 Modellen ist Anthropic mit 3 Modellen am häufigsten vertreten.
Agentenindex Artificial Analysis
Veröffentlicht am 2026-10-05 · Abgerufen am 2026-10-05
Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen.
Als Tabelle anzeigen (Top 60)
| Rang | Modell | Anbieter | Punkte |
|---|---|---|---|
| 1 | #1Claude Fable 5.1 (Max, Default Fallback) | Anthropic | 57.9 |
| 2 | #2Claude Opus 5 (Max) | Anthropic | 56.5 |
| 3 | #3Qwen3.8 Max (0902) | Alibaba | 56 |
| 4 | #4ZGLM-5.3 (Max) | Z.ai | 53.1 |
| 5 | #5xGrok 4.6 (High) | xAI | 53 |
| 6 | #6OGPT-6 Astra (max) | OpenAI | 51 |
| 7 | #7ZGLM 5.3 Flash | Z.ai | 50.9 |
| 8 | #8Claude Fable 5 (Max, Opus 4.8 Fallback) | Anthropic | 50.7 |
| 9 | #9OGPT-5.6 Sol (Max) | OpenAI | 50.2 |
| 10 | #10Qwen3.8 2.4T A95B | Alibaba | 50.1 |
| 11 | #11Kimi K3 (Max) | Moonshot AI | 50 |
| 12 | #12Qwen3.8 Max | Alibaba | 49.9 |
| 13 | #13Qwen3.8 27B (Xhigh) | Alibaba | 45.8 |
| 14 | #14Claude Sonnet 5 (Max) | Anthropic | 43.6 |
| 15 | #15Muse Spark 1.2 (Xhigh) | Meta | 43.2 |
| 16 | #16OGPT-5.6 Terra (Max) | OpenAI | 43.2 |
| 17 | #17OGPT-5.6 Luna (Max) | OpenAI | 42.1 |
| 18 | #18Claude Opus 4.8 (Max) | Anthropic | 41.9 |
| 19 | #19DeepSeek V4 Pro 0813 (Max) | DeepSeek | 41.3 |
| 20 | #20xGrok 4.5 (High) | xAI | 41.2 |
| 21 | #21DeepSeek V4 Flash 0731 (Max) | DeepSeek | 41 |
| 22 | #22Gemini 3.8 Flash (High) | 40.2 | |
| 23 | #23Claude Opus 4.7 (Max) | Anthropic | 38.6 |
| 24 | #24ZGLM-5.2 (Max) | Z.ai | 38.4 |
| 25 | #25OGPT-5.5 (Xhigh) | OpenAI | 36.4 |
| 26 | #26Gemini 3.7 Flash (High) | 35.2 | |
| 27 | #27Claude Sonnet 4.6 (Max) | Anthropic | 31.8 |
| 28 | #28MiniMax-M3 | MiniMax | 29.5 |
| 29 | #29Gemini 3.6 Flash (High) | 29 | |
| 30 | #30iLing-3.0-flash-VL | inclusionAI | 28.7 |
| 31 | #31iLing-3.0-flash-Fin | inclusionAI | 27.9 |
| 32 | #32DeepSeek V4 Flash 0420 (High) | DeepSeek | 26.3 |
| 33 | #33DeepSeek V4 Pro 0424 (Max) | DeepSeek | 26.3 |
| 34 | #34Gemini 3.5 Flash (High) | 26 | |
| 35 | #35Muse Spark 1.1 (Xhigh) | Meta | 25.8 |
| 36 | #36THy3 | Tencent | 24.1 |
| 37 | #37ZGLM-5.1 (Reasoning) | Z.ai | 23.9 |
| 38 | #38NNex-N2-Pro (Based on Qwen3.5-397B-A17B) | Nex Agi | 23.7 |
| 39 | #39TInkling Small | Thinkingmachines | 23.5 |
| 40 | #40TInkling (Xhigh) | Thinkingmachines | 22.5 |
| 41 | #41Qwen3.7 Max | Alibaba | 22.5 |
| 42 | #42MiMo-V2.5-Pro (Reasoning) | Xiaomi | 21.3 |
| 43 | #43Kimi K2.7 Code | Moonshot AI | 21 |
| 44 | #44Kimi K2.6 (Reasoning) | Moonshot AI | 20.5 |
| 45 | #45Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 20.1 |
| 46 | #46iLing 3.0 Flash | inclusionAI | 19.3 |
| 47 | #47Qwen3.6 27B (Reasoning) | Alibaba | 18.5 |
| 48 | #48OGPT-5.4 mini (Xhigh) | OpenAI | 17.9 |
| 49 | #49Qwen3.7 Plus | Alibaba | 17.5 |
| 50 | #50OGPT-5.4 nano (Xhigh) | OpenAI | 16 |
| 51 | #51Claude 4.5 Sonnet (Reasoning) | Anthropic | 15.8 |
| 52 | #52MiMo-V2.5 | Xiaomi | 15.8 |
| 53 | #53xGrok 4.3 (High) | xAI | 15.5 |
| 54 | #54MiniMax-M2.7 | MiniMax | 15.3 |
| 55 | #55Gemini 3.5 Flash-Lite | 14.3 | |
| 56 | #56MLongCat 2.0 | Meituan | 14 |
| 57 | #57Qwen3.6 35B A3B (Reasoning) | Alibaba | 13.1 |
| 58 | #58iRing-2.6-1T | inclusionAI | 10.7 |
| 59 | #59Qwen3.5 397B A17B (Reasoning) | Alibaba | 8.3 |
| 60 | #60Gemini 3.1 Pro Preview | 8.2 |
Source: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings