KI-Benchmark-Ranglisten
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
Neueste Modelle auf einen Blick
Modelle der letzten 120 Tage, nach Veröffentlichungsdatum sortiert, mit Werten aus beiden öffentlichen Quellen in einer Zeile. Die Testergebnisse zeigen den Anteil richtiger Antworten (%).
| Modell | Veröffentlicht | Gesamtindex | GPQA Diamond | FrontierMath | HLE | ARC-AGI-2 | SWE-bench Verified | LMArena-Gesamtrang | LMArena-Rang (Deutsch) |
|---|---|---|---|---|---|---|---|---|---|
| OGPT-6.1 SolOpenAI | 2026-09-29 | – | 95.4 | 93.7 | – | – | – | #21 | Noch nicht verfügbar |
| Claude Sonnet 5.5Anthropic | 2026-09-28 | 165.2 | 95.6 | 88.8 | – | – | – | #45 | Noch nicht verfügbar |
| Claude Opus 5.5Anthropic | 2026-09-22 | 167.4 | – | 91.2 | – | 92.5 | – | #4 | Noch nicht verfügbar |
| OGPT-6 SolOpenAI | 2026-09-22 | – | 94.3 | 89.8 | – | 89.6 | – | #64 | Noch nicht verfügbar |
| OGPT-6 LunaOpenAI | 2026-09-22 | – | – | 78.9 | – | 59.3 | – | #90 | Noch nicht verfügbar |
| DeepSeek V4.1 FlashDeepSeek | 2026-09-09 | 155 | – | – | – | – | – | #38 | Noch nicht verfügbar |
| OGPT-6 AstraOpenAI | 2026-09-03 | 166.5 | 95.8 | 93.7 | 54.8 | 95 | – | #29 | Noch nicht verfügbar |
| Gemini 3.8 FlashGoogle | 2026-09-02 | 156.9 | 95.4 | 68.4 | 44.5 | – | – | #8 | #40 |
| Muse Spark 1.3Meta | 2026-09-02 | 156.9 | – | 74.4 | – | – | – | #9 | #3 |
| Claude Fable 5.1Anthropic | 2026-09-01 | 164.8 | – | 90.2 | 46.5 | 90 | – | #6 | #20 |
| Qwen3.8 Max (0902)Alibaba | 2026-09-01 | 155.2 | 92.3 | 65.6 | – | – | – | Noch nicht verfügbar | Noch nicht verfügbar |
| ZGLM-5.3-FlashZ.ai | 2026-08-20 | 151.9 | – | – | – | – | – | #41 | #48 |
| ZGLM-5.3Z.ai | 2026-08-14 | 155.8 | 90.9 | 68.8 | – | – | – | #27 | #2 |
| Qwen 3.8 27BAlibaba | 2026-08-14 | 149.4 | – | – | – | – | – | #99 | #89 |
| Gemini 3.7 FlashGoogle | 2026-08-13 | 157.4 | 94.8 | 71.6 | – | 84.6 | – | #17 | #21 |
| DeepSeek V4 Pro 0813DeepSeek | 2026-08-13 | 155.4 | 91.7 | – | – | 61.3 | – | Noch nicht verfügbar | Noch nicht verfügbar |
Neue Modelle erscheinen erst nach genügend Abstimmungen in den Ranglisten, besonders in den Sprachranglisten. Direkt nach der Veröffentlichung kann daher „Noch nicht verfügbar“ angezeigt werden.
Deutsch LMArena
Veröffentlicht am 2026-10-02 · Abgerufen am 2026-10-04
Punkte zeigen den Wert, horizontale Linien das 95%-Konfidenzintervall. Überlappende Linien deuten auf ein ähnliches Niveau hin. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen. Die Ranglisten für Dialog und Bildverständnis verwenden die um Tonfall und Antwortlänge bereinigte Auswertung (style control), die auch auf der LMArena-Website standardmäßig angezeigt wird.
Beste Platzierung je Unternehmen
- Googlegemini-3-pro#1
- ZZ.aiglm-5.3-max#2
- Metamuse-spark-1.3-max#3
- Anthropicclaude-opus-4-6-high#5
- OOpenAIgpt-5.6-sol-xhigh#9
- Moonshot AIkimi-k3-max#13
- Alibabaqwen3.8-max#17
- xxAIgrok-4.20-beta1#19
- Baiduernie-5.1#38
Als Tabelle anzeigen (Top 50)
| Rang | Modell | Anbieter | Punkte | 95%-Konfidenzintervall | Stimmen |
|---|---|---|---|---|---|
| 1 | #1gemini-3-pro | 1522 | 1500–1545 | 805 | |
| 2 | #2Zglm-5.3-max | Z.ai | 1520 | 1486–1554 | 282 |
| 3 | #3muse-spark-1.3-max | Meta | 1519 | 1477–1562 | 182 |
| 4 | #4muse-spark | Meta | 1511 | 1471–1551 | 237 |
| 5 | #5claude-opus-4-6-high | Anthropic | 1510 | 1492–1527 | 1,251 |
| 6 | #6claude-opus-5-max | Anthropic | 1506 | 1478–1534 | 489 |
| 7 | #7claude-opus-4-7-high | Anthropic | 1505 | 1486–1524 | 1,014 |
| 8 | #8claude-fable-5-high | Anthropic | 1503 | 1478–1528 | 586 |
| 9 | #9Ogpt-5.6-sol-xhigh | OpenAI | 1501 | 1476–1526 | 566 |
| 10 | #10gemini-3-flash | 1499 | 1474–1524 | 572 | |
| 11 | #11claude-opus-4-7 | Anthropic | 1497 | 1477–1516 | 1,035 |
| 12 | #12gemini-3.1-pro-preview | 1495 | 1480–1510 | 2,025 | |
| 13 | #13kimi-k3-max | Moonshot AI | 1492 | 1466–1518 | 547 |
| 14 | #14gemini-3.5-flash-medium | 1492 | 1469–1514 | 741 | |
| 15 | #15claude-opus-4-8-high | Anthropic | 1491 | 1472–1510 | 1,061 |
| 16 | #16Ogpt-5.5 | OpenAI | 1490 | 1471–1509 | 1,105 |
| 17 | #17qwen3.8-max | Alibaba | 1490 | 1460–1519 | 362 |
| 18 | #18claude-opus-4-6 | Anthropic | 1490 | 1472–1507 | 1,277 |
| 19 | #19xgrok-4.20-beta1 | xAI | 1489 | 1461–1517 | 442 |
| 20 | #20claude-fable-5.1-max | Anthropic | 1487 | 1448–1527 | 220 |
| 21 | #21gemini-3.7-flash-high | 1487 | 1454–1520 | 313 | |
| 22 | #22claude-opus-5-high | Anthropic | 1487 | 1466–1508 | 917 |
| 23 | #23gemini-3.5-flash-high | 1483 | 1460–1505 | 762 | |
| 24 | #24Ogpt-5.6-terra-xhigh | OpenAI | 1482 | 1458–1507 | 592 |
| 25 | #25Ogpt-5.2-chat-latest-20260210 | OpenAI | 1481 | 1456–1506 | 564 |
| 26 | #26gemini-3.6-flash-high | 1479 | 1454–1504 | 571 | |
| 27 | #27claude-opus-4-5-20251101 | Anthropic | 1478 | 1460–1497 | 1,129 |
| 28 | #28Ogpt-4.5-preview-2025-02-27 | OpenAI | 1477 | 1445–1509 | 319 |
| 29 | #29gemini-3-flash (thinking-minimal) | 1477 | 1460–1493 | 1,464 | |
| 30 | #30claude-opus-4-5-20251101-high-32k | Anthropic | 1477 | 1453–1500 | 662 |
| 31 | #31muse-spark-1.1 | Meta | 1476 | 1453–1500 | 687 |
| 32 | #32Ogpt-5.6-luna-xhigh | OpenAI | 1476 | 1452–1500 | 655 |
| 33 | #33Ogpt-5.4-high | OpenAI | 1476 | 1457–1495 | 1,088 |
| 34 | #34xgrok-4.20-multi-agent-beta-0309 | xAI | 1475 | 1456–1495 | 1,046 |
| 35 | #35Zglm-5.2-max | Z.ai | 1473 | 1451–1494 | 805 |
| 36 | #36qwen3.5-max-preview | Alibaba | 1472 | 1442–1502 | 382 |
| 37 | #37gemini-3.5-flash-lite | 1472 | 1448–1495 | 637 | |
| 38 | #38ernie-5.1 | Baidu | 1472 | 1449–1494 | 749 |
| 39 | #39claude-opus-4-8 | Anthropic | 1472 | 1453–1490 | 1,082 |
| 40 | #40gemini-3.8-flash-high | 1472 | 1443–1500 | 398 | |
| 41 | #41Ogpt-5.5-high | OpenAI | 1471 | 1452–1490 | 1,050 |
| 42 | #42gemini-2.5-pro | 1470 | 1457–1483 | 2,638 | |
| 43 | #43deepseek-v4-pro | DeepSeek | 1468 | 1449–1488 | 999 |
| 44 | #44claude-sonnet-5-high | Anthropic | 1468 | 1445–1491 | 719 |
| 45 | #45qwen3.7-plus | Alibaba | 1466 | 1444–1488 | 760 |
| 46 | #46xgrok-4.1 | xAI | 1466 | 1448–1484 | 1,248 |
| 47 | #47Ogpt-5.5-instant | OpenAI | 1465 | 1436–1494 | 427 |
| 48 | #48Zglm-5.3-flash | Z.ai | 1465 | 1435–1494 | 395 |
| 49 | #49mimo-v2.5-pro | Xiaomi | 1464 | 1445–1482 | 1,198 |
| 50 | #50Zglm-5.1 | Z.ai | 1464 | 1444–1484 | 928 |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings