Valumigo

KI-Benchmark-Ranglisten

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

Neueste Modelle auf einen Blick

Modelle der letzten 120 Tage, nach Veröffentlichungsdatum sortiert, mit Werten aus beiden öffentlichen Quellen in einer Zeile. Die Testergebnisse zeigen den Anteil richtiger Antworten (%).

ModellVeröffentlichtGesamtindexGPQA DiamondFrontierMathHLEARC-AGI-2SWE-bench VerifiedLMArena-GesamtrangLMArena-Rang (Deutsch)
OGPT-6.1 SolOpenAI2026-09-29–95.493.7–––#21Noch nicht verfügbar
AnthropicClaude Sonnet 5.5Anthropic2026-09-28165.295.688.8–––#45Noch nicht verfügbar
AnthropicClaude Opus 5.5Anthropic2026-09-22167.4–91.2–92.5–#4Noch nicht verfügbar
OGPT-6 SolOpenAI2026-09-22–94.389.8–89.6–#64Noch nicht verfügbar
OGPT-6 LunaOpenAI2026-09-22––78.9–59.3–#90Noch nicht verfügbar
DeepSeekDeepSeek V4.1 FlashDeepSeek2026-09-09155–––––#38Noch nicht verfügbar
OGPT-6 AstraOpenAI2026-09-03166.595.893.754.895–#29Noch nicht verfügbar
GoogleGemini 3.8 FlashGoogle2026-09-02156.995.468.444.5––#8#40
MetaMuse Spark 1.3Meta2026-09-02156.9–74.4–––#9#3
AnthropicClaude Fable 5.1Anthropic2026-09-01164.8–90.246.590–#6#20
AlibabaQwen3.8 Max (0902)Alibaba2026-09-01155.292.365.6–––Noch nicht verfügbarNoch nicht verfügbar
ZGLM-5.3-FlashZ.ai2026-08-20151.9–––––#41#48
ZGLM-5.3Z.ai2026-08-14155.890.968.8–––#27#2
AlibabaQwen 3.8 27BAlibaba2026-08-14149.4–––––#99#89
GoogleGemini 3.7 FlashGoogle2026-08-13157.494.871.6–84.6–#17#21
DeepSeekDeepSeek V4 Pro 0813DeepSeek2026-08-13155.491.7––61.3–Noch nicht verfügbarNoch nicht verfügbar

Neue Modelle erscheinen erst nach genügend Abstimmungen in den Ranglisten, besonders in den Sprachranglisten. Direkt nach der Veröffentlichung kann daher „Noch nicht verfügbar“ angezeigt werden.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

Deutsch LMArena

Veröffentlicht am 2026-10-02 · Abgerufen am 2026-10-04

144014701500153015601590
Googlegemini-3-pro
1522
Zglm-5.3-max
1520
Metamuse-spark-1.3-max
1519
Metamuse-spark
1511
Anthropicclaude-opus-4-6-high
1510
Anthropicclaude-opus-5-max
1506
Anthropicclaude-opus-4-7-high
1505
Anthropicclaude-fable-5-high
1503
Ogpt-5.6-sol-xhigh
1501
Googlegemini-3-flash
1499
Googlegemini-3.1-pro-preview
1495
Moonshot AIkimi-k3-max
1492
Googlegemini-3.5-flash-medium
1492
Anthropicclaude-opus-4-8-high
1491
Ogpt-5.5
1490
Alibabaqwen3.8-max
1490
xgrok-4.20-beta1
1489
Anthropicclaude-fable-5.1-max
1487
Googlegemini-3.7-flash-high
1487
Ogpt-5.6-terra-xhigh
1482

Punkte zeigen den Wert, horizontale Linien das 95%-Konfidenzintervall. Überlappende Linien deuten auf ein ähnliches Niveau hin. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen. Die Ranglisten für Dialog und Bildverständnis verwenden die um Tonfall und Antwortlänge bereinigte Auswertung (style control), die auch auf der LMArena-Website standardmäßig angezeigt wird.

Beste Platzierung je Unternehmen

  • GoogleGooglegemini-3-pro#1
  • ZZ.aiglm-5.3-max#2
  • MetaMetamuse-spark-1.3-max#3
  • AnthropicAnthropicclaude-opus-4-6-high#5
  • OOpenAIgpt-5.6-sol-xhigh#9
  • Moonshot AIMoonshot AIkimi-k3-max#13
  • AlibabaAlibabaqwen3.8-max#17
  • xxAIgrok-4.20-beta1#19
  • BaiduBaiduernie-5.1#38
Als Tabelle anzeigen (Top 50)
RangModellAnbieterPunkte95%-KonfidenzintervallStimmen
1#1Googlegemini-3-proGoogle15221500–1545805
2#2Zglm-5.3-maxZ.ai15201486–1554282
3#3Metamuse-spark-1.3-maxMeta15191477–1562182
4#4Metamuse-sparkMeta15111471–1551237
5#5Anthropicclaude-opus-4-6-highAnthropic15101492–15271,251
6#6Anthropicclaude-opus-5-maxAnthropic15061478–1534489
7#7Anthropicclaude-opus-4-7-highAnthropic15051486–15241,014
8#8Anthropicclaude-fable-5-highAnthropic15031478–1528586
9#9Ogpt-5.6-sol-xhighOpenAI15011476–1526566
10#10Googlegemini-3-flashGoogle14991474–1524572
11#11Anthropicclaude-opus-4-7Anthropic14971477–15161,035
12#12Googlegemini-3.1-pro-previewGoogle14951480–15102,025
13#13Moonshot AIkimi-k3-maxMoonshot AI14921466–1518547
14#14Googlegemini-3.5-flash-mediumGoogle14921469–1514741
15#15Anthropicclaude-opus-4-8-highAnthropic14911472–15101,061
16#16Ogpt-5.5OpenAI14901471–15091,105
17#17Alibabaqwen3.8-maxAlibaba14901460–1519362
18#18Anthropicclaude-opus-4-6Anthropic14901472–15071,277
19#19xgrok-4.20-beta1xAI14891461–1517442
20#20Anthropicclaude-fable-5.1-maxAnthropic14871448–1527220
21#21Googlegemini-3.7-flash-highGoogle14871454–1520313
22#22Anthropicclaude-opus-5-highAnthropic14871466–1508917
23#23Googlegemini-3.5-flash-highGoogle14831460–1505762
24#24Ogpt-5.6-terra-xhighOpenAI14821458–1507592
25#25Ogpt-5.2-chat-latest-20260210OpenAI14811456–1506564
26#26Googlegemini-3.6-flash-highGoogle14791454–1504571
27#27Anthropicclaude-opus-4-5-20251101Anthropic14781460–14971,129
28#28Ogpt-4.5-preview-2025-02-27OpenAI14771445–1509319
29#29Googlegemini-3-flash (thinking-minimal)Google14771460–14931,464
30#30Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14771453–1500662
31#31Metamuse-spark-1.1Meta14761453–1500687
32#32Ogpt-5.6-luna-xhighOpenAI14761452–1500655
33#33Ogpt-5.4-highOpenAI14761457–14951,088
34#34xgrok-4.20-multi-agent-beta-0309xAI14751456–14951,046
35#35Zglm-5.2-maxZ.ai14731451–1494805
36#36Alibabaqwen3.5-max-previewAlibaba14721442–1502382
37#37Googlegemini-3.5-flash-liteGoogle14721448–1495637
38#38Baiduernie-5.1Baidu14721449–1494749
39#39Anthropicclaude-opus-4-8Anthropic14721453–14901,082
40#40Googlegemini-3.8-flash-highGoogle14721443–1500398
41#41Ogpt-5.5-highOpenAI14711452–14901,050
42#42Googlegemini-2.5-proGoogle14701457–14832,638
43#43DeepSeekdeepseek-v4-proDeepSeek14681449–1488999
44#44Anthropicclaude-sonnet-5-highAnthropic14681445–1491719
45#45Alibabaqwen3.7-plusAlibaba14661444–1488760
46#46xgrok-4.1xAI14661448–14841,248
47#47Ogpt-5.5-instantOpenAI14651436–1494427
48#48Zglm-5.3-flashZ.ai14651435–1494395
49#49Xiaomimimo-v2.5-proXiaomi14641445–14821,198
50#50Zglm-5.1Z.ai14641444–1484928

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings