Valumigo

LMArena · Gesamt

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Diese Rangliste fasst die Abstimmungen auf LMArena zusammen, bei denen Nutzer die Antworten zweier Modelle vergleichen, deren Namen verborgen sind. Wie in der Standardansicht der LMArena-Website verwenden wir die um Tonfall und Antwortlänge bereinigte Rangliste (style control), die den Einfluss der Antwortlänge und von Formatierungen wie Markdown auf die Abstimmungen statistisch korrigiert.

So lesen Sie die Werte: Dieser relative Wert wird aus den Stimmen mit einem Bradley–Terry-Modell geschätzt und auf einer Elo-ähnlichen Skala dargestellt. Das 95%-Konfidenzintervall zeigt die Unsicherheit der Schätzung. Überlappende Intervalle allein belegen keine gleiche Leistungsfähigkeit.

Zu beachten: Da Nutzerpräferenzen bewertet werden, können neben der Genauigkeit auch Ton, Länge und Format die Ergebnisse beeinflussen. Prüfen Sie auch die angewendeten Filter und Korrektureinstellungen.

Was diese Rangliste zeigt

  • Die 95%-Konfidenzintervalle von gemini-4-argon-high auf Platz 1 und claude-opus-4-6-high auf Platz 2 überlappen sich nicht. In dieser Auswertung ist der Vorsprung von Platz 1 vergleichsweise klar belegt.
  • Unter den besten 10 Modellen ist Anthropic mit 7 Modellen am häufigsten vertreten.
  • Das Modell auf Platz 1 hat 4,932 Stimmen erhalten. Diese Rangliste umfasst 413 Modelle.

Gesamt LMArena

Veröffentlicht am 2026-10-02 · Abgerufen am 2026-10-04

14601480150015201540
Googlegemini-4-argon-high
1525
Anthropicclaude-opus-4-6-high
1505
Anthropicclaude-fable-5-high
1504
Anthropicclaude-opus-5.5-high
1504
Anthropicclaude-opus-4-7-high
1501
Anthropicclaude-fable-5.1-max
1501
Googlegemini-3.8-flash-high
1495
Metamuse-spark-1.3-max
1494
Metamuse-spark-1.2 (xHigh)
1494
Metamuse-spark-1.1
1491
Anthropicclaude-opus-5-high
1490
Metamuse-spark
1489
Moonshot AIkimi-k3-max
1488
Googlegemini-3.7-flash-high
1488
Googlegemini-3.1-pro-preview
1487
Googlegemini-3-pro
1485
Ogpt-5.6-sol-xhigh
1484
Ogpt-6.1-sol-max
1483
Googlegemini-3.6-flash-high
1483
Alibabaqwen3.8-max
1482

Punkte zeigen den Wert, horizontale Linien das 95%-Konfidenzintervall. Überlappende Linien deuten auf ein ähnliches Niveau hin. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen. Die Ranglisten für Dialog und Bildverständnis verwenden die um Tonfall und Antwortlänge bereinigte Auswertung (style control), die auch auf der LMArena-Website standardmäßig angezeigt wird.

Beste Platzierung je Unternehmen

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-opus-4-6-high#2
  • MetaMetamuse-spark-1.3-max#9
  • Moonshot AIMoonshot AIkimi-k3-max#16
  • OOpenAIgpt-5.6-sol-xhigh#20
  • AlibabaAlibabaqwen3.8-max#23
  • XiaomiXiaomimimo-v2.6-pro#26
  • ZZ.aiglm-5.3-max#27
  • xxAIgrok-4.20-beta1#36
Als Tabelle anzeigen (Top 50)
RangModellAnbieterPunkte95%-KonfidenzintervallStimmen
1#1Googlegemini-4-argon-highGoogle15251516–15344,932
2#2Anthropicclaude-opus-4-6-highAnthropic15051501–150877,636
3#3Anthropicclaude-fable-5-highAnthropic15041500–150938,387
4#4Anthropicclaude-opus-5.5-highAnthropic15041495–15134,552
5#5Anthropicclaude-opus-4-7-highAnthropic15011498–150564,946
6#6Anthropicclaude-fable-5.1-maxAnthropic15011495–150811,800
7#7Anthropicclaude-opus-4-6Anthropic14971494–150182,189
8#8Googlegemini-3.8-flash-highGoogle14951490–150026,298
9#9Metamuse-spark-1.3-maxMeta14941488–150012,343
10#10Anthropicclaude-opus-4-7Anthropic14941490–149866,058
11#11Metamuse-spark-1.2 (xHigh)Meta14941484–15034,356
12#12Metamuse-spark-1.1Meta14911487–149637,238
13#13Anthropicclaude-opus-5-highAnthropic14901486–149459,482
14#14Anthropicclaude-opus-5-maxAnthropic14891485–149428,937
15#15Metamuse-sparkMeta14891484–149514,120
16#16Moonshot AIkimi-k3-maxMoonshot AI14881484–149328,280
17#17Googlegemini-3.7-flash-highGoogle14881483–149321,539
18#18Googlegemini-3.1-pro-previewGoogle14871484–1490121,806
19#19Googlegemini-3-proGoogle14851482–148941,910
20#20Ogpt-5.6-sol-xhighOpenAI14841479–148836,656
21#21Ogpt-6.1-sol-maxOpenAI14831473–14943,071
22#22Googlegemini-3.6-flash-highGoogle14831479–148736,070
23#23Alibabaqwen3.8-maxAlibaba14821476–148723,353
24#24Anthropicclaude-opus-4-8-highAnthropic14821478–148563,974
25#25Ogpt-5.5-highOpenAI14811478–148569,202
26#26Xiaomimimo-v2.6-proXiaomi14801471–14894,056
27#27Zglm-5.3-maxZ.ai14781473–148417,857
28#28Googlegemini-3.5-flash-highGoogle14771473–148148,420
29#29Ogpt-6-astra-maxOpenAI14771470–14849,156
30#30Ogpt-5.5OpenAI14771473–148070,781
31#31Googlegemini-3.5-flash-mediumGoogle14761472–148047,187
32#32Zglm-5.2-maxZ.ai14761471–148045,399
33#33Ogpt-5.2-chat-latest-20260210OpenAI14761472–148035,937
34#34Ogpt-5.4-highOpenAI14751471–147964,642
35#35Alibabaqwen3.7-max-previewAlibaba14751465–14853,920
36#36xgrok-4.20-beta1xAI14751470–147927,827
37#37Anthropicclaude-opus-4-8Anthropic14751471–147865,072
38#38DeepSeekdeepseek-v4.1-flash-maxDeepSeek14741468–14818,728
39#39Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14741470–147737,448
40#40Ogpt-5.5-instantOpenAI14731468–147827,098
41#41Zglm-5.3-flashZ.ai14731468–147822,971
42#42Googlegemini-3-flashGoogle14731468–147731,259
43#43Anthropicclaude-sonnet-4-6Anthropic14721469–147670,747
44#44xgrok-4.20-beta-0309-reasoningxAI14721468–147566,334
45#45Anthropicclaude-sonnet-5.5-xhighAnthropic14711461–14813,145
46#46xgrok-4.20-multi-agent-beta-0309xAI14711467–147464,788
47#47Anthropicclaude-opus-4-5-20251101Anthropic14701467–147372,772
48#48Baiduernie-5.1Baidu14681463–147239,396
49#49Xiaomimimo-v2.5-proXiaomi14681464–147170,871
50#50xgrok-4.5xAI14661461–147039,789

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings