Valumigo

LMArena · Englisch

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Diese Rangliste wird aus den Abstimmungen zu Fragen berechnet, die in den Textdialogen von LMArena als Englisch klassifiziert wurden.

So lesen Sie die Werte: Die Rangliste zeigt, welche Modelle Abstimmende bei Fragen auf Englisch bevorzugten. Die Sprache der Frage gibt keinen Aufschluss über die Muttersprache oder Identität der Abstimmenden.

Zu beachten: Die Anzahl der Stimmen und die Breite der Konfidenzintervalle unterscheiden sich je nach Sprache und Modell. Prüfen Sie bei neuen Modellen auch die Stimmenzahl, das Aktualisierungsdatum und die Auswertungsbedingungen.

Was diese Rangliste zeigt

  • Die 95%-Konfidenzintervalle von gemini-4-argon-high auf Platz 1 und claude-opus-4-6-high auf Platz 2 überlappen sich. Aus dieser Auswertung allein lässt sich die Reihenfolge der beiden Modelle schwer eindeutig bestimmen.
  • Bei 3 weiteren Modellen überlappt das Konfidenzintervall mit dem von Platz 1. Interpretieren Sie kleine Rangunterschiede vorsichtig und unter Berücksichtigung der Stimmenzahl.
  • Unter den besten 10 Modellen ist Anthropic mit 6 Modellen am häufigsten vertreten.
  • Das Modell auf Platz 1 hat 1,928 Stimmen erhalten. Diese Rangliste umfasst 413 Modelle.

Englisch LMArena

Veröffentlicht am 2026-10-02 · Abgerufen am 2026-10-04

146014801500152015401560
Googlegemini-4-argon-high
1533
Anthropicclaude-opus-4-6-high
1514
Anthropicclaude-fable-5-high
1513
Anthropicclaude-opus-4-7-high
1510
Anthropicclaude-opus-5.5-high
1506
Metamuse-spark-1.3-max
1499
Metamuse-spark-1.2 (xHigh)
1498
Googlegemini-3.8-flash-high
1498
Anthropicclaude-fable-5.1-max
1498
Metamuse-spark
1497
Ogpt-6.1-sol-max
1496
Xiaomimimo-v2.6-pro
1496
Moonshot AIkimi-k3-max
1495
Anthropicclaude-opus-5-high
1493
Anthropicclaude-sonnet-5.5-xhigh
1492
Alibabaqwen3.8-max
1492
Metamuse-spark-1.1
1491
Googlegemini-3.1-pro-preview
1490
Anthropicclaude-opus-4-8-high
1490
Zglm-5.3-max
1490

Punkte zeigen den Wert, horizontale Linien das 95%-Konfidenzintervall. Überlappende Linien deuten auf ein ähnliches Niveau hin. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen. Die Ranglisten für Dialog und Bildverständnis verwenden die um Tonfall und Antwortlänge bereinigte Auswertung (style control), die auch auf der LMArena-Website standardmäßig angezeigt wird.

Beste Platzierung je Unternehmen

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-opus-4-6-high#2
  • MetaMetamuse-spark-1.3-max#8
  • OOpenAIgpt-6.1-sol-max#13
  • XiaomiXiaomimimo-v2.6-pro#14
  • Moonshot AIMoonshot AIkimi-k3-max#15
  • AlibabaAlibabaqwen3.8-max#18
  • ZZ.aiglm-5.3-max#23
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#24
Als Tabelle anzeigen (Top 50)
RangModellAnbieterPunkte95%-KonfidenzintervallStimmen
1#1Googlegemini-4-argon-highGoogle15331519–15471,928
2#2Anthropicclaude-opus-4-6-highAnthropic15141509–151934,324
3#3Anthropicclaude-fable-5-highAnthropic15131508–151916,474
4#4Anthropicclaude-opus-4-7-highAnthropic15101505–151530,082
5#5Anthropicclaude-opus-4-6Anthropic15071502–151136,805
6#6Anthropicclaude-opus-5.5-highAnthropic15061492–15201,719
7#7Anthropicclaude-opus-4-7Anthropic15011496–150630,422
8#8Metamuse-spark-1.3-maxMeta14991491–15084,928
9#9Metamuse-spark-1.2 (xHigh)Meta14981484–15121,805
10#10Googlegemini-3.8-flash-highGoogle14981491–150510,363
11#11Anthropicclaude-fable-5.1-maxAnthropic14981489–15064,793
12#12Metamuse-sparkMeta14971489–15046,673
13#13Ogpt-6.1-sol-maxOpenAI14961479–15131,149
14#14Xiaomimimo-v2.6-proXiaomi14961481–15111,487
15#15Moonshot AIkimi-k3-maxMoonshot AI14951489–150210,786
16#16Anthropicclaude-opus-5-highAnthropic14931488–149824,266
17#17Anthropicclaude-sonnet-5.5-xhighAnthropic14921475–15091,196
18#18Alibabaqwen3.8-maxAlibaba14921485–14999,003
19#19Metamuse-spark-1.1Meta14911486–149715,100
20#20Anthropicclaude-opus-5-maxAnthropic14911484–149711,702
21#21Googlegemini-3.1-pro-previewGoogle14901486–149453,727
22#22Anthropicclaude-opus-4-8-highAnthropic14901485–149527,922
23#23Zglm-5.3-maxZ.ai14901482–14977,223
24#24DeepSeekdeepseek-v4.1-flash-maxDeepSeek14891479–15003,237
25#25Ogpt-5.6-sol-xhighOpenAI14891483–149514,827
26#26Ogpt-6-astra-maxOpenAI14881478–14983,692
27#27Googlegemini-3-proGoogle14871482–149316,887
28#28Googlegemini-3.6-flash-highGoogle14871481–149315,114
29#29Googlegemini-3.7-flash-highGoogle14851478–14938,659
30#30Ogpt-5.5-highOpenAI14841480–148931,442
31#31Ogpt-5.5OpenAI14831478–148832,123
32#32Anthropicclaude-sonnet-4-6Anthropic14821478–148731,850
33#33Zglm-5.2-maxZ.ai14821477–148818,859
34#34Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14821477–148814,837
35#35Anthropicclaude-opus-4-8Anthropic14821477–148728,640
36#36Ogpt-5.2-chat-latest-20260210OpenAI14811476–148715,854
37#37Zglm-5.1Z.ai14811477–148625,210
38#38xgrok-4.20-beta1xAI14811475–148712,733
39#39Xiaomimimo-v2.5-proXiaomi14801475–148429,857
40#40Anthropicclaude-opus-4-5-20251101Anthropic14791474–148331,143
41#41Googlegemini-3.5-flash-highGoogle14791473–148420,509
42#42DeepSeekdeepseek-v4-pro-high-20260813DeepSeek14791469–14883,755
43#43Baiduernie-5.1Baidu14781473–148417,926
44#44Zglm-5.3-flashZ.ai14781471–14858,546
45#45Googlegemini-3.5-flash-mediumGoogle14781472–148319,998
46#46xgrok-4.20-beta-0309-reasoningxAI14781473–148330,381
47#47Ogpt-5.4-highOpenAI14761471–148129,222
48#48Googlegemini-3-flashGoogle14761470–148212,474
49#49xgrok-4.5xAI14741468–148016,121
50#50xgrok-4.20-multi-agent-beta-0309xAI14741469–147829,508

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings