Valumigo

LMArena · Mathematik

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Diese Rangliste basiert auf Abstimmungen zu Fragen, die in den Textdialogen von LMArena als mathematisch klassifiziert wurden.

So lesen Sie die Werte: Der relative Wert zeigt, welche Modelle Nutzer bei mathematischen Antworten bevorzugten. Bei Modellen mit wenigen Stimmen können die Konfidenzintervalle breit sein.

Zu beachten: Dies ist eine Präferenzbewertung, kein Test mit direkter Bewertung der Antwortkorrektheit. Prüfen Sie für mathematische Genauigkeit auch Tests mit objektiver Bewertung wie FrontierMath.

Was diese Rangliste zeigt

  • Die 95%-Konfidenzintervalle von gemini-4-argon-high auf Platz 1 und claude-fable-5-high auf Platz 2 überlappen sich. Aus dieser Auswertung allein lässt sich die Reihenfolge der beiden Modelle schwer eindeutig bestimmen.
  • Bei 37 weiteren Modellen überlappt das Konfidenzintervall mit dem von Platz 1. Interpretieren Sie kleine Rangunterschiede vorsichtig und unter Berücksichtigung der Stimmenzahl.
  • Unter den besten 10 Modellen ist Anthropic mit 7 Modellen am häufigsten vertreten.
  • Das Modell auf Platz 1 hat 255 Stimmen erhalten. Diese Rangliste umfasst 396 Modelle.

Mathematik LMArena

Veröffentlicht am 2026-10-02 · Abgerufen am 2026-10-04

14701500153015601590
Googlegemini-4-argon-high
1530
Anthropicclaude-fable-5-high
1522
Anthropicclaude-opus-5-high
1521
Anthropicclaude-fable-5.1-max
1518
Googlegemini-3.8-flash-high
1517
Anthropicclaude-opus-4-6-high
1517
Anthropicclaude-opus-5.5-high
1510
Metamuse-spark-1.3-max
1509
Anthropicclaude-opus-4-7-high
1504
Googlegemini-3.7-flash-high
1503
Zglm-5.3-flash
1503
DeepSeekdeepseek-v4.1-flash-max
1503
Googlegemini-3.6-flash-high
1501
Moonshot AIkimi-k3-max
1500
Ogpt-5.5
1500
Alibabaqwen3.8-max
1498
Googlegemini-3.5-flash-high
1497
Zglm-5.3-max
1494
Anthropicclaude-opus-4-8-high
1494
Ogpt-5.6-sol-xhigh
1494

Punkte zeigen den Wert, horizontale Linien das 95%-Konfidenzintervall. Überlappende Linien deuten auf ein ähnliches Niveau hin. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen. Die Ranglisten für Dialog und Bildverständnis verwenden die um Tonfall und Antwortlänge bereinigte Auswertung (style control), die auch auf der LMArena-Website standardmäßig angezeigt wird.

Beste Platzierung je Unternehmen

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-fable-5-high#2
  • MetaMetamuse-spark-1.3-max#9
  • ZZ.aiglm-5.3-flash#13
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#14
  • Moonshot AIMoonshot AIkimi-k3-max#16
  • OOpenAIgpt-5.5#17
  • AlibabaAlibabaqwen3.8-max#18
  • XiaomiXiaomimimo-v2.6-pro#30
Als Tabelle anzeigen (Top 50)
RangModellAnbieterPunkte95%-KonfidenzintervallStimmen
1#1Googlegemini-4-argon-highGoogle15301494–1566255
2#2Anthropicclaude-fable-5-highAnthropic15221509–15361,889
3#3Anthropicclaude-opus-5-highAnthropic15211509–15332,756
4#4Anthropicclaude-fable-5.1-maxAnthropic15181493–1543544
5#5Googlegemini-3.8-flash-highGoogle15171501–15341,274
6#6Anthropicclaude-opus-4-6-highAnthropic15171507–15273,978
7#7Anthropicclaude-opus-5-maxAnthropic15161499–15321,337
8#8Anthropicclaude-opus-5.5-highAnthropic15101475–1546235
9#9Metamuse-spark-1.3-maxMeta15091485–1533586
10#10Anthropicclaude-opus-4-6Anthropic15071497–15164,454
11#11Anthropicclaude-opus-4-7-highAnthropic15041493–15153,260
12#12Googlegemini-3.7-flash-highGoogle15031485–15211,097
13#13Zglm-5.3-flashZ.ai15031485–15211,131
14#14DeepSeekdeepseek-v4.1-flash-maxDeepSeek15031476–1530433
15#15Googlegemini-3.6-flash-highGoogle15011487–15161,736
16#16Moonshot AIkimi-k3-maxMoonshot AI15001483–15171,218
17#17Ogpt-5.5OpenAI15001489–15103,499
18#18Alibabaqwen3.8-maxAlibaba14981480–15151,151
19#19Googlegemini-3.5-flash-highGoogle14971485–15102,361
20#20Zglm-5.3-maxZ.ai14941473–1515739
21#21Anthropicclaude-opus-4-8-highAnthropic14941483–15052,941
22#22Ogpt-5.6-sol-xhighOpenAI14941480–15081,732
23#23Ogpt-5.5-highOpenAI14931483–15033,472
24#24Metamuse-spark-1.1Meta14921478–15071,661
25#25Ogpt-5.4-highOpenAI14921481–15023,379
26#26Anthropicclaude-opus-4-7Anthropic14921481–15023,371
27#27Ogpt-6-astra-maxOpenAI14901463–1517458
28#28Zglm-5.2-maxZ.ai14881475–15012,035
29#29Googlegemini-3.1-pro-previewGoogle14881480–14966,301
30#30Xiaomimimo-v2.6-proXiaomi14871447–1527213
31#31Alibabaqwen3.7-max-previewAlibaba14841446–1523231
32#32Googlegemini-3.5-flash-mediumGoogle14821469–14952,196
33#33Xiaomimimo-v2.5-proXiaomi14811470–14913,356
34#34Thy3Tencent14801455–1505550
35#35Moonshot AIkimi-k2.6Moonshot AI14801467–14932,075
36#36Ogpt-5.6-terra-xhighOpenAI14781464–14931,664
37#37TinklingThinky14781463–14931,581
38#38Baiduernie-5.1Baidu14771464–14911,980
39#39Ogpt-5.6-luna-xhighOpenAI14771463–14911,780
40#40Anthropicclaude-opus-4-8Anthropic14771466–14883,072
41#41Googlegemini-3-proGoogle14771465–14882,761
42#42Alibabaqwen3.6-max-previewAlibaba14761447–1505380
43#43Zglm-5.1Z.ai14751464–14872,860
44#44Googlegemini-3-flashGoogle14741461–14872,060
45#45Anthropicclaude-sonnet-5-highAnthropic14741460–14872,061
46#46xgrok-4.5xAI14731459–14871,752
47#47Xiaomimimo-v2.6-flashXiaomi14721441–1503330
48#48Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14721460–14842,334
49#49Moonshot AIkimi-k2.5-thinkingMoonshot AI14711462–14814,158
50#50Googlegemma-4-31bGoogle14691443–1496432

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings