Valumigo

LMArena · Dokumentverständnis

Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.

LMArena-Werte entstehen, indem Menschen zwei Modellantworten vergleichen und für die bessere stimmen (Elo-Verfahren). Liegt der Punkteunterschied innerhalb des Konfidenzintervalls, solltest du die Modelle als etwa gleichwertig ansehen.

So lesen Sie diese Rangliste

Was wird gemessen: Diese LMArena-Rangliste basiert auf Abstimmungen, bei denen Nutzer nach dem Hochladen eines Dokuments, etwa einer PDF-Datei, und einer Frage dazu die Antworten zweier Modelle vergleichen.

So lesen Sie die Werte: Die relativen Werte werden mit dem Bradley–Terry-Verfahren geschätzt. Bei breiten 95%-Konfidenzintervallen sollten Rangunterschiede vorsichtig interpretiert werden.

Zu beachten: Die Veröffentlichungsintervalle können länger sein als bei anderen Ranglisten. Prüfen Sie daher das Veröffentlichungsdatum. Die Ergebnisse können je nach Dokumenttyp und Sprache variieren.

Was diese Rangliste zeigt

  • Die 95%-Konfidenzintervalle von claude-opus-5-high auf Platz 1 und claude-fable-5.1-max auf Platz 2 überlappen sich. Aus dieser Auswertung allein lässt sich die Reihenfolge der beiden Modelle schwer eindeutig bestimmen.
  • Bei 3 weiteren Modellen überlappt das Konfidenzintervall mit dem von Platz 1. Interpretieren Sie kleine Rangunterschiede vorsichtig und unter Berücksichtigung der Stimmenzahl.
  • Unter den besten 10 Modellen ist Anthropic mit 7 Modellen am häufigsten vertreten.
  • Das Modell auf Platz 1 hat 8,794 Stimmen erhalten. Diese Rangliste umfasst 44 Modelle.

Dokumentverständnis LMArena

Veröffentlicht am 2026-09-13 · Abgerufen am 2026-10-04

1440147015001530
Anthropicclaude-opus-5-high
1516
Anthropicclaude-fable-5.1-max
1513
Anthropicclaude-opus-4-6-high
1507
Anthropicclaude-fable-5
1496
Anthropicclaude-opus-4-7
1495
Ogpt-5.5
1486
Ogpt-5.6-sol-xhigh
1483
Anthropicclaude-sonnet-4-6
1482
Anthropicclaude-opus-4-8-high
1475
Ogpt-5.6-terra-xhigh
1472
Ogpt-5.4
1471
Metamuse-spark-1.3-max
1471
Ogpt-6-astra-max
1468
Anthropicclaude-sonnet-5-high
1466
Metamuse-spark-1.1
1465
Googlegemini-3.5-flash-medium
1463
Anthropicclaude-opus-4-5-20251101
1462
Ogpt-5.6-luna-xhigh
1457
Googlegemini-3.6-flash-high
1456
xgrok-4.6-high
1452

Punkte zeigen den Wert, horizontale Linien das 95%-Konfidenzintervall. Überlappende Linien deuten auf ein ähnliches Niveau hin. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen.

Beste Platzierung je Unternehmen

  • AnthropicAnthropicclaude-opus-5-high#1
  • OOpenAIgpt-5.5#8
  • MetaMetamuse-spark-1.3-max#15
  • GoogleGooglegemini-3.5-flash-medium#20
  • xxAIgrok-4.6-high#25
  • Moonshot AIMoonshot AIkimi-k2.6#27
  • AlibabaAlibabaqwen3.7-plus#30
  • MiniMaxMiniMaxminimax-m3#32
  • ZZ.aiglm-5v-turbo#39
Als Tabelle anzeigen (Top 50)
RangModellAnbieterPunkte95%-KonfidenzintervallStimmen
1#1Anthropicclaude-opus-5-highAnthropic15161509–15238,794
2#2Anthropicclaude-fable-5.1-maxAnthropic15131497–15281,403
3#3Anthropicclaude-opus-4-6-highAnthropic15071501–151427,929
4#4Anthropicclaude-opus-4-6Anthropic15071501–151341,260
5#5Anthropicclaude-fable-5Anthropic14961488–15048,497
6#6Anthropicclaude-opus-4-7Anthropic14951489–150122,192
7#7Anthropicclaude-opus-4-7-highAnthropic14951488–150121,957
8#8Ogpt-5.5OpenAI14861479–149221,279
9#9Ogpt-5.5-highOpenAI14841478–149120,944
10#10Ogpt-5.6-sol-xhighOpenAI14831474–14924,818
11#11Anthropicclaude-sonnet-4-6Anthropic14821476–148857,813
12#12Anthropicclaude-opus-4-8-highAnthropic14751468–148211,551
13#13Ogpt-5.6-terra-xhighOpenAI14721463–14805,787
14#14Ogpt-5.4OpenAI14711465–147733,331
15#15Metamuse-spark-1.3-maxMeta14711452–14891,006
16#16Ogpt-6-astra-maxOpenAI14681453–14821,621
17#17Anthropicclaude-sonnet-5-highAnthropic14661458–14747,411
18#18Metamuse-spark-1.1Meta14651456–14744,885
19#19Anthropicclaude-opus-4-8Anthropic14641457–147112,128
20#20Googlegemini-3.5-flash-mediumGoogle14631455–14716,500
21#21Anthropicclaude-opus-4-5-20251101Anthropic14621452–14737,981
22#22Googlegemini-3.5-flash-highGoogle14611452–14714,061
23#23Ogpt-5.6-luna-xhighOpenAI14571449–14655,766
24#24Googlegemini-3.6-flash-highGoogle14561445–14672,975
25#25xgrok-4.6-highxAI14521440–14642,258
26#26xgrok-4.5xAI14521443–14614,965
27#27Moonshot AIkimi-k2.6Moonshot AI14511443–145811,291
28#28Anthropicclaude-sonnet-4-5-20250929Anthropic14501444–145631,455
29#29Metamuse-sparkMeta14441426–14621,084
30#30Alibabaqwen3.7-plusAlibaba14441435–14534,591
31#31Googlegemini-3.1-pro-previewGoogle14441439–144949,457
32#32MiniMaxminimax-m3MiniMax14351427–14436,314
33#33Googlegemini-3-proGoogle14341425–144310,769
34#34Moonshot AIkimi-k2.5-thinkingMoonshot AI14301423–143721,569
35#35Googlegemma-4-31bGoogle14251417–143212,326
36#36Googlegemini-2.5-proGoogle14211415–142725,110
37#37Anthropicclaude-haiku-4-5-20251001Anthropic14201414–142634,677
38#38xgrok-4.20-beta-0309-reasoningxAI14161409–142320,948
39#39Zglm-5v-turboZ.ai14161407–14246,995
40#40Googlegemini-3-flashGoogle14131404–14227,158
41#41Ogpt-5.2-highOpenAI14051395–14147,108
42#42Ogpt-5.1OpenAI14031394–14138,244
43#43Ogpt-5.5-instantOpenAI14031395–14118,497
44#44Ogpt-5.2OpenAI14011395–140728,212

Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings