LMArena · KI-Suche
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: Diese Rangliste basiert auf Abstimmungen zum Vergleich von Antworten KI-gestützter Systeme mit Websuche. Sie umfasst vielfältige Suchanfragen, darunter Fragen zu aktuellen Informationen.
So lesen Sie die Werte: Der relative Wert zeigt, welche Suchantworten Nutzer bevorzugten. Unterscheiden Sie zwischen dem grundlegenden Präferenzwert und der um Factuality korrigierten Kennzahl, die zusätzlich die sachliche Genauigkeit berücksichtigt.
Zu beachten: Prüfen Sie das Aktualisierungsdatum sowie die Suchwerkzeuge und Ausführungsbedingungen. Interpretieren Sie diesen Wert nicht als Genauigkeit aller Suchantworten eines realen Dienstes.
Was diese Rangliste zeigt
- Die 95%-Konfidenzintervalle von gpt-5.6-sol-xhigh auf Platz 1 und claude-opus-4-6-search auf Platz 2 überlappen sich. Aus dieser Auswertung allein lässt sich die Reihenfolge der beiden Modelle schwer eindeutig bestimmen.
- Unter den besten 10 Modellen ist Anthropic mit 4 Modellen am häufigsten vertreten.
- Das Modell auf Platz 1 hat 29,663 Stimmen erhalten. Diese Rangliste umfasst 34 Modelle.
KI-Suche LMArena
Veröffentlicht am 2026-08-24 · Abgerufen am 2026-10-04
Punkte zeigen den Wert, horizontale Linien das 95%-Konfidenzintervall. Überlappende Linien deuten auf ein ähnliches Niveau hin. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen.
Beste Platzierung je Unternehmen
- OOpenAIgpt-5.6-sol-xhigh#1
- Anthropicclaude-opus-4-6-search#2
- Baiduernie-5.1#6
- xxAIgrok-4.5#8
- Googlegemini-3.1-pro-grounding#9
- Perplexityppl-sonar-reasoning-pro-high#29
- DDiffbotdiffbot-small-xl#33
Als Tabelle anzeigen (Top 50)
| Rang | Modell | Anbieter | Punkte | 95%-Konfidenzintervall | Stimmen |
|---|---|---|---|---|---|
| 1 | #1Ogpt-5.6-sol-xhigh | OpenAI | 1257 | 1250–1265 | 29,663 |
| 2 | #2claude-opus-4-6-search | Anthropic | 1253 | 1248–1258 | 134,699 |
| 3 | #3Ogpt-5.5-search | OpenAI | 1242 | 1237–1247 | 89,873 |
| 4 | #4claude-opus-4-7 | Anthropic | 1233 | 1228–1239 | 91,394 |
| 5 | #5claude-fable-5 | Anthropic | 1230 | 1222–1238 | 41,795 |
| 6 | #6ernie-5.1 | Baidu | 1227 | 1217–1237 | 3,788 |
| 7 | #7claude-sonnet-4-6-search | Anthropic | 1221 | 1216–1226 | 134,905 |
| 8 | #8xgrok-4.5 | xAI | 1213 | 1206–1220 | 31,505 |
| 9 | #9gemini-3.1-pro-grounding | 1210 | 1205–1216 | 113,282 | |
| 10 | #10gemini-3-pro-grounding | 1207 | 1202–1213 | 37,024 | |
| 11 | #11Ogpt-5.2-search | OpenAI | 1207 | 1201–1213 | 52,712 |
| 12 | #12claude-opus-4-8 | Anthropic | 1204 | 1198–1211 | 70,998 |
| 13 | #13xgrok-4.20-multi-agent-beta-0309 | xAI | 1204 | 1199–1209 | 109,553 |
| 14 | #14Ogpt-5.1-search | OpenAI | 1199 | 1194–1205 | 59,909 |
| 15 | #15gemini-3-flash-grounding | 1198 | 1193–1203 | 149,334 | |
| 16 | #16Ogpt-5.4-search | OpenAI | 1197 | 1192–1203 | 110,116 |
| 17 | #17claude-sonnet-5-search | Anthropic | 1194 | 1187–1201 | 40,230 |
| 18 | #18xgrok-4.20-beta1 | xAI | 1189 | 1183–1195 | 53,921 |
| 19 | #19claude-opus-4-5-search | Anthropic | 1180 | 1174–1185 | 61,573 |
| 20 | #20Ogpt-5.2-search-non-reasoning | OpenAI | 1172 | 1167–1178 | 75,658 |
| 21 | #21xgrok-4-1-fast-search | xAI | 1171 | 1166–1176 | 81,507 |
| 22 | #22xgrok-4-fast-search | xAI | 1171 | 1166–1175 | 41,794 |
| 23 | #23xgrok-4.3 | xAI | 1165 | 1160–1170 | 91,483 |
| 24 | #24claude-sonnet-4-5-search | Anthropic | 1158 | 1153–1163 | 127,378 |
| 25 | #25claude-opus-4-1-search | Anthropic | 1148 | 1143–1153 | 76,933 |
| 26 | #26Oo3-search | OpenAI | 1144 | 1139–1150 | 20,644 |
| 27 | #27gemini-2.5-pro-grounding | 1142 | 1137–1146 | 83,404 | |
| 28 | #28xgrok-4-search | xAI | 1142 | 1136–1147 | 19,108 |
| 29 | #29ppl-sonar-reasoning-pro-high | Perplexity | 1139 | 1133–1144 | 29,055 |
| 30 | #30Ogpt-5-search | OpenAI | 1133 | 1127–1139 | 20,781 |
| 31 | #31ppl-sonar-pro-high | Perplexity | 1130 | 1124–1136 | 28,519 |
| 32 | #32claude-opus-4-search | Anthropic | 1126 | 1121–1132 | 31,037 |
| 33 | #33Ddiffbot-small-xl | Diffbot | 1023 | 1014–1031 | 6,388 |
| 34 | #34Oapi-gpt-4o-search | OpenAI | 1006 | 995–1017 | 3,411 |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings