LMArena · Programmieren
Wir rufen regelmäßig öffentliche Benchmark-Daten ab und zeigen sie an: Ranglisten aus LMArena-Nutzerabstimmungen, Epoch AI-Testergebnisse und OpenRouter-Nutzungsranglisten. Für jede Rangliste zeigen wir das Veröffentlichungsdatum und das Abrufdatum. Die Bewertungen stammen nicht von dieser Website.
So lesen Sie diese Rangliste
Was wird gemessen: Diese Rangliste wird aus Abstimmungen zu Fragen berechnet, die in den Textdialogen von LMArena als programmierbezogen klassifiziert wurden.
So lesen Sie die Werte: Der relative Wert zeigt, welche Modelle Nutzer bei Antworten zu Programmierfragen bevorzugten. Interpretieren Sie kleine Punktunterschiede unter Berücksichtigung der Konfidenzintervalle und der Stimmenzahl.
Zu beachten: Hier werden Präferenzen bei Programmierdialogen bewertet. Unterscheiden Sie dies von Agentenevaluationen, bei denen Repositories tatsächlich geändert und getestet werden. Prüfen Sie auch SWE-bench, Terminal-Bench und veröffentlichte Messergebnisse.
Was diese Rangliste zeigt
- Die 95%-Konfidenzintervalle von gemini-4-argon-high auf Platz 1 und claude-fable-5-high auf Platz 2 überlappen sich. Aus dieser Auswertung allein lässt sich die Reihenfolge der beiden Modelle schwer eindeutig bestimmen.
- Bei 14 weiteren Modellen überlappt das Konfidenzintervall mit dem von Platz 1. Interpretieren Sie kleine Rangunterschiede vorsichtig und unter Berücksichtigung der Stimmenzahl.
- Unter den besten 10 Modellen ist Anthropic mit 5 Modellen am häufigsten vertreten.
- Das Modell auf Platz 1 hat 1,230 Stimmen erhalten. Diese Rangliste umfasst 408 Modelle.
Programmieren LMArena
Veröffentlicht am 2026-10-02 · Abgerufen am 2026-10-04
Punkte zeigen den Wert, horizontale Linien das 95%-Konfidenzintervall. Überlappende Linien deuten auf ein ähnliches Niveau hin. Das Diagramm zeigt pro Modell nur die am höchsten platzierte Schlussfolgerungseinstellung (high, max usw.). Die Tabelle enthält die Platzierungen aller Einstellungen. Die Ranglisten für Dialog und Bildverständnis verwenden die um Tonfall und Antwortlänge bereinigte Auswertung (style control), die auch auf der LMArena-Website standardmäßig angezeigt wird.
Beste Platzierung je Unternehmen
- Googlegemini-4-argon-high#1
- Anthropicclaude-fable-5-high#2
- OOpenAIgpt-6-astra-max#7
- Moonshot AIkimi-k3-max#9
- Xiaomimimo-v2.6-pro#10
- Metamuse-spark-1.3-max#11
- DeepSeekdeepseek-v4.1-flash-max#26
- Alibabaqwen3.7-max-preview#27
- ZZ.aiglm-5.3-flash#29
Als Tabelle anzeigen (Top 50)
| Rang | Modell | Anbieter | Punkte | 95%-Konfidenzintervall | Stimmen |
|---|---|---|---|---|---|
| 1 | #1gemini-4-argon-high | 1560 | 1543–1577 | 1,230 | |
| 2 | #2claude-fable-5-high | Anthropic | 1552 | 1545–1559 | 10,038 |
| 3 | #3claude-opus-4-6-high | Anthropic | 1551 | 1546–1557 | 20,235 |
| 4 | #4claude-opus-4-7-high | Anthropic | 1551 | 1545–1556 | 18,521 |
| 5 | #5claude-opus-4-6 | Anthropic | 1548 | 1542–1553 | 22,901 |
| 6 | #6claude-opus-4-7 | Anthropic | 1546 | 1541–1552 | 18,728 |
| 7 | #7Ogpt-6-astra-max | OpenAI | 1543 | 1530–1556 | 2,135 |
| 8 | #8Ogpt-6.1-sol-max | OpenAI | 1542 | 1518–1566 | 609 |
| 9 | #9kimi-k3-max | Moonshot AI | 1541 | 1533–1549 | 7,285 |
| 10 | #10mimo-v2.6-pro | Xiaomi | 1540 | 1522–1558 | 1,103 |
| 11 | #11muse-spark-1.3-max | Meta | 1539 | 1528–1549 | 3,307 |
| 12 | #12claude-opus-5.5-high | Anthropic | 1538 | 1521–1556 | 1,060 |
| 13 | #13claude-sonnet-5.5-xhigh | Anthropic | 1536 | 1515–1558 | 779 |
| 14 | #14Ogpt-5.6-sol-xhigh | OpenAI | 1534 | 1527–1541 | 9,943 |
| 15 | #15claude-opus-5-high | Anthropic | 1533 | 1527–1540 | 15,559 |
| 16 | #16claude-opus-4-8-high | Anthropic | 1533 | 1527–1539 | 17,395 |
| 17 | #17muse-spark-1.1 | Meta | 1533 | 1526–1539 | 10,537 |
| 18 | #18muse-spark-1.2 (xHigh) | Meta | 1531 | 1514–1549 | 1,222 |
| 19 | #19claude-fable-5.1-max | Anthropic | 1531 | 1519–1544 | 2,358 |
| 20 | #20claude-opus-4-5-20251101-high-32k | Anthropic | 1530 | 1523–1538 | 7,793 |
| 21 | #21claude-opus-5-max | Anthropic | 1530 | 1522–1538 | 7,382 |
| 22 | #22gemini-3.8-flash-high | 1530 | 1522–1538 | 7,067 | |
| 23 | #23claude-opus-4-8 | Anthropic | 1530 | 1524–1535 | 18,024 |
| 24 | #24muse-spark | Meta | 1530 | 1520–1540 | 3,930 |
| 25 | #25claude-sonnet-4-6 | Anthropic | 1529 | 1523–1534 | 19,686 |
| 26 | #26deepseek-v4.1-flash-max | DeepSeek | 1528 | 1516–1540 | 2,469 |
| 27 | #27qwen3.7-max-preview | Alibaba | 1524 | 1506–1542 | 1,165 |
| 28 | #28qwen3.8-max | Alibaba | 1524 | 1516–1532 | 6,611 |
| 29 | #29Zglm-5.3-flash | Z.ai | 1523 | 1515–1532 | 6,157 |
| 30 | #30claude-opus-4-5-20251101 | Anthropic | 1523 | 1518–1528 | 17,962 |
| 31 | #31gemini-3.1-pro-preview | 1522 | 1517–1526 | 33,581 | |
| 32 | #32mimo-v2.5-pro | Xiaomi | 1522 | 1516–1527 | 19,324 |
| 33 | #33mimo-v2.6-flash | Xiaomi | 1521 | 1506–1537 | 1,508 |
| 34 | #34Zglm-5.3-max | Z.ai | 1521 | 1511–1530 | 4,424 |
| 35 | #35Ogpt-5.4-high | OpenAI | 1521 | 1515–1527 | 17,566 |
| 36 | #36Ogpt-6-sol-max | OpenAI | 1520 | 1507–1534 | 2,071 |
| 37 | #37claude-sonnet-4-5-20250929-high-32k | Anthropic | 1519 | 1514–1524 | 19,905 |
| 38 | #38gemini-3.6-flash-high | 1519 | 1512–1526 | 10,350 | |
| 39 | #39claude-sonnet-5-high | Anthropic | 1519 | 1512–1525 | 12,377 |
| 40 | #40Ogpt-5.5-high | OpenAI | 1519 | 1513–1524 | 19,110 |
| 41 | #41gemini-3.7-flash-high | 1518 | 1510–1526 | 6,041 | |
| 42 | #42gemini-3-pro | 1518 | 1511–1525 | 8,787 | |
| 43 | #43kimi-k2.6 | Moonshot AI | 1516 | 1509–1523 | 11,062 |
| 44 | #44Ogpt-5.6-terra-xhigh | OpenAI | 1515 | 1508–1522 | 10,166 |
| 45 | #45Ogpt-5.2-chat-latest-20260210 | OpenAI | 1515 | 1508–1522 | 9,629 |
| 46 | #46xgrok-4.5 | xAI | 1514 | 1507–1521 | 11,055 |
| 47 | #47dola-seed-2.0-pro | ByteDance | 1514 | 1509–1519 | 21,996 |
| 48 | #48qwen3.5-max-preview | Alibaba | 1514 | 1506–1522 | 6,358 |
| 49 | #49Ogpt-5.5-instant | OpenAI | 1513 | 1506–1521 | 7,909 |
| 50 | #50Zglm-5.1 | Z.ai | 1513 | 1507–1518 | 16,060 |
Daten: LMArena leaderboard dataset (CC BY 4.0). Änderungen: Nur die Top 50 jeder Rangliste, gerundete Werte. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetFirmenlogos sind Marken der jeweiligen Unternehmen und dienen nur zur Unterscheidung (Icons: Simple Icons).Daten: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings