AI benchmark rankings
We regularly fetch and display public benchmark data: LMArena user-voted rankings and Epoch AI test scores. Each leaderboard shows its publication and retrieval dates. These scores are not produced by this site.
Latest models at a glance
Models released in the past 120 days, sorted by release date, with scores from both public sources in one row. Test scores show accuracy (%).
| Model | Release date | Overall index | GPQA Diamond | FrontierMath | HLE | ARC-AGI-2 | SWE-bench Verified | LMArena overall rank | LMArena English rank |
|---|---|---|---|---|---|---|---|---|---|
| OGPT-6.1 SolOpenAI | 2026-09-29 | – | 95.4 | 93.7 | – | – | – | #60 | #57 |
| Claude Sonnet 5.5Anthropic | 2026-09-28 | 165.2 | 95.6 | 88.8 | – | – | – | #34 | #16 |
| Claude Opus 5.5Anthropic | 2026-09-22 | 167.4 | – | 91.2 | – | 92.5 | – | #2 | #2 |
| OGPT-6 SolOpenAI | 2026-09-22 | – | 94.3 | 89.8 | – | 89.6 | – | #158 | #162 |
| OGPT-6 LunaOpenAI | 2026-09-22 | – | – | 78.9 | – | 59.3 | – | #163 | #171 |
| DeepSeek V4.1 FlashDeepSeek | 2026-09-09 | 155 | – | – | – | – | – | #37 | #30 |
| OGPT-6 AstraOpenAI | 2026-09-03 | 166.5 | 95.8 | 93.7 | 54.8 | 95 | – | #71 | #76 |
| Gemini 3.8 FlashGoogle | 2026-09-02 | 156.9 | 95.4 | 68.4 | 44.5 | – | – | #8 | #10 |
| Muse Spark 1.3Meta | 2026-09-02 | 156.9 | – | 74.4 | – | – | – | #12 | #12 |
| Claude Fable 5.1Anthropic | 2026-09-01 | 164.8 | – | 90.2 | 46.5 | 90 | – | #3 | #7 |
| Qwen3.8 Max (0902)Alibaba | 2026-09-01 | 155.2 | 92.3 | 65.6 | – | – | – | Not yet available | Not yet available |
| ZGLM-5.3-FlashZ.ai | 2026-08-20 | 151.9 | – | – | – | – | – | #30 | #34 |
| ZGLM-5.3Z.ai | 2026-08-14 | 155.8 | 90.9 | 68.8 | – | – | – | #26 | #19 |
| Qwen 3.8 27BAlibaba | 2026-08-14 | 149.4 | – | – | – | – | – | #74 | #81 |
| Gemini 3.7 FlashGoogle | 2026-08-13 | 157.4 | 94.8 | 71.6 | – | 84.6 | – | #13 | #17 |
| DeepSeek V4 Pro 0813DeepSeek | 2026-08-13 | 155.4 | 91.7 | – | – | 61.3 | – | Not yet available | Not yet available |
New models need enough votes to appear on leaderboards, especially language-specific rankings. They may show as 'Not yet available' shortly after release.
English LMArena
Published 2026-10-02 · Retrieved 2026-10-04
Dots show scores; horizontal lines show 95% confidence intervals. Overlapping intervals suggest similar performance.
View table (top 50)
| Rank | Model | Developer | Score | 95% confidence interval | Votes |
|---|---|---|---|---|---|
| 1 | gemini-4-argon-high | 1539 | 1525–1553 | 1,928 | |
| 2 | claude-opus-5.5-high | Anthropic | 1513 | 1498–1527 | 1,719 |
| 3 | claude-opus-4-6-high | Anthropic | 1512 | 1508–1517 | 34,324 |
| 4 | claude-opus-4-6 | Anthropic | 1506 | 1502–1511 | 36,805 |
| 5 | claude-opus-5-max | Anthropic | 1505 | 1498–1511 | 11,702 |
| 6 | mimo-v2.6-pro | Xiaomi | 1504 | 1489–1519 | 1,487 |
| 7 | claude-fable-5.1-max | Anthropic | 1504 | 1495–1512 | 4,793 |
| 8 | claude-opus-5-high | Anthropic | 1502 | 1496–1507 | 24,266 |
| 9 | claude-fable-5-high | Anthropic | 1500 | 1494–1505 | 16,474 |
| 10 | gemini-3.8-flash-high | 1498 | 1491–1505 | 10,363 | |
| 11 | claude-opus-4-7-high | Anthropic | 1496 | 1491–1501 | 30,082 |
| 12 | muse-spark-1.3-max | Meta | 1492 | 1484–1501 | 4,928 |
| 13 | qwen3.8-max | Alibaba | 1492 | 1485–1499 | 9,003 |
| 14 | muse-spark-1.2 (xHigh) | Meta | 1489 | 1475–1502 | 1,805 |
| 15 | claude-opus-4-7 | Anthropic | 1488 | 1483–1493 | 30,422 |
| 16 | claude-sonnet-5.5-xhigh | Anthropic | 1487 | 1470–1504 | 1,196 |
| 17 | gemini-3.7-flash-high | 1484 | 1477–1491 | 8,659 | |
| 18 | kimi-k3-max | Moonshot AI | 1482 | 1476–1489 | 10,786 |
| 19 | Zglm-5.3-max | Z.ai | 1482 | 1474–1490 | 7,223 |
| 20 | gemini-3.6-flash-high | 1482 | 1476–1488 | 15,114 | |
| 21 | muse-spark | Meta | 1480 | 1473–1488 | 6,673 |
| 22 | gemini-3.5-flash-high | 1480 | 1475–1486 | 20,509 | |
| 23 | muse-spark-1.1 | Meta | 1479 | 1473–1485 | 15,100 |
| 24 | gemini-3.1-pro-preview | 1479 | 1475–1483 | 53,727 | |
| 25 | mimo-v2.6-flash | Xiaomi | 1478 | 1466–1491 | 2,266 |
| 26 | ernie-5.1 | Baidu | 1478 | 1472–1484 | 17,926 |
| 27 | gemini-3-pro | 1478 | 1472–1483 | 16,887 | |
| 28 | mimo-v2.5-pro | Xiaomi | 1478 | 1473–1482 | 29,857 |
| 29 | gemini-3.5-flash-medium | 1476 | 1471–1481 | 19,998 | |
| 30 | deepseek-v4.1-flash-max | DeepSeek | 1476 | 1466–1486 | 3,237 |
| 31 | Zglm-5.1 | Z.ai | 1476 | 1471–1480 | 25,210 |
| 32 | qwen3.5-max-preview | Alibaba | 1475 | 1469–1482 | 10,143 |
| 33 | Zglm-5.2-max | Z.ai | 1474 | 1469–1480 | 18,859 |
| 34 | Zglm-5.3-flash | Z.ai | 1473 | 1466–1480 | 8,546 |
| 35 | claude-sonnet-4-6 | Anthropic | 1472 | 1467–1477 | 31,850 |
| 36 | qwen3.7-max-preview | Alibaba | 1470 | 1457–1484 | 1,884 |
| 37 | Ogpt-5.5-high | OpenAI | 1470 | 1465–1475 | 31,442 |
| 38 | Ogpt-5.5 | OpenAI | 1469 | 1464–1474 | 32,123 |
| 39 | claude-opus-4-8-high | Anthropic | 1468 | 1463–1473 | 27,922 |
| 40 | gemini-3-flash | 1467 | 1461–1473 | 12,474 | |
| 41 | Ogpt-5.4-high | OpenAI | 1467 | 1462–1472 | 29,222 |
| 42 | SStep 5 Preview | Stepfun | 1461 | 1442–1479 | 961 |
| 43 | claude-opus-4-5-20251101 | Anthropic | 1461 | 1456–1465 | 31,143 |
| 44 | claude-opus-4-8 | Anthropic | 1460 | 1455–1465 | 28,640 |
| 45 | kimi-k2.6 | Moonshot AI | 1460 | 1455–1466 | 18,104 |
| 46 | deepseek-v4-pro | DeepSeek | 1459 | 1454–1464 | 25,209 |
| 47 | qwen3.7-plus | Alibaba | 1458 | 1453–1464 | 17,608 |
| 48 | Zglm-5 | Z.ai | 1458 | 1452–1464 | 12,877 |
| 49 | gemini-2.5-pro | 1458 | 1455–1461 | 53,818 | |
| 50 | Aamazon-nova-experimental-chat-26-02-10 | Amazon | 1458 | 1442–1473 | 1,310 |
Data: LMArena leaderboard dataset (CC BY 4.0). Changes: Top 50 entries per leaderboard; scores are rounded. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetCompany logos are trademarks of their respective owners and are used only for identification (icons: Simple Icons).Data: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarks