AI 벤치마크 순위
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
최신 모델 한눈에
최근 120일 안에 나온 모델을 출시일 순으로, 두 공개 출처의 점수를 한 줄에 모았습니다. 점수는 정답률(%)입니다.
| 모델 | 출시일 | 종합 지수 | GPQA Diamond | FrontierMath | HLE | ARC-AGI-2 | SWE-bench Verified | LMArena 종합 순위 | LMArena 한국어 순위 |
|---|---|---|---|---|---|---|---|---|---|
| OGPT-6.1 SolOpenAI | 2026-09-29 | – | 95.4 | 93.7 | – | – | – | #60 | 아직 없음 |
| Claude Sonnet 5.5Anthropic | 2026-09-28 | 165.2 | 95.6 | 88.8 | – | – | – | #34 | 아직 없음 |
| Claude Opus 5.5Anthropic | 2026-09-22 | 167.4 | – | 91.2 | – | 92.5 | – | #2 | 아직 없음 |
| OGPT-6 SolOpenAI | 2026-09-22 | – | 94.3 | 89.8 | – | 89.6 | – | #158 | 아직 없음 |
| OGPT-6 LunaOpenAI | 2026-09-22 | – | – | 78.9 | – | 59.3 | – | #163 | #135 |
| DeepSeek V4.1 FlashDeepSeek | 2026-09-09 | 155 | – | – | – | – | – | #37 | 아직 없음 |
| OGPT-6 AstraOpenAI | 2026-09-03 | 166.5 | 95.8 | 93.7 | 54.8 | 95 | – | #71 | 아직 없음 |
| Gemini 3.8 FlashGoogle | 2026-09-02 | 156.9 | 95.4 | 68.4 | 44.5 | – | – | #8 | #8 |
| Muse Spark 1.3Meta | 2026-09-02 | 156.9 | – | 74.4 | – | – | – | #12 | #3 |
| Claude Fable 5.1Anthropic | 2026-09-01 | 164.8 | – | 90.2 | 46.5 | 90 | – | #3 | #1 |
| Qwen3.8 Max (0902)Alibaba | 2026-09-01 | 155.2 | 92.3 | 65.6 | – | – | – | 아직 없음 | 아직 없음 |
| ZGLM-5.3-FlashZ.ai | 2026-08-20 | 151.9 | – | – | – | – | – | #30 | #27 |
| ZGLM-5.3Z.ai | 2026-08-14 | 155.8 | 90.9 | 68.8 | – | – | – | #26 | #7 |
| Qwen 3.8 27BAlibaba | 2026-08-14 | 149.4 | – | – | – | – | – | #74 | #64 |
| Gemini 3.7 FlashGoogle | 2026-08-13 | 157.4 | 94.8 | 71.6 | – | 84.6 | – | #13 | #6 |
| DeepSeek V4 Pro 0813DeepSeek | 2026-08-13 | 155.4 | 91.7 | – | – | 61.3 | – | 아직 없음 | 아직 없음 |
새 모델은 투표가 충분히 쌓여야 순위표(특히 언어별 순위)에 들어갑니다. 출시 직후에는 '아직 없음'으로 보일 수 있습니다.
LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.
한국어 LMArena
공개일 2026-10-02 · 가져온 날 2026-10-04
14001450150015501600
claude-fable-5.1-max
1534
claude-opus-5-max
1519
muse-spark-1.3-max
1516
claude-opus-5-high
1511
claude-fable-5-high
1488
gemini-3.7-flash-high
1483
Zglm-5.3-max
1475
gemini-3.8-flash-high
1468
qwen3.8-max
1465
claude-opus-4-6
1465
claude-opus-4-7
1464
Ogpt-5.5-high
1461
muse-spark-1.1
1461
kimi-k3-max
1460
gemini-3.1-pro-preview
1458
muse-spark
1457
claude-opus-4-7-high
1453
gemini-3.5-flash-medium
1452
Ogpt-5.4-high
1450
claude-opus-4-6-high
1450
점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다.
표로 보기 (상위 50개)
| 순위 | 모델 | 만든 곳 | 점수 | 95% 신뢰 구간 | 투표 수 |
|---|---|---|---|---|---|
| 1 | claude-fable-5.1-max | Anthropic | 1534 | 1487–1581 | 177 |
| 2 | claude-opus-5-max | Anthropic | 1519 | 1494–1545 | 568 |
| 3 | muse-spark-1.3-max | Meta | 1516 | 1475–1558 | 205 |
| 4 | claude-opus-5-high | Anthropic | 1511 | 1492–1531 | 1,126 |
| 5 | claude-fable-5-high | Anthropic | 1488 | 1465–1511 | 722 |
| 6 | gemini-3.7-flash-high | 1483 | 1452–1514 | 404 | |
| 7 | Zglm-5.3-max | Z.ai | 1475 | 1441–1510 | 298 |
| 8 | gemini-3.8-flash-high | 1468 | 1440–1497 | 487 | |
| 9 | qwen3.8-max | Alibaba | 1465 | 1438–1493 | 493 |
| 10 | claude-opus-4-6 | Anthropic | 1465 | 1448–1482 | 1,486 |
| 11 | claude-opus-4-7 | Anthropic | 1464 | 1446–1483 | 1,144 |
| 12 | Ogpt-5.5-high | OpenAI | 1461 | 1443–1479 | 1,187 |
| 13 | muse-spark-1.1 | Meta | 1461 | 1438–1484 | 708 |
| 14 | kimi-k3-max | Moonshot AI | 1460 | 1436–1484 | 615 |
| 15 | gemini-3.1-pro-preview | 1458 | 1443–1473 | 2,145 | |
| 16 | muse-spark | Meta | 1457 | 1419–1496 | 252 |
| 17 | claude-opus-4-7-high | Anthropic | 1453 | 1434–1473 | 1,100 |
| 18 | gemini-3.5-flash-medium | 1452 | 1431–1473 | 855 | |
| 19 | Ogpt-5.4-high | OpenAI | 1450 | 1430–1469 | 1,106 |
| 20 | claude-opus-4-6-high | Anthropic | 1450 | 1432–1467 | 1,310 |
| 21 | gemini-3-pro | 1449 | 1426–1472 | 719 | |
| 22 | gemini-3.5-flash-high | 1448 | 1429–1468 | 960 | |
| 23 | Zglm-5.2-max | Z.ai | 1447 | 1427–1468 | 879 |
| 24 | Ogpt-5.5 | OpenAI | 1445 | 1427–1464 | 1,180 |
| 25 | gemini-3-flash | 1443 | 1418–1469 | 579 | |
| 26 | deepseek-v4-pro-high-20260813 | DeepSeek | 1443 | 1403–1484 | 195 |
| 27 | Zglm-5.3-flash | Z.ai | 1439 | 1408–1469 | 397 |
| 28 | Ogpt-5.4 | OpenAI | 1438 | 1419–1457 | 1,159 |
| 29 | qwen3.5-max-preview | Alibaba | 1438 | 1409–1467 | 411 |
| 30 | gemini-3.6-flash-high | 1438 | 1414–1461 | 685 | |
| 31 | Ogpt-5.6-sol-xhigh | OpenAI | 1436 | 1413–1459 | 723 |
| 32 | mimo-v2.5-pro | Xiaomi | 1435 | 1417–1453 | 1,305 |
| 33 | gemini-2.5-pro | 1434 | 1421–1447 | 2,476 | |
| 34 | claude-opus-4-8-high | Anthropic | 1433 | 1414–1453 | 1,094 |
| 35 | kimi-k2.6 | Moonshot AI | 1429 | 1406–1452 | 729 |
| 36 | ernie-5.1 | Baidu | 1428 | 1404–1452 | 654 |
| 37 | deepseek-v4-pro-high-preview | DeepSeek | 1426 | 1407–1446 | 980 |
| 38 | Ogpt-5.6-terra-xhigh | OpenAI | 1425 | 1403–1448 | 733 |
| 39 | claude-opus-4-5-20251101 | Anthropic | 1425 | 1407–1443 | 1,163 |
| 40 | claude-opus-4-8 | Anthropic | 1425 | 1405–1444 | 1,064 |
| 41 | Zglm-5 | Z.ai | 1423 | 1397–1448 | 552 |
| 42 | Zglm-5.1 | Z.ai | 1420 | 1401–1439 | 1,113 |
| 43 | gemini-3-flash (thinking-minimal) | 1418 | 1401–1435 | 1,408 | |
| 44 | xgrok-4.20-multi-agent-beta-0309 | xAI | 1417 | 1397–1436 | 1,045 |
| 45 | xgrok-4.20-beta1 | xAI | 1416 | 1388–1444 | 467 |
| 46 | xgrok-4.20-beta-0309-reasoning | xAI | 1416 | 1396–1436 | 1,058 |
| 47 | qwen3.7-plus | Alibaba | 1416 | 1394–1437 | 828 |
| 48 | Ogpt-5.6-luna-xhigh | OpenAI | 1414 | 1392–1437 | 712 |
| 49 | dola-seed-2.0-pro | ByteDance | 1413 | 1395–1430 | 1,322 |
| 50 | kimi-k2.5-thinking | Moonshot AI | 1412 | 1394–1429 | 1,355 |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarks