LMArena · 문서 이해
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: 문서(PDF 등)를 올리고 질문했을 때 두 모델의 답을 비교해 투표한 LMArena 순위입니다.
점수 읽는 법: Bradley–Terry 방식으로 추정한 상대 점수입니다. 95% 신뢰 구간이 넓으면 순위 차이를 신중히 해석하세요.
주의할 점: 다른 순위표보다 공개 주기가 길 수 있으니 공개일을 확인하세요. 문서의 종류와 언어에 따라 결과가 달라질 수 있습니다.
이번 순위에서 읽을 점
- 1위 claude-opus-5-high와 2위 claude-fable-5.1-max의 95% 신뢰 구간이 겹칩니다. 이 집계만으로 두 모델의 순서를 확정하기는 어렵습니다.
- 1위와 신뢰 구간이 겹치는 모델이 3개 더 있습니다. 작은 순위 차이는 투표 수와 함께 신중히 해석하세요.
- 상위 10개 중 Anthropic 모델이 7개로 가장 많습니다.
- 1위 모델이 받은 투표는 8,794표이고, 이 순위표에는 모델 44개가 있습니다.
문서 이해 LMArena
공개일 2026-09-13 · 가져온 날 2026-10-04
점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다.
회사별 최고 순위
- Anthropicclaude-opus-5-high#1
- OOpenAIgpt-5.5#8
- Metamuse-spark-1.3-max#15
- Googlegemini-3.5-flash-medium#20
- xxAIgrok-4.6-high#25
- Moonshot AIkimi-k2.6#27
- Alibabaqwen3.7-plus#30
- MiniMaxminimax-m3#32
- ZZ.aiglm-5v-turbo#39
표로 보기 (상위 50개)
| 순위 | 모델 | 만든 곳 | 점수 | 95% 신뢰 구간 | 투표 수 |
|---|---|---|---|---|---|
| 1 | #1claude-opus-5-high | Anthropic | 1516 | 1509–1523 | 8,794 |
| 2 | #2claude-fable-5.1-max | Anthropic | 1513 | 1497–1528 | 1,403 |
| 3 | #3claude-opus-4-6-high | Anthropic | 1507 | 1501–1514 | 27,929 |
| 4 | #4claude-opus-4-6 | Anthropic | 1507 | 1501–1513 | 41,260 |
| 5 | #5claude-fable-5 | Anthropic | 1496 | 1488–1504 | 8,497 |
| 6 | #6claude-opus-4-7 | Anthropic | 1495 | 1489–1501 | 22,192 |
| 7 | #7claude-opus-4-7-high | Anthropic | 1495 | 1488–1501 | 21,957 |
| 8 | #8Ogpt-5.5 | OpenAI | 1486 | 1479–1492 | 21,279 |
| 9 | #9Ogpt-5.5-high | OpenAI | 1484 | 1478–1491 | 20,944 |
| 10 | #10Ogpt-5.6-sol-xhigh | OpenAI | 1483 | 1474–1492 | 4,818 |
| 11 | #11claude-sonnet-4-6 | Anthropic | 1482 | 1476–1488 | 57,813 |
| 12 | #12claude-opus-4-8-high | Anthropic | 1475 | 1468–1482 | 11,551 |
| 13 | #13Ogpt-5.6-terra-xhigh | OpenAI | 1472 | 1463–1480 | 5,787 |
| 14 | #14Ogpt-5.4 | OpenAI | 1471 | 1465–1477 | 33,331 |
| 15 | #15muse-spark-1.3-max | Meta | 1471 | 1452–1489 | 1,006 |
| 16 | #16Ogpt-6-astra-max | OpenAI | 1468 | 1453–1482 | 1,621 |
| 17 | #17claude-sonnet-5-high | Anthropic | 1466 | 1458–1474 | 7,411 |
| 18 | #18muse-spark-1.1 | Meta | 1465 | 1456–1474 | 4,885 |
| 19 | #19claude-opus-4-8 | Anthropic | 1464 | 1457–1471 | 12,128 |
| 20 | #20gemini-3.5-flash-medium | 1463 | 1455–1471 | 6,500 | |
| 21 | #21claude-opus-4-5-20251101 | Anthropic | 1462 | 1452–1473 | 7,981 |
| 22 | #22gemini-3.5-flash-high | 1461 | 1452–1471 | 4,061 | |
| 23 | #23Ogpt-5.6-luna-xhigh | OpenAI | 1457 | 1449–1465 | 5,766 |
| 24 | #24gemini-3.6-flash-high | 1456 | 1445–1467 | 2,975 | |
| 25 | #25xgrok-4.6-high | xAI | 1452 | 1440–1464 | 2,258 |
| 26 | #26xgrok-4.5 | xAI | 1452 | 1443–1461 | 4,965 |
| 27 | #27kimi-k2.6 | Moonshot AI | 1451 | 1443–1458 | 11,291 |
| 28 | #28claude-sonnet-4-5-20250929 | Anthropic | 1450 | 1444–1456 | 31,455 |
| 29 | #29muse-spark | Meta | 1444 | 1426–1462 | 1,084 |
| 30 | #30qwen3.7-plus | Alibaba | 1444 | 1435–1453 | 4,591 |
| 31 | #31gemini-3.1-pro-preview | 1444 | 1439–1449 | 49,457 | |
| 32 | #32minimax-m3 | MiniMax | 1435 | 1427–1443 | 6,314 |
| 33 | #33gemini-3-pro | 1434 | 1425–1443 | 10,769 | |
| 34 | #34kimi-k2.5-thinking | Moonshot AI | 1430 | 1423–1437 | 21,569 |
| 35 | #35gemma-4-31b | 1425 | 1417–1432 | 12,326 | |
| 36 | #36gemini-2.5-pro | 1421 | 1415–1427 | 25,110 | |
| 37 | #37claude-haiku-4-5-20251001 | Anthropic | 1420 | 1414–1426 | 34,677 |
| 38 | #38xgrok-4.20-beta-0309-reasoning | xAI | 1416 | 1409–1423 | 20,948 |
| 39 | #39Zglm-5v-turbo | Z.ai | 1416 | 1407–1424 | 6,995 |
| 40 | #40gemini-3-flash | 1413 | 1404–1422 | 7,158 | |
| 41 | #41Ogpt-5.2-high | OpenAI | 1405 | 1395–1414 | 7,108 |
| 42 | #42Ogpt-5.1 | OpenAI | 1403 | 1394–1413 | 8,244 |
| 43 | #43Ogpt-5.5-instant | OpenAI | 1403 | 1395–1411 | 8,497 |
| 44 | #44Ogpt-5.2 | OpenAI | 1401 | 1395–1407 | 28,212 |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings