LMArena · 웹 개발
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: 같은 요청으로 웹페이지나 웹앱을 생성하게 하고, 실행된 결과를 익명으로 비교해 투표한 WebDev Arena 순위입니다.
점수 읽는 법: 사용자가 더 선호한 실행 결과의 상대 점수입니다. 객관적인 기능 테스트 통과율이나 유지보수 점수는 아닙니다.
주의할 점: 지원 프레임워크와 생성·실행 조건에 한정된 평가이므로 대규모 프로젝트의 장기 유지보수 능력까지 보장하지는 않습니다.
이번 순위에서 읽을 점
- 1위 claude-opus-5.5-max와 2위 gpt-6-astra-max의 95% 신뢰 구간이 겹치지 않습니다. 이번 집계에서는 1위가 앞선다는 근거가 비교적 분명합니다.
- 상위 10개 중 Anthropic 모델이 5개로 가장 많습니다.
- 1위 모델이 받은 투표는 2,062표이고, 이 순위표에는 모델 50개가 있습니다.
웹 개발 LMArena
공개일 2026-10-01 · 가져온 날 2026-10-04
점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다.
회사별 최고 순위
- Anthropicclaude-opus-5.5-max#1
- OOpenAIgpt-6-astra-max#2
- Googlegemini-4-argon-high#9
- Alibabaqwen3.8-max#10
- Moonshot AIkimi-k3-max#13
- Metamuse-spark-1.3-max#14
- xxAIgrok-4.7-xhigh#15
- TTencenthy4-preview#17
- ZZ.aiglm-5.3-max#20
표로 보기 (상위 50개)
| 순위 | 모델 | 만든 곳 | 점수 | 95% 신뢰 구간 | 투표 수 |
|---|---|---|---|---|---|
| 1 | #1claude-opus-5.5-max | Anthropic | 1815 | 1799–1831 | 2,062 |
| 2 | #2Ogpt-6-astra-max | OpenAI | 1788 | 1777–1798 | 6,123 |
| 3 | #3claude-sonnet-5.5-xhigh | Anthropic | 1786 | 1768–1804 | 1,531 |
| 4 | #4Ogpt-6.1-sol-max | OpenAI | 1758 | 1741–1775 | 1,620 |
| 5 | #5claude-fable-5.1-max | Anthropic | 1749 | 1740–1759 | 6,318 |
| 6 | #6claude-sonnet-5.5-high | Anthropic | 1715 | 1702–1729 | 2,527 |
| 7 | #7claude-opus-5-max | Anthropic | 1695 | 1689–1701 | 16,954 |
| 8 | #8Ogpt-6-sol-max | OpenAI | 1689 | 1678–1700 | 3,411 |
| 9 | #9gemini-4-argon-high | 1680 | 1666–1693 | 2,422 | |
| 10 | #10qwen3.8-max | Alibaba | 1671 | 1659–1683 | 3,454 |
| 11 | #11qwen3.8-max-0902 | Alibaba | 1670 | 1662–1678 | 9,485 |
| 12 | #12claude-opus-5-high | Anthropic | 1660 | 1654–1666 | 21,506 |
| 13 | #13kimi-k3-max | Moonshot AI | 1658 | 1651–1664 | 16,513 |
| 14 | #14muse-spark-1.3-max | Meta | 1657 | 1648–1665 | 7,249 |
| 15 | #15xgrok-4.7-xhigh | xAI | 1638 | 1626–1649 | 3,216 |
| 16 | #16qwen3.8-flash-next | Alibaba | 1637 | 1629–1646 | 6,193 |
| 17 | #17Thy4-preview | Tencent | 1633 | 1624–1643 | 5,088 |
| 18 | #18claude-fable-5-high | Anthropic | 1625 | 1619–1632 | 14,126 |
| 19 | #19muse-spark-1.3 (xHigh) | Meta | 1624 | 1616–1633 | 6,326 |
| 20 | #20Zglm-5.3-max | Z.ai | 1623 | 1615–1631 | 7,658 |
| 21 | #21deepseek-v4.1-flash-max | DeepSeek | 1620 | 1609–1630 | 3,960 |
| 22 | #22Ogpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1620 | 1614–1626 | 17,128 |
| 23 | #23xgrok-4.6-high | xAI | 1620 | 1612–1627 | 8,315 |
| 24 | #24mimo-v2.6-pro | Xiaomi | 1618 | 1606–1631 | 2,734 |
| 25 | #25Zglm-5.3-flash | Z.ai | 1616 | 1608–1623 | 10,355 |
| 26 | #26Zglm-5.2-max | Z.ai | 1605 | 1599–1611 | 14,729 |
| 27 | #27gemini-3.7-flash-high | 1592 | 1584–1599 | 9,624 | |
| 28 | #28qwen3.8-27b | Alibaba | 1591 | 1584–1598 | 12,388 |
| 29 | #29gemini-3.8-flash-high | 1583 | 1575–1591 | 8,524 | |
| 30 | #30deepseek-v4-pro-high-20260813 | DeepSeek | 1583 | 1573–1592 | 4,882 |
| 31 | #31deepseek-v4-flash-high | DeepSeek | 1581 | 1572–1590 | 5,040 |
| 32 | #32Ogpt-6-luna-max | OpenAI | 1579 | 1570–1587 | 6,429 |
| 33 | #33Sstep-5-preview-high | StepFun | 1570 | 1557–1583 | 2,506 |
| 34 | #34claude-opus-4-7-high | Anthropic | 1557 | 1552–1563 | 17,982 |
| 35 | #35claude-opus-4-8-high | Anthropic | 1556 | 1550–1561 | 18,908 |
| 36 | #36claude-opus-4-7 | Anthropic | 1555 | 1550–1561 | 18,174 |
| 37 | #37xgrok-4.5 | xAI | 1552 | 1545–1558 | 11,393 |
| 38 | #38claude-opus-4-6-high | Anthropic | 1546 | 1540–1551 | 19,519 |
| 39 | #39muse-spark-1.1 | Meta | 1542 | 1534–1549 | 8,070 |
| 40 | #40claude-sonnet-5-high | Anthropic | 1539 | 1533–1546 | 14,130 |
| 41 | #41claude-opus-4-6 | Anthropic | 1537 | 1532–1542 | 20,762 |
| 42 | #42gemini-3.6-flash-high | 1536 | 1529–1544 | 8,823 | |
| 43 | #43claude-opus-4-8 | Anthropic | 1534 | 1528–1540 | 17,880 |
| 44 | #44muse-spark-1.2 (xHigh) | Meta | 1532 | 1518–1545 | 2,183 |
| 45 | #45claude-sonnet-4-6 | Anthropic | 1521 | 1516–1527 | 22,960 |
| 46 | #46Ogpt-5.6-terra-xhigh (codex-harness) | OpenAI | 1519 | 1513–1526 | 12,526 |
| 47 | #47Ogpt-5.6-luna-xhigh (codex-harness) | OpenAI | 1518 | 1512–1524 | 12,776 |
| 48 | #48seed-2.1-pro-preview | ByteDance | 1517 | 1511–1523 | 13,312 |
| 49 | #49qwen3.7-max-20260517 | Alibaba | 1515 | 1508–1522 | 8,922 |
| 50 | #50Ogpt-5.5-xhigh (codex-harness) | OpenAI | 1512 | 1506–1518 | 15,873 |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings