LMArena · 에이전트 종합
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: LMArena의 Agent Arena에서 사람들이 에이전트 모드로 실제 업무(소프트웨어 개발, 재무 분석 등)를 맡긴 기록을 바탕으로 한 순위입니다. 에이전트는 bash·웹 검색·파일 작업 같은 도구를 직접 사용합니다.
점수 읽는 법: 점수는 IPS(τ̂)라는 인과 추정 값으로, 0이 기준선이고 높을수록 그 모델을 썼을 때 결과가 더 좋아졌다는 뜻입니다. 사용자의 성공 확인, 칭찬·불만, 수정 지시 반영, bash 오류 복구, 도구 환각 회피 다섯 신호를 합쳤습니다.
주의할 점: 대화 순위(Bradley–Terry 방식)와 점수 척도가 달라 직접 비교할 수 없습니다. 관측 수가 적은 모델은 신뢰 구간이 넓습니다.
이번 순위에서 읽을 점
- 1위 Claude Fable 5.1 (Max)와 2위 Claude Opus 5.5 (High)의 95% 신뢰 구간이 겹칩니다. 이 집계만으로 두 모델의 순서를 확정하기는 어렵습니다.
- 1위와 신뢰 구간이 겹치는 모델이 4개 더 있습니다. 작은 순위 차이는 투표 수와 함께 신중히 해석하세요.
- 상위 10개 중 Anthropic 모델이 6개로 가장 많습니다.
- 1위 모델의 관측 수는 1,683,381건이고, 이 순위표에는 모델 50개가 있습니다.
에이전트 종합 LMArena
공개일 2026-10-02 · 가져온 날 2026-10-04
점수는 IPS(τ̂)로, 0이 기준선이고 높을수록 좋습니다. 선은 95% 신뢰 구간입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다.
회사별 최고 순위
- AnthropicClaude Fable 5.1 (Max)#1
- OOpenAIGPT 6 Astra (Max)#4
- GoogleGemini 4 Argon (High)#10
- Moonshot AIKimi K3 (Max)#14
- xxAIGrok 4.7 (xHigh)#16
- DeepSeekDeepseek V4.1 Flash (Max)#17
- MetaMuse Spark 1.3 (Max)#18
- TTencentHy4 preview#19
- ZZ.aiGLM 5.2 (Max)#20
표로 보기 (상위 50개)
| 순위 | 모델 | 만든 곳 | 점수 | 95% 신뢰 구간 | 관측 수 |
|---|---|---|---|---|---|
| 1 | #1Claude Fable 5.1 (Max) | Anthropic | 0.143 | 0.124–0.162 | 1,683,381 |
| 2 | #2Claude Opus 5.5 (High) | Anthropic | 0.138 | 0.116–0.16 | 754,031 |
| 3 | #3Claude Sonnet 5.5 (Max) | Anthropic | 0.125 | 0.094–0.156 | 483,211 |
| 4 | #4OGPT 6 Astra (Max) | OpenAI | 0.123 | 0.1–0.145 | 888,641 |
| 5 | #5OGPT 6.1 Sol (Max) | OpenAI | 0.112 | 0.085–0.14 | 379,372 |
| 6 | #6OGPT 6 Sol (Max) | OpenAI | 0.097 | 0.073–0.121 | 994,367 |
| 7 | #7Claude Opus 5 (High) | Anthropic | 0.087 | 0.073–0.101 | 3,531,760 |
| 8 | #8Claude Fable 5 (High) | Anthropic | 0.082 | 0.07–0.094 | 2,603,067 |
| 9 | #9Claude Opus 5 (Max) | Anthropic | 0.079 | 0.064–0.094 | 3,006,257 |
| 10 | #10Gemini 4 Argon (High) | 0.076 | 0.056–0.095 | 587,353 | |
| 11 | #11Claude Opus 4.8 (High) | Anthropic | 0.066 | 0.053–0.08 | 2,431,185 |
| 12 | #12OGPT 5.6 Sol (xHigh) | OpenAI | 0.065 | 0.052–0.077 | 4,348,715 |
| 13 | #13Claude Sonnet 5 (High) | Anthropic | 0.044 | 0.028–0.06 | 3,612,898 |
| 14 | #14Kimi K3 (Max) | Moonshot AI | 0.042 | 0.036–0.047 | 12,305,667 |
| 15 | #15OGPT 5.5 (xHigh) | OpenAI | 0.042 | 0.031–0.052 | 3,060,353 |
| 16 | #16xGrok 4.7 (xHigh) | xAI | 0.04 | 0.024–0.056 | 1,656,641 |
| 17 | #17Deepseek V4.1 Flash (Max) | DeepSeek | 0.04 | 0.036–0.045 | 16,932,092 |
| 18 | #18Muse Spark 1.3 (Max) | Meta | 0.04 | 0.034–0.046 | 6,139,426 |
| 19 | #19THy4 preview | Tencent | 0.04 | 0.032–0.047 | 5,108,255 |
| 20 | #20ZGLM 5.2 (Max) | Z.ai | 0.035 | 0.028–0.042 | 6,684,620 |
| 21 | #21Gemini 3.8 Flash (High) | 0.03 | 0.021–0.038 | 4,279,699 | |
| 22 | #22Qwen3.8 Max | Alibaba | 0.025 | 0.019–0.031 | 4,577,924 |
| 23 | #23ZGLM 5.3 (Max) | Z.ai | 0.024 | 0.017–0.03 | 9,155,315 |
| 24 | #24OGPT 6 Luna (Max) | OpenAI | 0.014 | 0.003–0.024 | 3,443,780 |
| 25 | #25xGrok 4.6 (xHigh) | xAI | 0.013 | 0.003–0.023 | 3,131,725 |
| 26 | #26xGrok 4.5 | xAI | 0.012 | 0.002–0.022 | 2,418,629 |
| 27 | #27DeepSeek V4 Pro (High) (0813) | DeepSeek | 0.012 | -0.005–0.028 | 797,284 |
| 28 | #28OGPT 5.4 (High) | OpenAI | 0.011 | 0.001–0.02 | 4,332,904 |
| 29 | #29OGPT 5.5 | OpenAI | 0.01 | 0.001–0.02 | 2,659,460 |
| 30 | #30SStep 5 Preview | StepFun | 0.005 | -0.01–0.02 | 1,125,598 |
| 31 | #31OGPT 5.6 Terra (xHigh) | OpenAI | 0.004 | -0.008–0.016 | 1,686,712 |
| 32 | #32ZGLM 5.3 Flash | Z.ai | -0.004 | -0.009–0 | 9,533,773 |
| 33 | #33MiMo V2.6 Flash | Xiaomi | -0.006 | -0.019–0.007 | 1,562,757 |
| 34 | #34Qwen3.8 Flash Next | Alibaba | -0.007 | -0.014–-0.001 | 11,249,221 |
| 35 | #35OGPT 5.6 Luna (xHigh) | OpenAI | -0.012 | -0.018–-0.005 | 4,028,029 |
| 36 | #36Gemini 3.7 Flash (High) | -0.015 | -0.022–-0.007 | 5,048,920 | |
| 37 | #37Qwen 3.8 27B | Alibaba | -0.017 | -0.023–-0.011 | 6,972,838 |
| 38 | #38Muse Spark 1.2 (xHigh) | Meta | -0.033 | -0.039–-0.026 | 2,884,900 |
| 39 | #39Muse Spark 1.1 | Meta | -0.049 | -0.053–-0.044 | 7,612,456 |
| 40 | #40Qwen3.7 Max | Alibaba | -0.051 | -0.061–-0.042 | 2,207,521 |
| 41 | #41THy3 | Tencent | -0.054 | -0.066–-0.042 | 1,171,568 |
| 42 | #42Minimax M3 | MiniMax | -0.069 | -0.078–-0.06 | 3,338,791 |
| 43 | #43Qwen3.7 Plus | Alibaba | -0.072 | -0.086–-0.057 | 1,144,063 |
| 44 | #44Mimo V2.5 Pro | Xiaomi | -0.075 | -0.084–-0.066 | 2,309,389 |
| 45 | #45Gemini 3.6 Flash (High) | -0.077 | -0.087–-0.066 | 1,523,777 | |
| 46 | #46Gemini 3.1 Pro Preview | -0.077 | -0.087–-0.067 | 3,446,977 | |
| 47 | #47TInkling Small | Thinky | -0.103 | -0.117–-0.089 | 503,653 |
| 48 | #48TInkling | Thinky | -0.109 | -0.119–-0.098 | 1,798,990 |
| 49 | #49Mistral Medium 3.5 | Mistral AI | -0.124 | -0.139–-0.109 | 437,621 |
| 50 | #50USolar Pro 4 | Upstage | -0.159 | -0.178–-0.141 | 427,705 |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings