LMArena · 에이전트 작업 성공
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: Agent Arena 신호 중 '작업 성공 확인'만 따로 본 순위입니다. 사용자가 에이전트의 작업이 끝난 뒤 성공·실패를 직접 표시한 결과를 씁니다.
점수 읽는 법: IPS(τ̂) 점수로, 0이 기준선이고 높을수록 사용자가 성공으로 표시한 결과가 기준보다 좋아졌다는 뜻입니다.
주의할 점: 사용자가 직접 표시한 경우만 반영되므로 표시하지 않은 작업은 빠집니다. 종합 순위와 순서가 다를 수 있습니다.
이번 순위에서 읽을 점
- 1위 Claude Fable 5.1 (Max)와 2위 GPT 6.1 Sol (Max)의 95% 신뢰 구간이 겹칩니다. 이 집계만으로 두 모델의 순서를 확정하기는 어렵습니다.
- 1위와 신뢰 구간이 겹치는 모델이 5개 더 있습니다. 작은 순위 차이는 투표 수와 함께 신중히 해석하세요.
- 상위 10개 중 Anthropic 모델이 5개로 가장 많습니다.
- 1위 모델의 관측 수는 7,868건이고, 이 순위표에는 모델 50개가 있습니다.
에이전트 작업 성공 LMArena
공개일 2026-10-02 · 가져온 날 2026-10-04
점수는 IPS(τ̂)로, 0이 기준선이고 높을수록 좋습니다. 선은 95% 신뢰 구간입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다.
회사별 최고 순위
- AnthropicClaude Fable 5.1 (Max)#1
- OOpenAIGPT 6.1 Sol (Max)#2
- GoogleGemini 4 Argon (High)#3
- DeepSeekDeepseek V4.1 Flash (Max)#8
- Moonshot AIKimi K3 (Max)#9
- TTencentHy4 preview#14
- XiaomiMiMo V2.6 Flash#15
- xxAIGrok 4.7 (xHigh)#16
- ZZ.aiGLM 5.3 (Max)#17
표로 보기 (상위 50개)
| 순위 | 모델 | 만든 곳 | 점수 | 95% 신뢰 구간 | 관측 수 |
|---|---|---|---|---|---|
| 1 | #1Claude Fable 5.1 (Max) | Anthropic | 0.176 | 0.148–0.205 | 7,868 |
| 2 | #2OGPT 6.1 Sol (Max) | OpenAI | 0.155 | 0.114–0.196 | 2,270 |
| 3 | #3Gemini 4 Argon (High) | 0.154 | 0.125–0.184 | 4,422 | |
| 4 | #4Claude Opus 5.5 (High) | Anthropic | 0.141 | 0.101–0.182 | 3,425 |
| 5 | #5Claude Sonnet 5.5 (Max) | Anthropic | 0.139 | 0.086–0.193 | 1,195 |
| 6 | #6OGPT 6 Astra (Max) | OpenAI | 0.132 | 0.095–0.169 | 5,954 |
| 7 | #7Claude Opus 5 (Max) | Anthropic | 0.095 | 0.064–0.126 | 15,453 |
| 8 | #8Deepseek V4.1 Flash (Max) | DeepSeek | 0.084 | 0.074–0.095 | 60,410 |
| 9 | #9Kimi K3 (Max) | Moonshot AI | 0.076 | 0.064–0.088 | 99,685 |
| 10 | #10Claude Opus 5 (High) | Anthropic | 0.076 | 0.046–0.106 | 20,843 |
| 11 | #11OGPT 6 Sol (Max) | OpenAI | 0.071 | 0.028–0.114 | 3,312 |
| 12 | #12Gemini 3.8 Flash (High) | 0.069 | 0.05–0.087 | 22,497 | |
| 13 | #13Claude Fable 5 (High) | Anthropic | 0.061 | 0.035–0.087 | 33,005 |
| 14 | #14THy4 preview | Tencent | 0.058 | 0.042–0.075 | 24,238 |
| 15 | #15MiMo V2.6 Flash | Xiaomi | 0.056 | 0.03–0.082 | 7,967 |
| 16 | #16xGrok 4.7 (xHigh) | xAI | 0.055 | 0.021–0.089 | 5,906 |
| 17 | #17ZGLM 5.3 (Max) | Z.ai | 0.053 | 0.037–0.068 | 62,886 |
| 18 | #18OGPT 5.6 Sol (xHigh) | OpenAI | 0.05 | 0.024–0.077 | 28,118 |
| 19 | #19Muse Spark 1.3 (Max) | Meta | 0.05 | 0.037–0.064 | 45,563 |
| 20 | #20ZGLM 5.2 (Max) | Z.ai | 0.048 | 0.032–0.063 | 55,555 |
| 21 | #21Qwen3.8 Max | Alibaba | 0.047 | 0.033–0.061 | 35,416 |
| 22 | #22SStep 5 Preview | StepFun | 0.045 | 0.012–0.078 | 4,266 |
| 23 | #23ZGLM 5.3 Flash | Z.ai | 0.044 | 0.032–0.055 | 60,370 |
| 24 | #24Claude Opus 4.8 (High) | Anthropic | 0.042 | 0.016–0.069 | 30,039 |
| 25 | #25Qwen3.8 Flash Next | Alibaba | 0.036 | 0.021–0.051 | 38,898 |
| 26 | #26xGrok 4.5 | xAI | 0.013 | -0.01–0.037 | 29,109 |
| 27 | #27Claude Sonnet 5 (High) | Anthropic | 0.012 | -0.023–0.047 | 22,551 |
| 28 | #28Gemini 3.7 Flash (High) | 0.012 | -0.006–0.029 | 48,036 | |
| 29 | #29Qwen 3.8 27B | Alibaba | 0.01 | -0.005–0.024 | 36,984 |
| 30 | #30OGPT 6 Luna (Max) | OpenAI | -0.001 | -0.025–0.023 | 14,416 |
| 31 | #31xGrok 4.6 (xHigh) | xAI | -0.006 | -0.029–0.018 | 20,463 |
| 32 | #32OGPT 5.5 (xHigh) | OpenAI | -0.009 | -0.031–0.014 | 43,172 |
| 33 | #33DeepSeek V4 Pro (High) (0813) | DeepSeek | -0.017 | -0.057–0.023 | 3,790 |
| 34 | #34OGPT 5.4 (High) | OpenAI | -0.025 | -0.046–-0.004 | 57,450 |
| 35 | #35OGPT 5.6 Luna (xHigh) | OpenAI | -0.033 | -0.049–-0.017 | 33,799 |
| 36 | #36OGPT 5.6 Terra (xHigh) | OpenAI | -0.039 | -0.065–-0.013 | 18,613 |
| 37 | #37Muse Spark 1.1 | Meta | -0.043 | -0.054–-0.031 | 95,130 |
| 38 | #38OGPT 5.5 | OpenAI | -0.047 | -0.068–-0.026 | 64,950 |
| 39 | #39Muse Spark 1.2 (xHigh) | Meta | -0.054 | -0.072–-0.036 | 33,552 |
| 40 | #40Gemini 3.6 Flash (High) | -0.057 | -0.083–-0.031 | 18,029 | |
| 41 | #41Qwen3.7 Max | Alibaba | -0.091 | -0.115–-0.066 | 30,156 |
| 42 | #42Qwen3.7 Plus | Alibaba | -0.093 | -0.126–-0.06 | 15,130 |
| 43 | #43Mimo V2.5 Pro | Xiaomi | -0.096 | -0.119–-0.073 | 29,517 |
| 44 | #44Gemini 3.1 Pro Preview | -0.099 | -0.121–-0.078 | 69,866 | |
| 45 | #45THy3 | Tencent | -0.112 | -0.14–-0.084 | 14,238 |
| 46 | #46Minimax M3 | MiniMax | -0.137 | -0.162–-0.112 | 28,148 |
| 47 | #47Mistral Medium 3.5 | Mistral AI | -0.145 | -0.183–-0.108 | 6,629 |
| 48 | #48TInkling Small | Thinky | -0.201 | -0.244–-0.158 | 7,271 |
| 49 | #49USolar Pro 4 | Upstage | -0.205 | -0.259–-0.152 | 4,788 |
| 50 | #50TInkling | Thinky | -0.207 | -0.237–-0.177 | 24,644 |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings