Valumigo

Artificial Analysis · 에이전트 지수

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: Artificial Analysis가 도구를 쓰며 여러 단계를 거치는 에이전트 작업 평가를 묶어 만든 지수입니다.

점수 읽는 법: 높을수록 도구 사용·다단계 작업 평가에서 좋은 결과를 냈다는 뜻입니다.

주의할 점: 평가 환경과 도구 구성에 따라 결과가 달라질 수 있어, 실제 쓰는 에이전트 도구에서의 성능과 같다고 보기는 어렵습니다.

이번 순위에서 읽을 점

  • 최고 점수는 Claude Fable 5.1 (Max, Default Fallback)의 57.9입니다.
  • 1위와 5위의 차이는 4.9입니다.
  • 상위 10개 중 Anthropic 모델이 3개로 가장 많습니다.

에이전트 지수 Artificial Analysis

공개일 2026-10-05 · 가져온 날 2026-10-05

AnthropicClaude Fable 5.1 (Max, Default Fallback)
57.9
AnthropicClaude Opus 5 (Max)
56.5
AlibabaQwen3.8 Max (0902)
56.0
ZGLM-5.3 (Max)
53.1
xGrok 4.6 (High)
53.0
OGPT-6 Astra (max)
51.0
ZGLM 5.3 Flash
50.9
AnthropicClaude Fable 5 (Max, Opus 4.8 Fallback)
50.7
OGPT-5.6 Sol (Max)
50.2
AlibabaQwen3.8 2.4T A95B
50.1
Moonshot AIKimi K3 (Max)
50.0
AlibabaQwen3.8 Max
49.9
AlibabaQwen3.8 27B (Xhigh)
45.8
AnthropicClaude Sonnet 5 (Max)
43.6
MetaMuse Spark 1.2 (Xhigh)
43.2
OGPT-5.6 Terra (Max)
43.2
OGPT-5.6 Luna (Max)
42.1
AnthropicClaude Opus 4.8 (Max)
41.9
DeepSeekDeepSeek V4 Pro 0813 (Max)
41.3
xGrok 4.5 (High)
41.2

그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다.

표로 보기 (상위 60개)
순위모델만든 곳점수
1#1AnthropicClaude Fable 5.1 (Max, Default Fallback)Anthropic57.9
2#2AnthropicClaude Opus 5 (Max)Anthropic56.5
3#3AlibabaQwen3.8 Max (0902)Alibaba56
4#4ZGLM-5.3 (Max)Z.ai53.1
5#5xGrok 4.6 (High)xAI53
6#6OGPT-6 Astra (max)OpenAI51
7#7ZGLM 5.3 FlashZ.ai50.9
8#8AnthropicClaude Fable 5 (Max, Opus 4.8 Fallback)Anthropic50.7
9#9OGPT-5.6 Sol (Max)OpenAI50.2
10#10AlibabaQwen3.8 2.4T A95BAlibaba50.1
11#11Moonshot AIKimi K3 (Max)Moonshot AI50
12#12AlibabaQwen3.8 MaxAlibaba49.9
13#13AlibabaQwen3.8 27B (Xhigh)Alibaba45.8
14#14AnthropicClaude Sonnet 5 (Max)Anthropic43.6
15#15MetaMuse Spark 1.2 (Xhigh)Meta43.2
16#16OGPT-5.6 Terra (Max)OpenAI43.2
17#17OGPT-5.6 Luna (Max)OpenAI42.1
18#18AnthropicClaude Opus 4.8 (Max)Anthropic41.9
19#19DeepSeekDeepSeek V4 Pro 0813 (Max)DeepSeek41.3
20#20xGrok 4.5 (High)xAI41.2
21#21DeepSeekDeepSeek V4 Flash 0731 (Max)DeepSeek41
22#22GoogleGemini 3.8 Flash (High)Google40.2
23#23AnthropicClaude Opus 4.7 (Max)Anthropic38.6
24#24ZGLM-5.2 (Max)Z.ai38.4
25#25OGPT-5.5 (Xhigh)OpenAI36.4
26#26GoogleGemini 3.7 Flash (High)Google35.2
27#27AnthropicClaude Sonnet 4.6 (Max)Anthropic31.8
28#28MiniMaxMiniMax-M3MiniMax29.5
29#29GoogleGemini 3.6 Flash (High)Google29
30#30iLing-3.0-flash-VLinclusionAI28.7
31#31iLing-3.0-flash-FininclusionAI27.9
32#32DeepSeekDeepSeek V4 Flash 0420 (High)DeepSeek26.3
33#33DeepSeekDeepSeek V4 Pro 0424 (Max)DeepSeek26.3
34#34GoogleGemini 3.5 Flash (High)Google26
35#35MetaMuse Spark 1.1 (Xhigh)Meta25.8
36#36THy3Tencent24.1
37#37ZGLM-5.1 (Reasoning)Z.ai23.9
38#38NNex-N2-Pro (Based on Qwen3.5-397B-A17B)Nex Agi23.7
39#39TInkling SmallThinkingmachines23.5
40#40TInkling (Xhigh)Thinkingmachines22.5
41#41AlibabaQwen3.7 MaxAlibaba22.5
42#42XiaomiMiMo-V2.5-Pro (Reasoning)Xiaomi21.3
43#43Moonshot AIKimi K2.7 CodeMoonshot AI21
44#44Moonshot AIKimi K2.6 (Reasoning)Moonshot AI20.5
45#45NVIDIANemotron 3 Ultra 550B A55B (Reasoning)NVIDIA20.1
46#46iLing 3.0 FlashinclusionAI19.3
47#47AlibabaQwen3.6 27B (Reasoning)Alibaba18.5
48#48OGPT-5.4 mini (Xhigh)OpenAI17.9
49#49AlibabaQwen3.7 PlusAlibaba17.5
50#50OGPT-5.4 nano (Xhigh)OpenAI16
51#51AnthropicClaude 4.5 Sonnet (Reasoning)Anthropic15.8
52#52XiaomiMiMo-V2.5Xiaomi15.8
53#53xGrok 4.3 (High)xAI15.5
54#54MiniMaxMiniMax-M2.7MiniMax15.3
55#55GoogleGemini 3.5 Flash-LiteGoogle14.3
56#56MLongCat 2.0Meituan14
57#57AlibabaQwen3.6 35B A3B (Reasoning)Alibaba13.1
58#58iRing-2.6-1TinclusionAI10.7
59#59AlibabaQwen3.5 397B A17B (Reasoning)Alibaba8.3
60#60GoogleGemini 3.1 Pro PreviewGoogle8.2

Source: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings