Valumigo

LMArena · 영어

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: LMArena의 텍스트 대화 중 영어로 분류된 질문의 투표를 이용해 계산한 순위입니다.

점수 읽는 법: 영어 질문에서 투표 참여자가 더 선호한 모델을 보여 줍니다. 질문 언어가 투표자의 모국어나 신원을 뜻하지는 않습니다.

주의할 점: 언어와 모델에 따라 투표 수와 신뢰 구간 폭이 다릅니다. 새 모델은 투표 수, 업데이트 날짜와 집계 조건을 함께 확인하세요.

이번 순위에서 읽을 점

  • 1위 gemini-4-argon-high와 2위 claude-opus-4-6-high의 95% 신뢰 구간이 겹칩니다. 이 집계만으로 두 모델의 순서를 확정하기는 어렵습니다.
  • 1위와 신뢰 구간이 겹치는 모델이 3개 더 있습니다. 작은 순위 차이는 투표 수와 함께 신중히 해석하세요.
  • 상위 10개 중 Anthropic 모델이 6개로 가장 많습니다.
  • 1위 모델이 받은 투표는 1,928표이고, 이 순위표에는 모델 413개가 있습니다.

영어 LMArena

공개일 2026-10-02 · 가져온 날 2026-10-04

146014801500152015401560
Googlegemini-4-argon-high
1533
Anthropicclaude-opus-4-6-high
1514
Anthropicclaude-fable-5-high
1513
Anthropicclaude-opus-4-7-high
1510
Anthropicclaude-opus-5.5-high
1506
Metamuse-spark-1.3-max
1499
Metamuse-spark-1.2 (xHigh)
1498
Googlegemini-3.8-flash-high
1498
Anthropicclaude-fable-5.1-max
1498
Metamuse-spark
1497
Ogpt-6.1-sol-max
1496
Xiaomimimo-v2.6-pro
1496
Moonshot AIkimi-k3-max
1495
Anthropicclaude-opus-5-high
1493
Anthropicclaude-sonnet-5.5-xhigh
1492
Alibabaqwen3.8-max
1492
Metamuse-spark-1.1
1491
Googlegemini-3.1-pro-preview
1490
Anthropicclaude-opus-4-8-high
1490
Zglm-5.3-max
1490

점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다. 대화·비전 순위는 LMArena 사이트의 기본값과 같은 '말투·길이 보정(style control)' 순위입니다.

회사별 최고 순위

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-opus-4-6-high#2
  • MetaMetamuse-spark-1.3-max#8
  • OOpenAIgpt-6.1-sol-max#13
  • XiaomiXiaomimimo-v2.6-pro#14
  • Moonshot AIMoonshot AIkimi-k3-max#15
  • AlibabaAlibabaqwen3.8-max#18
  • ZZ.aiglm-5.3-max#23
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#24
표로 보기 (상위 50개)
순위모델만든 곳점수95% 신뢰 구간투표 수
1#1Googlegemini-4-argon-highGoogle15331519–15471,928
2#2Anthropicclaude-opus-4-6-highAnthropic15141509–151934,324
3#3Anthropicclaude-fable-5-highAnthropic15131508–151916,474
4#4Anthropicclaude-opus-4-7-highAnthropic15101505–151530,082
5#5Anthropicclaude-opus-4-6Anthropic15071502–151136,805
6#6Anthropicclaude-opus-5.5-highAnthropic15061492–15201,719
7#7Anthropicclaude-opus-4-7Anthropic15011496–150630,422
8#8Metamuse-spark-1.3-maxMeta14991491–15084,928
9#9Metamuse-spark-1.2 (xHigh)Meta14981484–15121,805
10#10Googlegemini-3.8-flash-highGoogle14981491–150510,363
11#11Anthropicclaude-fable-5.1-maxAnthropic14981489–15064,793
12#12Metamuse-sparkMeta14971489–15046,673
13#13Ogpt-6.1-sol-maxOpenAI14961479–15131,149
14#14Xiaomimimo-v2.6-proXiaomi14961481–15111,487
15#15Moonshot AIkimi-k3-maxMoonshot AI14951489–150210,786
16#16Anthropicclaude-opus-5-highAnthropic14931488–149824,266
17#17Anthropicclaude-sonnet-5.5-xhighAnthropic14921475–15091,196
18#18Alibabaqwen3.8-maxAlibaba14921485–14999,003
19#19Metamuse-spark-1.1Meta14911486–149715,100
20#20Anthropicclaude-opus-5-maxAnthropic14911484–149711,702
21#21Googlegemini-3.1-pro-previewGoogle14901486–149453,727
22#22Anthropicclaude-opus-4-8-highAnthropic14901485–149527,922
23#23Zglm-5.3-maxZ.ai14901482–14977,223
24#24DeepSeekdeepseek-v4.1-flash-maxDeepSeek14891479–15003,237
25#25Ogpt-5.6-sol-xhighOpenAI14891483–149514,827
26#26Ogpt-6-astra-maxOpenAI14881478–14983,692
27#27Googlegemini-3-proGoogle14871482–149316,887
28#28Googlegemini-3.6-flash-highGoogle14871481–149315,114
29#29Googlegemini-3.7-flash-highGoogle14851478–14938,659
30#30Ogpt-5.5-highOpenAI14841480–148931,442
31#31Ogpt-5.5OpenAI14831478–148832,123
32#32Anthropicclaude-sonnet-4-6Anthropic14821478–148731,850
33#33Zglm-5.2-maxZ.ai14821477–148818,859
34#34Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14821477–148814,837
35#35Anthropicclaude-opus-4-8Anthropic14821477–148728,640
36#36Ogpt-5.2-chat-latest-20260210OpenAI14811476–148715,854
37#37Zglm-5.1Z.ai14811477–148625,210
38#38xgrok-4.20-beta1xAI14811475–148712,733
39#39Xiaomimimo-v2.5-proXiaomi14801475–148429,857
40#40Anthropicclaude-opus-4-5-20251101Anthropic14791474–148331,143
41#41Googlegemini-3.5-flash-highGoogle14791473–148420,509
42#42DeepSeekdeepseek-v4-pro-high-20260813DeepSeek14791469–14883,755
43#43Baiduernie-5.1Baidu14781473–148417,926
44#44Zglm-5.3-flashZ.ai14781471–14858,546
45#45Googlegemini-3.5-flash-mediumGoogle14781472–148319,998
46#46xgrok-4.20-beta-0309-reasoningxAI14781473–148330,381
47#47Ogpt-5.4-highOpenAI14761471–148129,222
48#48Googlegemini-3-flashGoogle14761470–148212,474
49#49xgrok-4.5xAI14741468–148016,121
50#50xgrok-4.20-multi-agent-beta-0309xAI14741469–147829,508

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings