Valumigo

LMArena · 종합

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: LMArena에서 사용자가 이름을 가린 두 모델의 답을 비교해 투표한 결과를 종합한 순위입니다. LMArena 사이트의 기본값과 같이, 답의 길이나 마크다운 같은 형식이 투표에 주는 영향을 통계적으로 보정한 '말투·길이 보정(style control)' 순위를 씁니다.

점수 읽는 법: 투표를 Bradley–Terry 모형으로 추정해 Elo와 유사한 척도로 표시한 상대 점수입니다. 95% 신뢰 구간은 추정의 불확실성을 나타내며, 겹친다는 사실만으로 같은 능력이라고 단정할 수는 없습니다.

주의할 점: 사용자가 더 선호한 답변을 평가하므로 정확도뿐 아니라 말투·길이·형식 등의 영향을 받을 수 있습니다. 적용된 필터와 보정 설정도 확인하세요.

이번 순위에서 읽을 점

  • 1위 gemini-4-argon-high와 2위 claude-opus-4-6-high의 95% 신뢰 구간이 겹치지 않습니다. 이번 집계에서는 1위가 앞선다는 근거가 비교적 분명합니다.
  • 상위 10개 중 Anthropic 모델이 7개로 가장 많습니다.
  • 1위 모델이 받은 투표는 4,932표이고, 이 순위표에는 모델 413개가 있습니다.

종합 LMArena

공개일 2026-10-02 · 가져온 날 2026-10-04

14601480150015201540
Googlegemini-4-argon-high
1525
Anthropicclaude-opus-4-6-high
1505
Anthropicclaude-fable-5-high
1504
Anthropicclaude-opus-5.5-high
1504
Anthropicclaude-opus-4-7-high
1501
Anthropicclaude-fable-5.1-max
1501
Googlegemini-3.8-flash-high
1495
Metamuse-spark-1.3-max
1494
Metamuse-spark-1.2 (xHigh)
1494
Metamuse-spark-1.1
1491
Anthropicclaude-opus-5-high
1490
Metamuse-spark
1489
Moonshot AIkimi-k3-max
1488
Googlegemini-3.7-flash-high
1488
Googlegemini-3.1-pro-preview
1487
Googlegemini-3-pro
1485
Ogpt-5.6-sol-xhigh
1484
Ogpt-6.1-sol-max
1483
Googlegemini-3.6-flash-high
1483
Alibabaqwen3.8-max
1482

점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다. 대화·비전 순위는 LMArena 사이트의 기본값과 같은 '말투·길이 보정(style control)' 순위입니다.

회사별 최고 순위

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-opus-4-6-high#2
  • MetaMetamuse-spark-1.3-max#9
  • Moonshot AIMoonshot AIkimi-k3-max#16
  • OOpenAIgpt-5.6-sol-xhigh#20
  • AlibabaAlibabaqwen3.8-max#23
  • XiaomiXiaomimimo-v2.6-pro#26
  • ZZ.aiglm-5.3-max#27
  • xxAIgrok-4.20-beta1#36
표로 보기 (상위 50개)
순위모델만든 곳점수95% 신뢰 구간투표 수
1#1Googlegemini-4-argon-highGoogle15251516–15344,932
2#2Anthropicclaude-opus-4-6-highAnthropic15051501–150877,636
3#3Anthropicclaude-fable-5-highAnthropic15041500–150938,387
4#4Anthropicclaude-opus-5.5-highAnthropic15041495–15134,552
5#5Anthropicclaude-opus-4-7-highAnthropic15011498–150564,946
6#6Anthropicclaude-fable-5.1-maxAnthropic15011495–150811,800
7#7Anthropicclaude-opus-4-6Anthropic14971494–150182,189
8#8Googlegemini-3.8-flash-highGoogle14951490–150026,298
9#9Metamuse-spark-1.3-maxMeta14941488–150012,343
10#10Anthropicclaude-opus-4-7Anthropic14941490–149866,058
11#11Metamuse-spark-1.2 (xHigh)Meta14941484–15034,356
12#12Metamuse-spark-1.1Meta14911487–149637,238
13#13Anthropicclaude-opus-5-highAnthropic14901486–149459,482
14#14Anthropicclaude-opus-5-maxAnthropic14891485–149428,937
15#15Metamuse-sparkMeta14891484–149514,120
16#16Moonshot AIkimi-k3-maxMoonshot AI14881484–149328,280
17#17Googlegemini-3.7-flash-highGoogle14881483–149321,539
18#18Googlegemini-3.1-pro-previewGoogle14871484–1490121,806
19#19Googlegemini-3-proGoogle14851482–148941,910
20#20Ogpt-5.6-sol-xhighOpenAI14841479–148836,656
21#21Ogpt-6.1-sol-maxOpenAI14831473–14943,071
22#22Googlegemini-3.6-flash-highGoogle14831479–148736,070
23#23Alibabaqwen3.8-maxAlibaba14821476–148723,353
24#24Anthropicclaude-opus-4-8-highAnthropic14821478–148563,974
25#25Ogpt-5.5-highOpenAI14811478–148569,202
26#26Xiaomimimo-v2.6-proXiaomi14801471–14894,056
27#27Zglm-5.3-maxZ.ai14781473–148417,857
28#28Googlegemini-3.5-flash-highGoogle14771473–148148,420
29#29Ogpt-6-astra-maxOpenAI14771470–14849,156
30#30Ogpt-5.5OpenAI14771473–148070,781
31#31Googlegemini-3.5-flash-mediumGoogle14761472–148047,187
32#32Zglm-5.2-maxZ.ai14761471–148045,399
33#33Ogpt-5.2-chat-latest-20260210OpenAI14761472–148035,937
34#34Ogpt-5.4-highOpenAI14751471–147964,642
35#35Alibabaqwen3.7-max-previewAlibaba14751465–14853,920
36#36xgrok-4.20-beta1xAI14751470–147927,827
37#37Anthropicclaude-opus-4-8Anthropic14751471–147865,072
38#38DeepSeekdeepseek-v4.1-flash-maxDeepSeek14741468–14818,728
39#39Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14741470–147737,448
40#40Ogpt-5.5-instantOpenAI14731468–147827,098
41#41Zglm-5.3-flashZ.ai14731468–147822,971
42#42Googlegemini-3-flashGoogle14731468–147731,259
43#43Anthropicclaude-sonnet-4-6Anthropic14721469–147670,747
44#44xgrok-4.20-beta-0309-reasoningxAI14721468–147566,334
45#45Anthropicclaude-sonnet-5.5-xhighAnthropic14711461–14813,145
46#46xgrok-4.20-multi-agent-beta-0309xAI14711467–147464,788
47#47Anthropicclaude-opus-4-5-20251101Anthropic14701467–147372,772
48#48Baiduernie-5.1Baidu14681463–147239,396
49#49Xiaomimimo-v2.5-proXiaomi14681464–147170,871
50#50xgrok-4.5xAI14661461–147039,789

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings