Valumigo

LMArena · 수학

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: LMArena의 텍스트 대화 중 수학 질문으로 분류된 투표를 이용한 순위입니다.

점수 읽는 법: 수학 관련 답변에서 사용자가 더 선호한 모델의 상대 점수입니다. 투표 수가 적은 모델은 신뢰 구간이 넓을 수 있습니다.

주의할 점: 정답률을 직접 채점한 시험이 아니라 선호 평가입니다. 수학 정확도는 FrontierMath 같은 채점형 평가도 함께 확인하세요.

이번 순위에서 읽을 점

  • 1위 gemini-4-argon-high와 2위 claude-fable-5-high의 95% 신뢰 구간이 겹칩니다. 이 집계만으로 두 모델의 순서를 확정하기는 어렵습니다.
  • 1위와 신뢰 구간이 겹치는 모델이 37개 더 있습니다. 작은 순위 차이는 투표 수와 함께 신중히 해석하세요.
  • 상위 10개 중 Anthropic 모델이 7개로 가장 많습니다.
  • 1위 모델이 받은 투표는 255표이고, 이 순위표에는 모델 396개가 있습니다.

수학 LMArena

공개일 2026-10-02 · 가져온 날 2026-10-04

14701500153015601590
Googlegemini-4-argon-high
1530
Anthropicclaude-fable-5-high
1522
Anthropicclaude-opus-5-high
1521
Anthropicclaude-fable-5.1-max
1518
Googlegemini-3.8-flash-high
1517
Anthropicclaude-opus-4-6-high
1517
Anthropicclaude-opus-5.5-high
1510
Metamuse-spark-1.3-max
1509
Anthropicclaude-opus-4-7-high
1504
Googlegemini-3.7-flash-high
1503
Zglm-5.3-flash
1503
DeepSeekdeepseek-v4.1-flash-max
1503
Googlegemini-3.6-flash-high
1501
Moonshot AIkimi-k3-max
1500
Ogpt-5.5
1500
Alibabaqwen3.8-max
1498
Googlegemini-3.5-flash-high
1497
Zglm-5.3-max
1494
Anthropicclaude-opus-4-8-high
1494
Ogpt-5.6-sol-xhigh
1494

점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다. 대화·비전 순위는 LMArena 사이트의 기본값과 같은 '말투·길이 보정(style control)' 순위입니다.

회사별 최고 순위

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-fable-5-high#2
  • MetaMetamuse-spark-1.3-max#9
  • ZZ.aiglm-5.3-flash#13
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#14
  • Moonshot AIMoonshot AIkimi-k3-max#16
  • OOpenAIgpt-5.5#17
  • AlibabaAlibabaqwen3.8-max#18
  • XiaomiXiaomimimo-v2.6-pro#30
표로 보기 (상위 50개)
순위모델만든 곳점수95% 신뢰 구간투표 수
1#1Googlegemini-4-argon-highGoogle15301494–1566255
2#2Anthropicclaude-fable-5-highAnthropic15221509–15361,889
3#3Anthropicclaude-opus-5-highAnthropic15211509–15332,756
4#4Anthropicclaude-fable-5.1-maxAnthropic15181493–1543544
5#5Googlegemini-3.8-flash-highGoogle15171501–15341,274
6#6Anthropicclaude-opus-4-6-highAnthropic15171507–15273,978
7#7Anthropicclaude-opus-5-maxAnthropic15161499–15321,337
8#8Anthropicclaude-opus-5.5-highAnthropic15101475–1546235
9#9Metamuse-spark-1.3-maxMeta15091485–1533586
10#10Anthropicclaude-opus-4-6Anthropic15071497–15164,454
11#11Anthropicclaude-opus-4-7-highAnthropic15041493–15153,260
12#12Googlegemini-3.7-flash-highGoogle15031485–15211,097
13#13Zglm-5.3-flashZ.ai15031485–15211,131
14#14DeepSeekdeepseek-v4.1-flash-maxDeepSeek15031476–1530433
15#15Googlegemini-3.6-flash-highGoogle15011487–15161,736
16#16Moonshot AIkimi-k3-maxMoonshot AI15001483–15171,218
17#17Ogpt-5.5OpenAI15001489–15103,499
18#18Alibabaqwen3.8-maxAlibaba14981480–15151,151
19#19Googlegemini-3.5-flash-highGoogle14971485–15102,361
20#20Zglm-5.3-maxZ.ai14941473–1515739
21#21Anthropicclaude-opus-4-8-highAnthropic14941483–15052,941
22#22Ogpt-5.6-sol-xhighOpenAI14941480–15081,732
23#23Ogpt-5.5-highOpenAI14931483–15033,472
24#24Metamuse-spark-1.1Meta14921478–15071,661
25#25Ogpt-5.4-highOpenAI14921481–15023,379
26#26Anthropicclaude-opus-4-7Anthropic14921481–15023,371
27#27Ogpt-6-astra-maxOpenAI14901463–1517458
28#28Zglm-5.2-maxZ.ai14881475–15012,035
29#29Googlegemini-3.1-pro-previewGoogle14881480–14966,301
30#30Xiaomimimo-v2.6-proXiaomi14871447–1527213
31#31Alibabaqwen3.7-max-previewAlibaba14841446–1523231
32#32Googlegemini-3.5-flash-mediumGoogle14821469–14952,196
33#33Xiaomimimo-v2.5-proXiaomi14811470–14913,356
34#34Thy3Tencent14801455–1505550
35#35Moonshot AIkimi-k2.6Moonshot AI14801467–14932,075
36#36Ogpt-5.6-terra-xhighOpenAI14781464–14931,664
37#37TinklingThinky14781463–14931,581
38#38Baiduernie-5.1Baidu14771464–14911,980
39#39Ogpt-5.6-luna-xhighOpenAI14771463–14911,780
40#40Anthropicclaude-opus-4-8Anthropic14771466–14883,072
41#41Googlegemini-3-proGoogle14771465–14882,761
42#42Alibabaqwen3.6-max-previewAlibaba14761447–1505380
43#43Zglm-5.1Z.ai14751464–14872,860
44#44Googlegemini-3-flashGoogle14741461–14872,060
45#45Anthropicclaude-sonnet-5-highAnthropic14741460–14872,061
46#46xgrok-4.5xAI14731459–14871,752
47#47Xiaomimimo-v2.6-flashXiaomi14721441–1503330
48#48Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14721460–14842,334
49#49Moonshot AIkimi-k2.5-thinkingMoonshot AI14711462–14814,158
50#50Googlegemma-4-31bGoogle14691443–1496432

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings