Valumigo

AI 벤치마크 순위

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

최신 모델 한눈에

최근 120일 안에 나온 모델을 출시일 순으로, 두 공개 출처의 점수를 한 줄에 모았습니다. 점수는 정답률(%)입니다.

모델출시일종합 지수GPQA DiamondFrontierMathHLEARC-AGI-2SWE-bench VerifiedLMArena 종합 순위LMArena 한국어 순위
OGPT-6.1 SolOpenAI2026-09-29–95.493.7–––#60아직 없음
AnthropicClaude Sonnet 5.5Anthropic2026-09-28165.295.688.8–––#34아직 없음
AnthropicClaude Opus 5.5Anthropic2026-09-22167.4–91.2–92.5–#2아직 없음
OGPT-6 SolOpenAI2026-09-22–94.389.8–89.6–#158아직 없음
OGPT-6 LunaOpenAI2026-09-22––78.9–59.3–#163#135
DeepSeekDeepSeek V4.1 FlashDeepSeek2026-09-09155–––––#37아직 없음
OGPT-6 AstraOpenAI2026-09-03166.595.893.754.895–#71아직 없음
GoogleGemini 3.8 FlashGoogle2026-09-02156.995.468.444.5––#8#8
MetaMuse Spark 1.3Meta2026-09-02156.9–74.4–––#12#3
AnthropicClaude Fable 5.1Anthropic2026-09-01164.8–90.246.590–#3#1
AlibabaQwen3.8 Max (0902)Alibaba2026-09-01155.292.365.6–––아직 없음아직 없음
ZGLM-5.3-FlashZ.ai2026-08-20151.9–––––#30#27
ZGLM-5.3Z.ai2026-08-14155.890.968.8–––#26#7
AlibabaQwen 3.8 27BAlibaba2026-08-14149.4–––––#74#64
GoogleGemini 3.7 FlashGoogle2026-08-13157.494.871.6–84.6–#13#6
DeepSeekDeepSeek V4 Pro 0813DeepSeek2026-08-13155.491.7––61.3–아직 없음아직 없음

새 모델은 투표가 충분히 쌓여야 순위표(특히 언어별 순위)에 들어갑니다. 출시 직후에는 '아직 없음'으로 보일 수 있습니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

한국어 LMArena

공개일 2026-10-02 · 가져온 날 2026-10-04

14001450150015501600
Anthropicclaude-fable-5.1-max
1534
Anthropicclaude-opus-5-max
1519
Metamuse-spark-1.3-max
1516
Anthropicclaude-opus-5-high
1511
Anthropicclaude-fable-5-high
1488
Googlegemini-3.7-flash-high
1483
Zglm-5.3-max
1475
Googlegemini-3.8-flash-high
1468
Alibabaqwen3.8-max
1465
Anthropicclaude-opus-4-6
1465
Anthropicclaude-opus-4-7
1464
Ogpt-5.5-high
1461
Metamuse-spark-1.1
1461
Moonshot AIkimi-k3-max
1460
Googlegemini-3.1-pro-preview
1458
Metamuse-spark
1457
Anthropicclaude-opus-4-7-high
1453
Googlegemini-3.5-flash-medium
1452
Ogpt-5.4-high
1450
Anthropicclaude-opus-4-6-high
1450

점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다.

표로 보기 (상위 50개)
순위모델만든 곳점수95% 신뢰 구간투표 수
1Anthropicclaude-fable-5.1-maxAnthropic15341487–1581177
2Anthropicclaude-opus-5-maxAnthropic15191494–1545568
3Metamuse-spark-1.3-maxMeta15161475–1558205
4Anthropicclaude-opus-5-highAnthropic15111492–15311,126
5Anthropicclaude-fable-5-highAnthropic14881465–1511722
6Googlegemini-3.7-flash-highGoogle14831452–1514404
7Zglm-5.3-maxZ.ai14751441–1510298
8Googlegemini-3.8-flash-highGoogle14681440–1497487
9Alibabaqwen3.8-maxAlibaba14651438–1493493
10Anthropicclaude-opus-4-6Anthropic14651448–14821,486
11Anthropicclaude-opus-4-7Anthropic14641446–14831,144
12Ogpt-5.5-highOpenAI14611443–14791,187
13Metamuse-spark-1.1Meta14611438–1484708
14Moonshot AIkimi-k3-maxMoonshot AI14601436–1484615
15Googlegemini-3.1-pro-previewGoogle14581443–14732,145
16Metamuse-sparkMeta14571419–1496252
17Anthropicclaude-opus-4-7-highAnthropic14531434–14731,100
18Googlegemini-3.5-flash-mediumGoogle14521431–1473855
19Ogpt-5.4-highOpenAI14501430–14691,106
20Anthropicclaude-opus-4-6-highAnthropic14501432–14671,310
21Googlegemini-3-proGoogle14491426–1472719
22Googlegemini-3.5-flash-highGoogle14481429–1468960
23Zglm-5.2-maxZ.ai14471427–1468879
24Ogpt-5.5OpenAI14451427–14641,180
25Googlegemini-3-flashGoogle14431418–1469579
26DeepSeekdeepseek-v4-pro-high-20260813DeepSeek14431403–1484195
27Zglm-5.3-flashZ.ai14391408–1469397
28Ogpt-5.4OpenAI14381419–14571,159
29Alibabaqwen3.5-max-previewAlibaba14381409–1467411
30Googlegemini-3.6-flash-highGoogle14381414–1461685
31Ogpt-5.6-sol-xhighOpenAI14361413–1459723
32Xiaomimimo-v2.5-proXiaomi14351417–14531,305
33Googlegemini-2.5-proGoogle14341421–14472,476
34Anthropicclaude-opus-4-8-highAnthropic14331414–14531,094
35Moonshot AIkimi-k2.6Moonshot AI14291406–1452729
36Baiduernie-5.1Baidu14281404–1452654
37DeepSeekdeepseek-v4-pro-high-previewDeepSeek14261407–1446980
38Ogpt-5.6-terra-xhighOpenAI14251403–1448733
39Anthropicclaude-opus-4-5-20251101Anthropic14251407–14431,163
40Anthropicclaude-opus-4-8Anthropic14251405–14441,064
41Zglm-5Z.ai14231397–1448552
42Zglm-5.1Z.ai14201401–14391,113
43Googlegemini-3-flash (thinking-minimal)Google14181401–14351,408
44xgrok-4.20-multi-agent-beta-0309xAI14171397–14361,045
45xgrok-4.20-beta1xAI14161388–1444467
46xgrok-4.20-beta-0309-reasoningxAI14161396–14361,058
47Alibabaqwen3.7-plusAlibaba14161394–1437828
48Ogpt-5.6-luna-xhighOpenAI14141392–1437712
49ByteDancedola-seed-2.0-proByteDance14131395–14301,322
50Moonshot AIkimi-k2.5-thinkingMoonshot AI14121394–14291,355

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarks