Valumigo

Epoch AI · 최고 난도 수학 (FrontierMath)

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: Epoch AI가 전문 수학자들과 만든 FrontierMath의 Tiers 1~3 비공개 평가 세트입니다. 고급 학부 수준부터 초기 연구자 수준까지 포함하며, 평가 문제를 비공개로 유지해 학습 데이터 오염 위험을 줄이려 합니다.

점수 읽는 법: 정답률(%)입니다. 정해진 형식의 답을 Python 객체로 제출하며 자동 채점으로 정답 여부를 평가합니다.

주의할 점: 일반적인 계산이나 숙제 도움 능력과는 다른 기준입니다. 비공개라고 오염 위험이 완전히 사라지는 것은 아니며, 비교할 때 데이터셋 버전과 평가 조건을 확인하세요.

이번 순위에서 읽을 점

  • 최고 점수는 GPT-6.1 Sol의 93.7%입니다.
  • 1위와 5위의 차이는 3.9%p입니다.
  • 상위 10개 중 OpenAI 모델이 6개로 가장 많습니다.
  • 이 시험 결과가 공개된 모델은 30개입니다.

최고 난도 수학 (FrontierMath) Epoch AI

Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04

OGPT-6.1 Sol
93.7%
OGPT-6 Astra
93.7%
AnthropicClaude Opus 5.5
91.2%
AnthropicClaude Fable 5.1
90.2%
OGPT-6 Sol
89.8%
OGPT-5.6 Sol
89.1%
AnthropicClaude Sonnet 5.5
88.8%
OGPT-5.5 Pro
87.7%
AnthropicClaude Fable 5
87.0%
OGPT-5.6 Terra
86.0%
AnthropicClaude Opus 5
85.6%
OGPT-5.5
85.3%
OGPT-5.4 Pro
82.5%
OGPT-5.6 Luna
82.1%
AnthropicClaude Opus 4.8
80.0%
OGPT-6 Luna
78.9%
OGPT-5.4
78.6%
AlibabaQwen3.8 Max
74.7%
MetaMuse Spark 1.3
74.4%
OGPT-5.2 Pro
74.0%

막대는 정답률(%)입니다. 0%부터 그립니다.

표로 보기 (상위 30개)
순위모델만든 곳출시일점수
1#1OGPT-6.1 Sol(max)OpenAI2026-09-2993.7%
2#2OGPT-6 Astra(max)OpenAI2026-09-0393.7%
3#3AnthropicClaude Opus 5.5(max)Anthropic2026-09-2291.2%
4#4AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.2%
5#5OGPT-6 Sol(max)OpenAI2026-09-2289.8%
6#6OGPT-5.6 Sol(max)OpenAI2026-07-0989.1%
7#7AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2888.8%
8#8OGPT-5.5 Pro(xhigh)OpenAI2026-04-2387.7%
9#9AnthropicClaude Fable 5(max)Anthropic2026-06-0987.0%
10#10OGPT-5.6 Terra(max)OpenAI2026-07-0986.0%
11#11AnthropicClaude Opus 5(max)Anthropic2026-07-2485.6%
12#12OGPT-5.5(xhigh)OpenAI2026-04-2385.3%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0582.5%
14#14OGPT-5.6 Luna(max)OpenAI2026-07-0982.1%
15#15AnthropicClaude Opus 4.8Anthropic2026-05-2880.0%
16#16OGPT-6 Luna(max)OpenAI2026-09-2278.9%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0578.6%
18#18AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0274.7%
19#19MetaMuse Spark 1.3(xhigh)Meta2026-09-0274.4%
20#20OGPT-5.2 ProOpenAI2025-12-1174.0%
21#21Moonshot AIKimi K3(max)Moonshot AI2026-07-1672.2%
22#22GoogleGemini 3.7 Flash(high)Google2026-08-1371.6%
23#23AnthropicClaude Opus 4.7(max)Anthropic2026-04-1670.2%
24#24ZGLM-5.3(max)Z.ai2026-08-1468.8%
25#25GoogleGemini 3.8 Flash(high)Google2026-09-0268.4%
26#26OGPT-5.2(xhigh)OpenAI2025-12-1167.4%
27#27xGrok 4.6(xhigh)xAI2026-08-1266.0%
28#28AnthropicClaude Opus 4.6(max)Anthropic2026-02-0566.0%
29#29AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0165.6%
30#30AnthropicClaude Sonnet 5(max)Anthropic2026-06-3065.6%

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings