Valumigo

Epoch AI · 박사급 과학 문제 (GPQA Diamond)

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: 생물·화학·물리 분야의 대학원 수준 객관식 문제 198개로 구성된 GPQA Diamond입니다. 분야 전문가들이 작성하고 검수했으며, 비전문가가 인터넷을 사용해도 풀기 어렵도록 설계됐습니다.

점수 읽는 법: 정답률(%)입니다. 4개 선택지를 균등하게 무작위로 고르면 기대 정답률은 25%입니다.

주의할 점: 상위 모델의 점수가 만점에 가까워질수록 이 시험만으로 능력 차이를 구분하기 어려울 수 있습니다. 과학 지식과 추론 평가이므로 일상 업무 능력과는 다를 수 있습니다.

이번 순위에서 읽을 점

  • 최고 점수는 GPT-6 Astra의 95.8%입니다.
  • 1위와 5위의 차이는 1.0%p입니다.
  • 상위 10개 중 OpenAI 모델이 4개로 가장 많습니다.
  • 이 시험 결과가 공개된 모델은 30개입니다.

박사급 과학 문제 (GPQA Diamond) Epoch AI

Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04

OGPT-6 Astra
95.8%
AnthropicClaude Sonnet 5.5
95.6%
OGPT-6.1 Sol
95.4%
GoogleGemini 3.8 Flash
95.4%
GoogleGemini 3.7 Flash
94.8%
OGPT-5.4 Pro
94.6%
GoogleGemini 3.1 Pro Preview
94.4%
OGPT-6 Sol
94.3%
GoogleGemini 3.6 Flash
94.1%
xGrok 4.6
94.0%
OGPT-5.5
94.0%
OGPT-5.5 Pro
93.9%
AnthropicClaude Opus 5
93.9%
OGPT-5.6 Sol
93.5%
xGrok 4.5
93.4%
OGPT-5.6 Terra
93.3%
OGPT-5.4
93.3%
Moonshot AIKimi K3
93.1%
GoogleGemini 3.5 Flash
92.8%
xGrok 4.7
92.7%

막대는 정답률(%)입니다. 0%부터 그립니다.

표로 보기 (상위 30개)
순위모델만든 곳출시일점수
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.8%
2#2AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2895.6%
3#3OGPT-6.1 Sol(max)OpenAI2026-09-2995.4%
4#4GoogleGemini 3.8 Flash(high)Google2026-09-0295.4%
5#5GoogleGemini 3.7 Flash(high)Google2026-08-1394.8%
6#6OGPT-5.4 Pro(xhigh)OpenAI2026-03-0594.6%
7#7GoogleGemini 3.1 Pro PreviewGoogle2026-02-1994.4%
8#8OGPT-6 Sol(max)OpenAI2026-09-2294.3%
9#9GoogleGemini 3.6 FlashGoogle2026-07-2194.1%
10#10xGrok 4.6(high)xAI2026-08-1294.0%
11#11OGPT-5.5(xhigh)OpenAI2026-04-2394.0%
12#12OGPT-5.5 Pro(xhigh)OpenAI2026-04-2393.9%
13#13AnthropicClaude Opus 5(max)Anthropic2026-07-2493.9%
14#14OGPT-5.6 Sol(max)OpenAI2026-07-0993.5%
15#15xGrok 4.5(high)xAI2026-07-0893.4%
16#16OGPT-5.6 Terra(max)OpenAI2026-07-0993.3%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0593.3%
18#18Moonshot AIKimi K3(max)Moonshot AI2026-07-1693.1%
19#19GoogleGemini 3.5 FlashGoogle2026-05-1992.8%
20#20xGrok 4.7(xhigh)xAI2026-09-2192.7%
21#21AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0292.7%
22#22GoogleGemini 3 Pro PreviewGoogle2025-11-1892.6%
23#23AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0192.3%
24#24ZGLM-5.2Z.ai2026-06-1691.9%
25#25DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1391.7%
26#26OGPT-5.6 Luna(max)OpenAI2026-07-0991.6%
27#27OGPT-5.2(xhigh)OpenAI2025-12-1191.4%
28#28AnthropicClaude Opus 4.8Anthropic2026-05-2891.0%
29#29DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3191.0%
30#30ZGLM-5.3(max)Z.ai2026-08-1490.9%

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings