Valumigo

Epoch AI · 사실 질문 정확도 (SimpleQA Verified)

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: 짧은 사실 질문에 정확히 답하는지 평가하는 SimpleQA Verified입니다. Google DeepMind·Google Research가 OpenAI의 SimpleQA를 바탕으로 중복과 정답 오류 등을 줄인 1,000문항 평가입니다.

점수 읽는 법: Epoch가 표시하는 값은 전체 질문 중 정답을 낸 비율(%)입니다. Google 공식 평가의 F1 지표와 다르며, 이 점수만으로 환각이나 답변 거절 성향을 모두 평가할 수는 없습니다.

주의할 점: 검색 도구 없이 모델 내부 지식으로 답하는 조건이므로 검색을 켠 서비스의 정확도와는 다를 수 있습니다. Epoch는 답변 거절을 줄이는 추가 지시를 사용합니다.

이번 순위에서 읽을 점

  • 최고 점수는 GPT-6 Astra의 75.6%입니다.
  • 1위와 5위의 차이는 4.8%p입니다.
  • 상위 10개 중 Google 모델이 4개로 가장 많습니다.
  • 이 시험 결과가 공개된 모델은 30개입니다.

사실 질문 정확도 (SimpleQA Verified) Epoch AI

Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04

OGPT-6 Astra
75.6%
OGPT-6.1 Sol
73.9%
GoogleGemini 3.1 Pro Preview
73.5%
AnthropicClaude Opus 5.5
72.2%
AnthropicClaude Fable 5.1
70.8%
AnthropicClaude Fable 5
70.7%
GoogleGemini 3.8 Flash
69.7%
OGPT-5.6 Sol
69.7%
GoogleGemini 3.7 Flash
69.2%
GoogleGemini 3 Flash Preview
66.8%
GoogleGemini 3.5 Flash
66.2%
GoogleGemini 3.6 Flash
66.2%
OGPT-5.5
63.0%
OGPT-6 Sol
60.7%
MetaMuse Spark 1.2
60.3%
AnthropicClaude Opus 5
59.9%
MetaMuse Spark 1.1
57.8%
xGrok 4.7
56.0%
AlibabaQwen3.7 Max
55.8%
AnthropicClaude Opus 4.8
53.0%

막대는 정답률(%)입니다. 0%부터 그립니다.

표로 보기 (상위 30개)
순위모델만든 곳출시일점수
1#1OGPT-6 Astra(max)OpenAI2026-09-0375.6%
2#2OGPT-6.1 Sol(max)OpenAI2026-09-2973.9%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1973.5%
4#4AnthropicClaude Opus 5.5(max)Anthropic2026-09-2272.2%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0170.8%
6#6AnthropicClaude Fable 5(xhigh)Anthropic2026-06-0970.7%
7#7GoogleGemini 3.8 Flash(high)Google2026-09-0269.7%
8#8OGPT-5.6 Sol(max)OpenAI2026-07-0969.7%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1369.2%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1766.8%
11#11GoogleGemini 3.5 FlashGoogle2026-05-1966.2%
12#12GoogleGemini 3.6 FlashGoogle2026-07-2166.2%
13#13OGPT-5.5(xhigh)OpenAI2026-04-2363.0%
14#14OGPT-6 Sol(max)OpenAI2026-09-2260.7%
15#15MetaMuse Spark 1.2(xhigh)Meta2026-08-0560.3%
16#16AnthropicClaude Opus 5(max)Anthropic2026-07-2459.9%
17#17MetaMuse Spark 1.1Meta2026-07-0957.8%
18#18xGrok 4.7(xhigh)xAI2026-09-2156.0%
19#19AlibabaQwen3.7 MaxAlibaba2026-05-1955.8%
20#20AnthropicClaude Opus 4.8Anthropic2026-05-2853.0%
21#21DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1352.9%
22#22AlibabaQwen 3.6 Max(Preview)Alibaba2026-04-2052.0%
23#23AnthropicClaude Opus 4.7(xhigh)Anthropic2026-04-1651.7%
24#24Moonshot AIKimi K3(max)Moonshot AI2026-07-1650.6%
25#25OGPT-5(high)OpenAI2025-08-0750.1%
26#26Oo3(high)OpenAI2025-04-1649.4%
27#27xGrok 4.6(high)xAI2026-08-1249.3%
28#28AlibabaQwen3-Max-InstructAlibaba2025-09-2448.7%
29#29xGrok 4.5(high)xAI2026-07-0848.3%
30#30OGPT-5.1(high)OpenAI2025-11-1348.0%

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings