Valumigo

Epoch AI · 리서치 보고서 (DeepResearch Bench)

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: Epoch가 수록한 FutureSearch의 Deep Research Bench는 웹에서 정보를 찾아 종합해 조사 질문에 답하는 능력을 평가합니다. 긴 보고서의 품질을 평가하는 동명의 다른 벤치마크와 구분해야 합니다.

점수 읽는 법: 과제별 정밀도·재현율·F1·정답 여부·확률 판단 오차 등을 이용한 0~1 점수를 집계합니다. 백분율로 표시해도 전체 과제의 해결률이라는 뜻은 아닙니다.

주의할 점: 저장된 웹 자료를 검색하는 RetroSearch와 정해진 에이전트 조건을 사용합니다. 일부 채점에는 AI의 보조 판단이 포함되므로 작은 차이는 평가 조건과 함께 해석하세요.

이번 순위에서 읽을 점

  • 최고 점수는 Claude Opus 4.6의 55.3%입니다.
  • 1위와 5위의 차이는 2.7%p입니다.
  • 상위 10개 중 Anthropic 모델이 6개로 가장 많습니다.
  • 이 시험 결과가 공개된 모델은 25개입니다.

리서치 보고서 (DeepResearch Bench) Epoch AI

Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04

AnthropicClaude Opus 4.6
55.3%
AnthropicClaude Sonnet 4.6
54.9%
AnthropicClaude Opus 4.5
54.8%
OGPT-5.5
54.0%
AnthropicClaude Sonnet 4.5
52.6%
AnthropicClaude Opus 4.8
50.2%
GoogleGemini 3 Flash Preview
49.8%
OGPT-5
49.6%
Anthropicclaude-opus-4-1-20250805
48.3%
GoogleGemini 3.1 Pro Preview
47.8%
xgrok-4-0709
47.3%
AnthropicClaude Opus 4
46.8%
Anthropicclaude-sonnet-4-20250514_2K
46.6%
GoogleGemini 3 Pro Preview
46.3%
AnthropicClaude Haiku 4.5
45.5%
Oo3
45.2%
AnthropicClaude 3.7 Sonnet
43.6%
GoogleGemini 2.5 Pro Preview
42.8%
OGPT-5.1
42.8%
Googlegemini-2.5-pro
41.5%

막대는 정답률(%)입니다. 0%부터 그립니다.

표로 보기 (상위 25개)
순위모델만든 곳출시일점수
1#1AnthropicClaude Opus 4.6(high)Anthropic2026-02-0555.3%
2#2AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1754.9%
3#3AnthropicClaude Opus 4.5(high)Anthropic2025-11-2454.8%
4#4OGPT-5.5(high)OpenAI2026-04-2354.0%
5#5AnthropicClaude Sonnet 4.5(2k thinking)Anthropic2025-09-2952.6%
6#6AnthropicClaude Opus 4.8Anthropic2026-05-2850.2%
7#7GoogleGemini 3 Flash PreviewGoogle2025-12-1749.8%
8#8OGPT-5(low)OpenAI2025-08-0749.6%
9#9Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0548.3%
10#10GoogleGemini 3.1 Pro PreviewGoogle2026-02-1947.8%
11#11xgrok-4-0709xAI2025-07-0947.3%
12#12AnthropicClaude Opus 4Anthropic2025-05-2246.8%
13#13Anthropicclaude-sonnet-4-20250514_2KAnthropic2025-05-2246.6%
14#14GoogleGemini 3 Pro Preview(low)Google2025-11-1846.3%
15#15AnthropicClaude Haiku 4.5(low)Anthropic2025-10-1545.5%
16#16Oo3(medium)OpenAI2025-04-1645.2%
17#17AnthropicClaude 3.7 Sonnet(2k thinking)Anthropic2025-02-2443.6%
18#18GoogleGemini 2.5 Pro Preview(Jun 2025)Google2025-06-0542.8%
19#19OGPT-5.1(low)OpenAI2025-11-1342.8%
20#20Googlegemini-2.5-proGoogle2025-06-0541.5%
21#21OGPT-5.2(low)OpenAI2025-12-1141.1%
22#22GoogleGemini 3.1 Flash-LiteGoogle2026-03-0337.3%
23#23OGPT-5.4 mini(low)OpenAI2026-03-1736.3%
24#24OGPT-5.4(low)OpenAI2026-03-0535.1%
25#25DeepSeekDeepSeek-R1(May 2025)DeepSeek2025-05-2835.1%

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings