Epoch AI · 분야별 최고 난도 문제 (HLE)
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: Center for AI Safety와 Scale AI가 만든 Humanity's Last Exam입니다. 여러 분야 전문가들이 작성한 공개 문제 2,500개로 구성되며, 기존 벤치마크의 포화에 대응해 개발됐습니다.
점수 읽는 법: 정답률(%)입니다. 고난도 지식과 추론을 평가하며, 점수는 모델과 도구 사용 조건에 따라 달라집니다.
주의할 점: 문항과 정답·채점의 오류가 지적됐습니다. 작은 점수 차이는 문항 결함, 평가 조건과 통계적 불확실성을 함께 확인해 해석하세요.
이번 순위에서 읽을 점
- 최고 점수는 GPT-6 Astra의 54.8%입니다.
- 1위와 5위의 차이는 10.5%p입니다.
- 상위 10개 중 OpenAI 모델이 3개로 가장 많습니다.
- 이 시험 결과가 공개된 모델은 30개입니다.
분야별 최고 난도 문제 (HLE) Epoch AI
Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04
막대는 정답률(%)입니다. 0%부터 그립니다.
표로 보기 (상위 30개)
| 순위 | 모델 | 만든 곳 | 출시일 | 점수 |
|---|---|---|---|---|
| 1 | #1OGPT-6 Astra(unknown thinking) | OpenAI | 2026-09-03 | 54.8% |
| 2 | #2Claude Fable 5.1(xhigh) | Anthropic | 2026-09-01 | 46.5% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 46.4% | |
| 4 | #4Gemini 3.8 Flash(unknown) | 2026-09-02 | 44.5% | |
| 5 | #5OGPT-5.4 Pro | OpenAI | 2026-03-05 | 44.3% |
| 6 | #6Muse Spark | Meta | 2026-04-08 | 40.6% |
| 7 | #7Gemini 3 Pro Preview | 2025-11-18 | 37.5% | |
| 8 | #8OGPT-5.4(xhigh) | OpenAI | 2026-03-05 | 36.2% |
| 9 | #9Claude Opus 4.7(unknown) | Anthropic | 2026-04-16 | 36.2% |
| 10 | #10Claude Opus 4.6(max) | Anthropic | 2026-02-05 | 34.4% |
| 11 | #11OGPT-5 Pro | OpenAI | 2025-10-07 | 31.6% |
| 12 | #12OGPT-5.2(unknown thinking) | OpenAI | 2025-12-11 | 27.8% |
| 13 | #13OGPT-5(high) | OpenAI | 2025-08-07 | 25.3% |
| 14 | #14Claude Opus 4.5(unknown thinking) | Anthropic | 2025-11-24 | 25.2% |
| 15 | #15Kimi K2.5 | Moonshot AI | 2026-01-27 | 24.4% |
| 16 | #16OGPT-5.1(unknown thinking) | OpenAI | 2025-11-13 | 23.7% |
| 17 | #17Gemini 2.5 Pro Preview(Jun 2025) | 2025-06-05 | 21.6% | |
| 18 | #18Oo3(high) | OpenAI | 2025-04-16 | 20.3% |
| 19 | #19OGPT-5 mini(unknown thinking) | OpenAI | 2025-08-07 | 19.4% |
| 20 | #20Gemini 2.5 Pro Exp(Mar 2025) | 2025-03-25 | 18.2% | |
| 21 | #21Oo4-mini(high) | OpenAI | 2025-04-16 | 18.1% |
| 22 | #22Claude Sonnet 4.5(unknown thinking) | Anthropic | 2025-09-29 | 13.7% |
| 23 | #23Gemini 2.5 Flash Preview(Apr 2025) | 2025-04-17 | 12.1% | |
| 24 | #24Claude Opus 4.1(unknown thinking) | Anthropic | 2025-08-05 | 11.5% |
| 25 | #25gemini-2.5-flash-preview-05-20 | 2025-05-20 | 11.0% | |
| 26 | #26Claude Opus 4 | Anthropic | 2025-05-22 | 10.7% |
| 27 | #27Gemini 3.1 Flash-Lite | 2026-03-03 | 8.6% | |
| 28 | #28Zglm-4.5 | Z.ai | 2025-08-03 | 8.3% |
| 29 | #29ZGLM-4.5-Air | Z.ai | 2025-07-20 | 8.1% |
| 30 | #30Oo1 Pro | OpenAI | 2025-03-19 | 8.1% |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings