Epoch AI · 실제 직무 결과물 (GDPval)
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: OpenAI가 만든 GDPval은 여러 직업의 업무 결과물을 모델에게 만들게 하고, 분야 전문가가 모델과 인간 전문가의 결과물을 익명으로 비교하는 평가입니다.
점수 읽는 법: 승리율은 모델 결과물이 인간 전문가의 결과물보다 낫다고 판단된 비율(%)입니다. 승리+동률 비율은 같거나 더 낫다고 판단된 비율이며, 현재 Epoch 기본 그래프는 승리율을 사용합니다.
주의할 점: 전문가 판단과 선정된 업무에 기반한 평가입니다. 업무별 결과가 다를 수 있으므로 표시 지표가 승리율인지 승리+동률인지 확인하세요.
이번 순위에서 읽을 점
- 최고 점수는 GPT-5.2의 49.7%입니다.
- 1위와 5위의 차이는 9.4%p입니다.
- 상위 10개 중 OpenAI 모델이 4개로 가장 많습니다.
- 이 시험 결과가 공개된 모델은 11개입니다.
실제 직무 결과물 (GDPval) Epoch AI
Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04
막대는 정답률(%)입니다. 0%부터 그립니다.
표로 보기 (상위 11개)
| 순위 | 모델 | 만든 곳 | 출시일 | 점수 |
|---|---|---|---|---|
| 1 | #1OGPT-5.2(none) | OpenAI | 2025-12-11 | 49.7% |
| 2 | #2Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 45.5% |
| 3 | #3claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 43.6% |
| 4 | #4Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 42.5% |
| 5 | #5Gemini 3 Pro Preview | 2025-11-18 | 40.3% | |
| 6 | #6OGPT-5(medium) | OpenAI | 2025-08-07 | 34.8% |
| 7 | #7Oo3(medium) | OpenAI | 2025-04-16 | 30.8% |
| 8 | #8Oo4-mini(high) | OpenAI | 2025-04-16 | 25.3% |
| 9 | #9gemini-2.5-pro | 2025-06-05 | 23.3% | |
| 10 | #10xgrok-4-0709_high | xAI | 2025-07-09 | 21.1% |
| 11 | #11OGPT-4o(Nov 2024) | OpenAI | 2024-11-20 | 9.9% |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings