Valumigo

Epoch AI · 처음 보는 퍼즐 추론 (ARC-AGI-2)

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: ARC Prize Foundation이 만든 ARC-AGI-2입니다. 색 격자의 입력·출력 예시에서 변환 규칙을 추론해 새로운 입력에 적용하며, 사람은 풀 수 있으면서 AI에는 어려운 과제로 설계됐습니다.

점수 읽는 법: 정답 격자를 맞힌 비율(%)입니다. 테스트 입력당 두 번의 답 제출을 허용하는 pass@2 방식으로 평가합니다.

주의할 점: 추론 계산량과 풀이 방식에 따라 점수가 달라질 수 있습니다. 평가 세트, 시도 조건과 문제당 비용을 함께 확인하세요.

이번 순위에서 읽을 점

  • 최고 점수는 GPT-6 Astra의 95.0%입니다.
  • 1위와 5위의 차이는 5.0%p입니다.
  • 상위 10개 중 OpenAI 모델이 4개로 가장 많습니다.
  • 이 시험 결과가 공개된 모델은 30개입니다.

처음 보는 퍼즐 추론 (ARC-AGI-2) Epoch AI

Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04

OGPT-6 Astra
95.0%
OGPT-5.6 Sol
92.5%
AnthropicClaude Opus 5.5
92.5%
AnthropicClaude Opus 5
90.4%
AnthropicClaude Fable 5.1
90.0%
OGPT-6 Sol
89.6%
AnthropicClaude Fable 5
89.2%
OGPT-5.5
85.0%
GoogleGemini 3.7 Flash
84.6%
GoogleGemini 3 Deep Think
84.6%
OGPT-5.5 Pro
84.6%
OGPT-5.6 Terra
83.9%
OGPT-5.4 Pro
83.3%
GoogleGemini 3.1 Pro Preview
77.1%
AnthropicClaude Opus 4.7
75.8%
OGPT-5.4
74.0%
GoogleGemini 3.5 Flash
72.1%
AnthropicClaude Opus 4.8
72.1%
AnthropicClaude Opus 4.6
69.2%
xGrok 4.6
67.1%

막대는 정답률(%)입니다. 0%부터 그립니다.

표로 보기 (상위 30개)
순위모델만든 곳출시일점수
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.0%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0992.5%
3#3AnthropicClaude Opus 5.5(xhigh)Anthropic2026-09-2292.5%
4#4AnthropicClaude Opus 5(max)Anthropic2026-07-2490.4%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.0%
6#6OGPT-6 Sol(max)OpenAI2026-09-2289.6%
7#7AnthropicClaude Fable 5(max)Anthropic2026-06-0989.2%
8#8OGPT-5.5(xhigh)OpenAI2026-04-2385.0%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1384.6%
10#10GoogleGemini 3 Deep ThinkGoogle2026-02-1284.6%
11#11OGPT-5.5 Pro(high)OpenAI2026-04-2384.6%
12#12OGPT-5.6 Terra(max)OpenAI2026-07-0983.9%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0583.3%
14#14GoogleGemini 3.1 Pro PreviewGoogle2026-02-1977.1%
15#15AnthropicClaude Opus 4.7(max)Anthropic2026-04-1675.8%
16#16OGPT-5.4(xhigh)OpenAI2026-03-0574.0%
17#17GoogleGemini 3.5 FlashGoogle2026-05-1972.1%
18#18AnthropicClaude Opus 4.8Anthropic2026-05-2872.1%
19#19AnthropicClaude Opus 4.6(120k thinking)Anthropic2026-02-0569.2%
20#20xGrok 4.6(xhigh)xAI2026-08-1267.1%
21#21xgrok-4-20xAI2026-02-1765.1%
22#22DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3161.4%
23#23DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1361.3%
24#24AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1760.4%
25#25Moonshot AIKimi K3(max)Moonshot AI2026-07-1660.4%
26#26GoogleGemini 3.6 FlashGoogle2026-07-2160.4%
27#27OGPT-5.6 Luna(max)OpenAI2026-07-0959.5%
28#28OGPT-6 Luna(max)OpenAI2026-09-2259.3%
29#29OGPT-5.2 ProOpenAI2025-12-1154.2%
30#30OGPT-5.2(xhigh)OpenAI2025-12-1152.9%

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings