Valumigo

Epoch AI · 혼자 컴퓨터 작업하기 (Terminal-Bench)

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: 터미널 환경에서 여러 단계를 거쳐 작업을 완료하는 Terminal-Bench 2.0입니다. 프로그램 사용, 설치·설정·디버깅 등 명령줄 작업을 다룹니다.

점수 읽는 법: 채점 테스트를 통과한 작업의 비율(%)이며, 여러 반복 실행의 평균으로 보고되기도 합니다. Claude Code·Codex CLI 같은 도구와 모델의 조합을 평가합니다.

주의할 점: 에이전트 도구와 설정에 따라 점수가 달라집니다. Epoch의 모델별 대표값은 가장 높은 점수를 낸 모델·에이전트 조합이므로 실행 도구도 함께 확인하세요.

이번 순위에서 읽을 점

  • 최고 점수는 GPT-5.5의 84.7%입니다.
  • 1위와 5위의 차이는 4.9%p입니다.
  • 상위 10개 중 OpenAI 모델이 5개로 가장 많습니다.
  • 이 시험 결과가 공개된 모델은 30개입니다.

혼자 컴퓨터 작업하기 (Terminal-Bench) Epoch AI

Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04

OGPT-5.5
84.7%
OGPT-5.4
81.8%
GoogleGemini 3.1 Pro Preview
80.2%
AnthropicClaude Opus 4.7
80.2%
AnthropicClaude Opus 4.6
79.8%
OGPT-5.3 Codex
78.4%
GoogleGemini 3 Pro Preview
69.4%
OGPT-5.2 Codex
66.5%
OGPT-5.2
64.9%
GoogleGemini 3 Flash Preview
64.3%
AnthropicClaude Opus 4.5
63.1%
OGPT-5.1 Codex Mini
61.6%
?
61.2%
OGPT-5.1-Codex-Max
60.4%
OGPT-5.1 Codex
57.8%
xgrok-4-20
57.3%
AnthropicClaude Sonnet 4.6
53.4%
ZGLM-5
52.4%
OGPT-5
49.6%
OGPT-5.1
47.6%

막대는 정답률(%)입니다. 0%부터 그립니다.

표로 보기 (상위 30개)
순위모델만든 곳출시일점수
1#1OGPT-5.5(unknown thinking)OpenAI2026-04-2384.7%
2#2OGPT-5.4(unknown thinking)OpenAI2026-03-0581.8%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1980.2%
4#4AnthropicClaude Opus 4.7(unknown)Anthropic2026-04-1680.2%
5#5AnthropicClaude Opus 4.6(unknown thinking)Anthropic2026-02-0579.8%
6#6OGPT-5.3 CodexOpenAI2026-02-0578.4%
7#7GoogleGemini 3 Pro PreviewGoogle2025-11-1869.4%
8#8OGPT-5.2 CodexOpenAI2025-12-1866.5%
9#9OGPT-5.2(unknown thinking)OpenAI2025-12-1164.9%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1764.3%
11#11AnthropicClaude Opus 4.5(unknown thinking)Anthropic2025-11-2463.1%
12#12OGPT-5.1 Codex MiniOpenAI2025-11-1261.6%
13#13??61.2%
14#14OGPT-5.1-Codex-MaxOpenAI2025-11-1960.4%
15#15OGPT-5.1 CodexOpenAI2025-11-1257.8%
16#16xgrok-4-20xAI2026-02-1757.3%
17#17AnthropicClaude Sonnet 4.6(unknown thinking)Anthropic2026-02-1753.4%
18#18ZGLM-5Z.ai2026-02-1152.4%
19#19OGPT-5(unknown thinking)OpenAI2025-08-0749.6%
20#20OGPT-5.1(medium)OpenAI2025-11-1347.6%
21#21AnthropicClaude Sonnet 4.5(unknown thinking)Anthropic2025-09-2946.5%
22#22MiniMaxMiniMax-M2.7MiniMax2026-03-1845.1%
23#23OGPT-5-codexOpenAI2025-09-1544.3%
24#24Moonshot AIKimi K2.5Moonshot AI2026-01-2743.2%
25#25MiniMaxMiniMax-M2.5MiniMax2026-02-1242.7%
26#26DeepSeekDeepSeek-V3.2(Thinking; Novita)DeepSeek2025-12-0139.6%
27#27Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0538.0%
28#28AnthropicClaude Opus 4.1(unknown thinking)Anthropic2025-08-0538.0%
29#29MiniMaxMiniMax-M2.1MiniMax2025-12-2336.6%
30#30Moonshot AIKimi K2 ThinkingMoonshot AI2025-11-0635.7%

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings