Epoch AI · 실제 코드 버그 고치기 (SWE-bench Verified)
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: 실제 Python 오픈소스 저장소의 GitHub 이슈를 해결하는 SWE-bench Verified입니다. 원 데이터셋은 12개 저장소의 이슈 500개이며, Epoch 자체 평가는 실행 환경에서 검증한 484개를 사용합니다.
점수 읽는 법: 지정된 해결 검증 테스트와 기존 기능 보존 테스트를 통과한 이슈의 비율(%)입니다. 실제 저장소의 이슈 해결 능력을 비교할 때 참고하세요.
주의할 점: 점수는 모델뿐 아니라 도구와 에이전트 설정에 따라 달라집니다. Python 저장소 중심이며, 평가한 이슈 수와 실행 조건도 함께 확인하세요.
이번 순위에서 읽을 점
- 최고 점수는 Claude Opus 4.7의 83.5%입니다.
- 1위와 5위의 차이는 4.8%p입니다.
- 이 시험 결과가 공개된 모델은 30개입니다.
실제 코드 버그 고치기 (SWE-bench Verified) Epoch AI
Epoch AI가 직접 측정했거나 개발사·평가 기관이 발표한 점수를 모은 자료입니다. 시험마다 평가된 모델이 달라서, 최신 모델이 아직 없는 시험도 있습니다. 같은 모델의 추론 강도별 결과 중 가장 높은 점수를 보여 줍니다. · 가져온 날 2026-10-04
막대는 정답률(%)입니다. 0%부터 그립니다.
표로 보기 (상위 30개)
| 순위 | 모델 | 만든 곳 | 출시일 | 점수 |
|---|---|---|---|---|
| 1 | #1Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 83.5% |
| 2 | #2OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 80.6% |
| 3 | #3Gemini 3.5 Flash | 2026-05-19 | 79.3% | |
| 4 | #4Claude Opus 4.6(no thinking) | Anthropic | 2026-02-05 | 78.7% |
| 5 | #5ZGLM-5.2 | Z.ai | 2026-06-16 | 78.7% |
| 6 | #6DeepSeek v4 Pro(max) | DeepSeek | 2026-04-24 | 77.6% |
| 7 | #7Qwen3.7 Max | Alibaba | 2026-05-19 | 77.3% |
| 8 | #8OGPT-5.4(high) | OpenAI | 2026-03-05 | 76.9% |
| 9 | #9Qwen 3.6 Max(Preview) | Alibaba | 2026-04-20 | 76.7% |
| 10 | #10Kimi K2.6 | Moonshot AI | 2026-04-20 | 76.7% |
| 11 | #11Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 76.7% |
| 12 | #12Gemini 3.1 Pro Preview | 2026-02-19 | 75.6% | |
| 13 | #13Gemini 3 Flash Preview | 2025-12-17 | 75.4% | |
| 14 | #14Claude Sonnet 4.6(no thinking) | Anthropic | 2026-02-17 | 75.2% |
| 15 | #15OGPT-5.3 Codex(high) | OpenAI | 2026-02-05 | 74.8% |
| 16 | #16ZGLM-5.1 | Z.ai | 2026-04-07 | 74.2% |
| 17 | #17Kimi K2.5 | Moonshot AI | 2026-01-27 | 73.8% |
| 18 | #18OGPT-5.2(high) | OpenAI | 2025-12-11 | 73.8% |
| 19 | #19OGPT-5(high) | OpenAI | 2025-08-07 | 73.6% |
| 20 | #20claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 73.3% |
| 21 | #21Gemini 3 Pro Preview | 2025-11-18 | 72.9% | |
| 22 | #22ZGLM-5 | Z.ai | 2026-02-11 | 72.1% |
| 23 | #23Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 71.3% |
| 24 | #24Claude Opus 4 | Anthropic | 2025-05-22 | 70.7% |
| 25 | #25OGPT-5.1(high) | OpenAI | 2025-11-13 | 68.0% |
| 26 | #26OGPT-5 mini(medium) | OpenAI | 2025-08-07 | 64.7% |
| 27 | #27Oo3(medium) | OpenAI | 2025-04-16 | 62.3% |
| 28 | #28claude-3-7-sonnet-20250219 | Anthropic | 2025-02-24 | 61.0% |
| 29 | #29Qwen 3.6 Plus(2026-04-02) | Alibaba | 2026-03-31 | 57.9% |
| 30 | #30gemini-2.5-pro | 2025-06-05 | 57.6% |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings