Epoch AI · 実際のコードのバグ修正(SWE-bench Verified)
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: 実際のPythonオープンソースリポジトリのGitHubイシューを解決するSWE-bench Verifiedです。元のデータセットは12のリポジトリの500件のイシューで、Epoch独自の評価では実行環境で検証した484件を使用します。
スコアの読み方: 指定の解決検証テストと既存機能の維持を確認するテストを通過したイシューの割合(%)です。実際のリポジトリでのイシュー解決能力を比較する際の参考にしてください。
注意点: スコアはモデルだけでなく、ツールやエージェント設定によっても変わります。Pythonリポジトリが中心で、評価したイシュー数や実行条件も確認してください。
今回のランキングから読み取れること
- 最高スコアはClaude Opus 4.7の83.5%です。
- 1位と5位の差は4.8%pです。
- この試験の結果が公開されているモデルは30件です。
実際のコードのバグ修正(SWE-bench Verified) Epoch AI
Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04
棒は正答率(%)を示し、0%から描画しています。
表で見る(上位30件)
| 順位 | モデル | 開発元 | リリース日 | スコア |
|---|---|---|---|---|
| 1 | #1Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 83.5% |
| 2 | #2OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 80.6% |
| 3 | #3Gemini 3.5 Flash | 2026-05-19 | 79.3% | |
| 4 | #4Claude Opus 4.6(no thinking) | Anthropic | 2026-02-05 | 78.7% |
| 5 | #5ZGLM-5.2 | Z.ai | 2026-06-16 | 78.7% |
| 6 | #6DeepSeek v4 Pro(max) | DeepSeek | 2026-04-24 | 77.6% |
| 7 | #7Qwen3.7 Max | Alibaba | 2026-05-19 | 77.3% |
| 8 | #8OGPT-5.4(high) | OpenAI | 2026-03-05 | 76.9% |
| 9 | #9Qwen 3.6 Max(Preview) | Alibaba | 2026-04-20 | 76.7% |
| 10 | #10Kimi K2.6 | Moonshot AI | 2026-04-20 | 76.7% |
| 11 | #11Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 76.7% |
| 12 | #12Gemini 3.1 Pro Preview | 2026-02-19 | 75.6% | |
| 13 | #13Gemini 3 Flash Preview | 2025-12-17 | 75.4% | |
| 14 | #14Claude Sonnet 4.6(no thinking) | Anthropic | 2026-02-17 | 75.2% |
| 15 | #15OGPT-5.3 Codex(high) | OpenAI | 2026-02-05 | 74.8% |
| 16 | #16ZGLM-5.1 | Z.ai | 2026-04-07 | 74.2% |
| 17 | #17Kimi K2.5 | Moonshot AI | 2026-01-27 | 73.8% |
| 18 | #18OGPT-5.2(high) | OpenAI | 2025-12-11 | 73.8% |
| 19 | #19OGPT-5(high) | OpenAI | 2025-08-07 | 73.6% |
| 20 | #20claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 73.3% |
| 21 | #21Gemini 3 Pro Preview | 2025-11-18 | 72.9% | |
| 22 | #22ZGLM-5 | Z.ai | 2026-02-11 | 72.1% |
| 23 | #23Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 71.3% |
| 24 | #24Claude Opus 4 | Anthropic | 2025-05-22 | 70.7% |
| 25 | #25OGPT-5.1(high) | OpenAI | 2025-11-13 | 68.0% |
| 26 | #26OGPT-5 mini(medium) | OpenAI | 2025-08-07 | 64.7% |
| 27 | #27Oo3(medium) | OpenAI | 2025-04-16 | 62.3% |
| 28 | #28claude-3-7-sonnet-20250219 | Anthropic | 2025-02-24 | 61.0% |
| 29 | #29Qwen 3.6 Plus(2026-04-02) | Alibaba | 2026-03-31 | 57.9% |
| 30 | #30gemini-2.5-pro | 2025-06-05 | 57.6% |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings