Valumigo

Epoch AI · 実際のコードのバグ修正(SWE-bench Verified)

公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

このランキングの読み方

測定する能力: 実際のPythonオープンソースリポジトリのGitHubイシューを解決するSWE-bench Verifiedです。元のデータセットは12のリポジトリの500件のイシューで、Epoch独自の評価では実行環境で検証した484件を使用します。

スコアの読み方: 指定の解決検証テストと既存機能の維持を確認するテストを通過したイシューの割合(%)です。実際のリポジトリでのイシュー解決能力を比較する際の参考にしてください。

注意点: スコアはモデルだけでなく、ツールやエージェント設定によっても変わります。Pythonリポジトリが中心で、評価したイシュー数や実行条件も確認してください。

今回のランキングから読み取れること

  • 最高スコアはClaude Opus 4.7の83.5%です。
  • 1位と5位の差は4.8%pです。
  • この試験の結果が公開されているモデルは30件です。

実際のコードのバグ修正(SWE-bench Verified) Epoch AI

Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04

AnthropicClaude Opus 4.7
83.5%
OGPT-5.5
80.6%
GoogleGemini 3.5 Flash
79.3%
AnthropicClaude Opus 4.6
78.7%
ZGLM-5.2
78.7%
DeepSeekDeepSeek v4 Pro
77.6%
AlibabaQwen3.7 Max
77.3%
OGPT-5.4
76.9%
AlibabaQwen 3.6 Max
76.7%
Moonshot AIKimi K2.6
76.7%
AnthropicClaude Opus 4.5
76.7%
GoogleGemini 3.1 Pro Preview
75.6%
GoogleGemini 3 Flash Preview
75.4%
AnthropicClaude Sonnet 4.6
75.2%
OGPT-5.3 Codex
74.8%
ZGLM-5.1
74.2%
Moonshot AIKimi K2.5
73.8%
OGPT-5.2
73.8%
OGPT-5
73.6%
Anthropicclaude-opus-4-1-20250805
73.3%

棒は正答率(%)を示し、0%から描画しています。

表で見る(上位30件)
順位モデル開発元リリース日スコア
1#1AnthropicClaude Opus 4.7(max)Anthropic2026-04-1683.5%
2#2OGPT-5.5(xhigh)OpenAI2026-04-2380.6%
3#3GoogleGemini 3.5 FlashGoogle2026-05-1979.3%
4#4AnthropicClaude Opus 4.6(no thinking)Anthropic2026-02-0578.7%
5#5ZGLM-5.2Z.ai2026-06-1678.7%
6#6DeepSeekDeepSeek v4 Pro(max)DeepSeek2026-04-2477.6%
7#7AlibabaQwen3.7 MaxAlibaba2026-05-1977.3%
8#8OGPT-5.4(high)OpenAI2026-03-0576.9%
9#9AlibabaQwen 3.6 Max(Preview)Alibaba2026-04-2076.7%
10#10Moonshot AIKimi K2.6Moonshot AI2026-04-2076.7%
11#11AnthropicClaude Opus 4.5(no thinking)Anthropic2025-11-2476.7%
12#12GoogleGemini 3.1 Pro PreviewGoogle2026-02-1975.6%
13#13GoogleGemini 3 Flash PreviewGoogle2025-12-1775.4%
14#14AnthropicClaude Sonnet 4.6(no thinking)Anthropic2026-02-1775.2%
15#15OGPT-5.3 Codex(high)OpenAI2026-02-0574.8%
16#16ZGLM-5.1Z.ai2026-04-0774.2%
17#17Moonshot AIKimi K2.5Moonshot AI2026-01-2773.8%
18#18OGPT-5.2(high)OpenAI2025-12-1173.8%
19#19OGPT-5(high)OpenAI2025-08-0773.6%
20#20Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0573.3%
21#21GoogleGemini 3 Pro PreviewGoogle2025-11-1872.9%
22#22ZGLM-5Z.ai2026-02-1172.1%
23#23AnthropicClaude Sonnet 4.5(no thinking)Anthropic2025-09-2971.3%
24#24AnthropicClaude Opus 4Anthropic2025-05-2270.7%
25#25OGPT-5.1(high)OpenAI2025-11-1368.0%
26#26OGPT-5 mini(medium)OpenAI2025-08-0764.7%
27#27Oo3(medium)OpenAI2025-04-1662.3%
28#28Anthropicclaude-3-7-sonnet-20250219Anthropic2025-02-2461.0%
29#29AlibabaQwen 3.6 Plus(2026-04-02)Alibaba2026-03-3157.9%
30#30Googlegemini-2.5-proGoogle2025-06-0557.6%

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings