Valumigo

Epoch AI · Correction de bugs réels (SWE-bench Verified)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : SWE-bench Verified consiste à résoudre des tickets GitHub issus de véritables dépôts Python open source. Le jeu de données original comprend 500 tickets provenant de 12 dépôts ; l’évaluation propre à Epoch utilise les 484 tickets validés dans son environnement d’exécution.

Comment lire le score : Il s’agit du pourcentage (%) de tickets pour lesquels les tests de validation de la correction et de non-régression ont réussi. Ce score aide à comparer la capacité à résoudre des tickets dans de véritables dépôts.

Points à surveiller : Le score dépend du modèle, mais aussi des outils et de la configuration de l’agent. L’évaluation porte principalement sur des dépôts Python : vérifiez aussi le nombre de tickets évalués et les conditions d’exécution.

Ce que révèle ce classement

  • Le meilleur score est de 83.5%, obtenu par Claude Opus 4.7.
  • L’écart entre la 1re et la 5e place est de 4.8%p.
  • Les résultats de ce test sont publics pour 30 modèles.

Correction de bugs réels (SWE-bench Verified) Epoch AI

Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04

AnthropicClaude Opus 4.7
83.5%
OGPT-5.5
80.6%
GoogleGemini 3.5 Flash
79.3%
AnthropicClaude Opus 4.6
78.7%
ZGLM-5.2
78.7%
DeepSeekDeepSeek v4 Pro
77.6%
AlibabaQwen3.7 Max
77.3%
OGPT-5.4
76.9%
AlibabaQwen 3.6 Max
76.7%
Moonshot AIKimi K2.6
76.7%
AnthropicClaude Opus 4.5
76.7%
GoogleGemini 3.1 Pro Preview
75.6%
GoogleGemini 3 Flash Preview
75.4%
AnthropicClaude Sonnet 4.6
75.2%
OGPT-5.3 Codex
74.8%
ZGLM-5.1
74.2%
Moonshot AIKimi K2.5
73.8%
OGPT-5.2
73.8%
OGPT-5
73.6%
Anthropicclaude-opus-4-1-20250805
73.3%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Voir le tableau (top 30)
RangModèleDéveloppeurDate de sortieScore
1#1AnthropicClaude Opus 4.7(max)Anthropic2026-04-1683.5%
2#2OGPT-5.5(xhigh)OpenAI2026-04-2380.6%
3#3GoogleGemini 3.5 FlashGoogle2026-05-1979.3%
4#4AnthropicClaude Opus 4.6(no thinking)Anthropic2026-02-0578.7%
5#5ZGLM-5.2Z.ai2026-06-1678.7%
6#6DeepSeekDeepSeek v4 Pro(max)DeepSeek2026-04-2477.6%
7#7AlibabaQwen3.7 MaxAlibaba2026-05-1977.3%
8#8OGPT-5.4(high)OpenAI2026-03-0576.9%
9#9AlibabaQwen 3.6 Max(Preview)Alibaba2026-04-2076.7%
10#10Moonshot AIKimi K2.6Moonshot AI2026-04-2076.7%
11#11AnthropicClaude Opus 4.5(no thinking)Anthropic2025-11-2476.7%
12#12GoogleGemini 3.1 Pro PreviewGoogle2026-02-1975.6%
13#13GoogleGemini 3 Flash PreviewGoogle2025-12-1775.4%
14#14AnthropicClaude Sonnet 4.6(no thinking)Anthropic2026-02-1775.2%
15#15OGPT-5.3 Codex(high)OpenAI2026-02-0574.8%
16#16ZGLM-5.1Z.ai2026-04-0774.2%
17#17Moonshot AIKimi K2.5Moonshot AI2026-01-2773.8%
18#18OGPT-5.2(high)OpenAI2025-12-1173.8%
19#19OGPT-5(high)OpenAI2025-08-0773.6%
20#20Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0573.3%
21#21GoogleGemini 3 Pro PreviewGoogle2025-11-1872.9%
22#22ZGLM-5Z.ai2026-02-1172.1%
23#23AnthropicClaude Sonnet 4.5(no thinking)Anthropic2025-09-2971.3%
24#24AnthropicClaude Opus 4Anthropic2025-05-2270.7%
25#25OGPT-5.1(high)OpenAI2025-11-1368.0%
26#26OGPT-5 mini(medium)OpenAI2025-08-0764.7%
27#27Oo3(medium)OpenAI2025-04-1662.3%
28#28Anthropicclaude-3-7-sonnet-20250219Anthropic2025-02-2461.0%
29#29AlibabaQwen 3.6 Plus(2026-04-02)Alibaba2026-03-3157.9%
30#30Googlegemini-2.5-proGoogle2025-06-0557.6%

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings