Epoch AI · Correction de bugs réels (SWE-bench Verified)
Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.
Comment lire ce classement
Ce qui est mesuré : SWE-bench Verified consiste à résoudre des tickets GitHub issus de véritables dépôts Python open source. Le jeu de données original comprend 500 tickets provenant de 12 dépôts ; l’évaluation propre à Epoch utilise les 484 tickets validés dans son environnement d’exécution.
Comment lire le score : Il s’agit du pourcentage (%) de tickets pour lesquels les tests de validation de la correction et de non-régression ont réussi. Ce score aide à comparer la capacité à résoudre des tickets dans de véritables dépôts.
Points à surveiller : Le score dépend du modèle, mais aussi des outils et de la configuration de l’agent. L’évaluation porte principalement sur des dépôts Python : vérifiez aussi le nombre de tickets évalués et les conditions d’exécution.
Ce que révèle ce classement
- Le meilleur score est de 83.5%, obtenu par Claude Opus 4.7.
- L’écart entre la 1re et la 5e place est de 4.8%p.
- Les résultats de ce test sont publics pour 30 modèles.
Correction de bugs réels (SWE-bench Verified) Epoch AI
Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04
Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.
Voir le tableau (top 30)
| Rang | Modèle | Développeur | Date de sortie | Score |
|---|---|---|---|---|
| 1 | #1Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 83.5% |
| 2 | #2OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 80.6% |
| 3 | #3Gemini 3.5 Flash | 2026-05-19 | 79.3% | |
| 4 | #4Claude Opus 4.6(no thinking) | Anthropic | 2026-02-05 | 78.7% |
| 5 | #5ZGLM-5.2 | Z.ai | 2026-06-16 | 78.7% |
| 6 | #6DeepSeek v4 Pro(max) | DeepSeek | 2026-04-24 | 77.6% |
| 7 | #7Qwen3.7 Max | Alibaba | 2026-05-19 | 77.3% |
| 8 | #8OGPT-5.4(high) | OpenAI | 2026-03-05 | 76.9% |
| 9 | #9Qwen 3.6 Max(Preview) | Alibaba | 2026-04-20 | 76.7% |
| 10 | #10Kimi K2.6 | Moonshot AI | 2026-04-20 | 76.7% |
| 11 | #11Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 76.7% |
| 12 | #12Gemini 3.1 Pro Preview | 2026-02-19 | 75.6% | |
| 13 | #13Gemini 3 Flash Preview | 2025-12-17 | 75.4% | |
| 14 | #14Claude Sonnet 4.6(no thinking) | Anthropic | 2026-02-17 | 75.2% |
| 15 | #15OGPT-5.3 Codex(high) | OpenAI | 2026-02-05 | 74.8% |
| 16 | #16ZGLM-5.1 | Z.ai | 2026-04-07 | 74.2% |
| 17 | #17Kimi K2.5 | Moonshot AI | 2026-01-27 | 73.8% |
| 18 | #18OGPT-5.2(high) | OpenAI | 2025-12-11 | 73.8% |
| 19 | #19OGPT-5(high) | OpenAI | 2025-08-07 | 73.6% |
| 20 | #20claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 73.3% |
| 21 | #21Gemini 3 Pro Preview | 2025-11-18 | 72.9% | |
| 22 | #22ZGLM-5 | Z.ai | 2026-02-11 | 72.1% |
| 23 | #23Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 71.3% |
| 24 | #24Claude Opus 4 | Anthropic | 2025-05-22 | 70.7% |
| 25 | #25OGPT-5.1(high) | OpenAI | 2025-11-13 | 68.0% |
| 26 | #26OGPT-5 mini(medium) | OpenAI | 2025-08-07 | 64.7% |
| 27 | #27Oo3(medium) | OpenAI | 2025-04-16 | 62.3% |
| 28 | #28claude-3-7-sonnet-20250219 | Anthropic | 2025-02-24 | 61.0% |
| 29 | #29Qwen 3.6 Plus(2026-04-02) | Alibaba | 2026-03-31 | 57.9% |
| 30 | #30gemini-2.5-pro | 2025-06-05 | 57.6% |
Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings