Epoch AI · Livrables professionnels réels (GDPval)
Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.
Comment lire ce classement
Ce qui est mesuré : GDPval, créé par OpenAI, demande aux modèles de produire des livrables correspondant à différents métiers. Des experts du domaine comparent ensuite anonymement les productions des modèles et celles d’experts humains.
Comment lire le score : Le taux de victoire est le pourcentage (%) de productions du modèle jugées meilleures que celles d’experts humains. Le taux de victoires et égalités correspond aux productions jugées aussi bonnes ou meilleures. Le graphique par défaut d’Epoch utilise actuellement le taux de victoire.
Points à surveiller : L’évaluation repose sur le jugement d’experts et sur une sélection de tâches professionnelles. Les résultats peuvent varier selon les tâches : vérifiez si l’indicateur affiché correspond aux victoires seules ou aux victoires et égalités.
Ce que révèle ce classement
- Le meilleur score est de 49.7%, obtenu par GPT-5.2.
- L’écart entre la 1re et la 5e place est de 9.4%p.
- Parmi les 10 premiers, les modèles de OpenAI sont les plus nombreux, avec 4 modèles.
- Les résultats de ce test sont publics pour 11 modèles.
Livrables professionnels réels (GDPval) Epoch AI
Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04
Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.
Voir le tableau (top 11)
| Rang | Modèle | Développeur | Date de sortie | Score |
|---|---|---|---|---|
| 1 | #1OGPT-5.2(none) | OpenAI | 2025-12-11 | 49.7% |
| 2 | #2Claude Opus 4.5(no thinking) | Anthropic | 2025-11-24 | 45.5% |
| 3 | #3claude-opus-4-1-20250805 | Anthropic | 2025-08-05 | 43.6% |
| 4 | #4Claude Sonnet 4.5(no thinking) | Anthropic | 2025-09-29 | 42.5% |
| 5 | #5Gemini 3 Pro Preview | 2025-11-18 | 40.3% | |
| 6 | #6OGPT-5(medium) | OpenAI | 2025-08-07 | 34.8% |
| 7 | #7Oo3(medium) | OpenAI | 2025-04-16 | 30.8% |
| 8 | #8Oo4-mini(high) | OpenAI | 2025-04-16 | 25.3% |
| 9 | #9gemini-2.5-pro | 2025-06-05 | 23.3% | |
| 10 | #10xgrok-4-0709_high | xAI | 2025-07-09 | 21.1% |
| 11 | #11OGPT-4o(Nov 2024) | OpenAI | 2024-11-20 | 9.9% |
Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings