Valumigo

Claude Opus 5

Anthropic · 2026-07-24

Informations générales

Développeur
AnthropicAnthropic
Date de sortie
2026-07-24
Indice de capacité globale (ECI)
162.9

Scores aux tests (Epoch AI)

Pour chaque test, nous indiquons également le rang du modèle parmi les modèles évalués.

AnthropicQuestions scientifiques de niveau doctoral (GPQA Diamond) · Rang 12 sur 30
93.9%
AnthropicMathématiques de très haut niveau (FrontierMath) · Rang 11 sur 30
85.6%
AnthropicRaisonnement sur des puzzles inédits (ARC-AGI-2) · Rang 4 sur 30
90.4%
AnthropicExactitude des réponses factuelles (SimpleQA Verified) · Rang 16 sur 30
59.9%
AnthropicInteraction avec l’interface d’un ordinateur (OSWorld 2.0) · Rang 1 sur 9
31.4%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Classement par vote des utilisateurs (LMArena)

Ce classement repose sur les votes de personnes comparant les réponses de deux modèles. Les modèles ne figurent pas dans les classements pour lesquels ils n’ont pas encore reçu suffisamment de votes.

  • GénéralRang 4 sur 413 · 1504
  • FrançaisRang 17 sur 290 · 1506
  • Développement webRang 1 sur 50 · 1815
  • Compréhension de documentsRang 1 sur 44 · 1516
  • Écriture créativeRang 2 sur 411 · 1516
  • ChinoisRang 2 sur 389 · 1571
  • Classement global des agentsRang 2 sur 50 · 0.138
  • MathématiquesRang 3 sur 396 · 1521
  • CoréenRang 3 sur 278 · 1498
  • JaponaisRang 4 sur 274 · 1506
  • Réussite des tâches des agentsRang 4 sur 50 · 0.141
  • AnglaisRang 6 sur 413 · 1506
  • AllemandRang 6 sur 307 · 1506
  • EspagnolRang 10 sur 295 · 1484
  • CodeRang 12 sur 408 · 1538
  • Compréhension d’images (vision)Rang 14 sur 50 · 1289

Où l’utiliser

Les modèles de Anthropic sont principalement disponibles sur Claude. Les modèles accessibles et les quotas d’utilisation varient selon l’abonnement ; consultez la page des tarifs et de l’offre gratuite.

Voir les tarifs et l’offre gratuite de Claude →

Tests pratiques

Pour tenir compte des critiques sur la simplicité de la 1re série, nous avons proposé des bugs répartis sur plusieurs fichiers, une fonctionnalité à implémenter selon une spécification et un bug de concurrence dans une petite boutique en ligne. Nous publions les 18 exécutions et les fichiers des tâches.

Claude Code vs Codex, 2e série : 3 tâches pratiques sur plusieurs fichiers, exécutées 3 fois chacune
Les scores et classements sont reproduits tels quels à partir de sources publiques et ne résultent pas de mesures effectuées par ce site. Les noms des modèles variant légèrement selon les sources, leur correspondance est établie automatiquement ; il peut donc arriver, dans de rares cas, que les données de différentes versions soient mélangées.

Source: Epoch AI (CC BY 4.0) · Vérifié 2026-10-04 · LMArena (CC BY 4.0) · Vérifié 2026-10-04