Valumigo

Epoch AI · Interaction avec l’interface d’un ordinateur (OSWorld 2.0)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : OSWorld 2.0 de XLANG Lab comprend 108 longues tâches de bureau et de navigation web réalisées dans de véritables systèmes d’exploitation. Il s’agit d’un test distinct et plus difficile que l’OSWorld original.

Comment lire le score : L’indicateur par défaut d’Epoch est le taux de réussite complète (%), qui exige de valider tous les points de contrôle d’une tâche. Il diffère d’un score partiel attribué lorsqu’une partie seulement de la tâche est accomplie.

Points à surveiller : Le score varie selon l’environnement d’exécution, la configuration des outils et le nombre d’étapes autorisées. Epoch affiche les résultats avec un budget par défaut de 500 étapes : vérifiez que les conditions sont identiques.

Ce que révèle ce classement

  • Le meilleur score est de 31.4%, obtenu par Claude Opus 5.
  • L’écart entre la 1re et la 5e place est de 18.4%p.
  • Parmi les 9 premiers, les modèles de Anthropic sont les plus nombreux, avec 4 modèles.
  • Les résultats de ce test sont publics pour 9 modèles.

Interaction avec l’interface d’un ordinateur (OSWorld 2.0) Epoch AI

Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04

AnthropicClaude Opus 5
31.4%
OGPT-5.6 Sol
27.3%
AnthropicClaude Opus 4.8
20.6%
AnthropicClaude Opus 4.7
18.2%
OGPT-5.5
13.0%
AnthropicClaude Sonnet 4.6
9.3%
MiniMaxMiniMax-M3
4.6%
Moonshot AIKimi K2.6
4.6%
AlibabaQwen3.7 Plus
2.8%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Voir le tableau (top 9)
RangModèleDéveloppeurDate de sortieScore
1#1AnthropicClaude Opus 5(max)Anthropic2026-07-2431.4%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0927.3%
3#3AnthropicClaude Opus 4.8Anthropic2026-05-2820.6%
4#4AnthropicClaude Opus 4.7(max)Anthropic2026-04-1618.2%
5#5OGPT-5.5(xhigh)OpenAI2026-04-2313.0%
6#6AnthropicClaude Sonnet 4.6(medium)Anthropic2026-02-179.3%
7#7MiniMaxMiniMax-M3MiniMax2026-06-014.6%
8#8Moonshot AIKimi K2.6Moonshot AI2026-04-204.6%
9#9AlibabaQwen3.7 PlusAlibaba2026-06-022.8%

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings