Valumigo

Epoch AI · Tâches informatiques en autonomie (Terminal-Bench)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : Terminal-Bench 2.0 évalue la réalisation de tâches en plusieurs étapes dans un terminal. Il couvre des tâches en ligne de commande comme l’utilisation de programmes, l’installation, la configuration et le débogage.

Comment lire le score : Il s’agit du pourcentage (%) de tâches ayant réussi les tests de notation, parfois présenté comme la moyenne de plusieurs exécutions. L’évaluation porte sur des combinaisons de modèles et d’outils comme Claude Code ou Codex CLI.

Points à surveiller : Le score varie selon les outils et la configuration de l’agent. Pour chaque modèle, Epoch retient la combinaison modèle-agent ayant obtenu le meilleur score : vérifiez aussi les outils d’exécution utilisés.

Ce que révèle ce classement

  • Le meilleur score est de 84.7%, obtenu par GPT-5.5.
  • L’écart entre la 1re et la 5e place est de 4.9%p.
  • Parmi les 10 premiers, les modèles de OpenAI sont les plus nombreux, avec 5 modèles.
  • Les résultats de ce test sont publics pour 30 modèles.

Tâches informatiques en autonomie (Terminal-Bench) Epoch AI

Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04

OGPT-5.5
84.7%
OGPT-5.4
81.8%
GoogleGemini 3.1 Pro Preview
80.2%
AnthropicClaude Opus 4.7
80.2%
AnthropicClaude Opus 4.6
79.8%
OGPT-5.3 Codex
78.4%
GoogleGemini 3 Pro Preview
69.4%
OGPT-5.2 Codex
66.5%
OGPT-5.2
64.9%
GoogleGemini 3 Flash Preview
64.3%
AnthropicClaude Opus 4.5
63.1%
OGPT-5.1 Codex Mini
61.6%
?
61.2%
OGPT-5.1-Codex-Max
60.4%
OGPT-5.1 Codex
57.8%
xgrok-4-20
57.3%
AnthropicClaude Sonnet 4.6
53.4%
ZGLM-5
52.4%
OGPT-5
49.6%
OGPT-5.1
47.6%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Voir le tableau (top 30)
RangModèleDéveloppeurDate de sortieScore
1#1OGPT-5.5(unknown thinking)OpenAI2026-04-2384.7%
2#2OGPT-5.4(unknown thinking)OpenAI2026-03-0581.8%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1980.2%
4#4AnthropicClaude Opus 4.7(unknown)Anthropic2026-04-1680.2%
5#5AnthropicClaude Opus 4.6(unknown thinking)Anthropic2026-02-0579.8%
6#6OGPT-5.3 CodexOpenAI2026-02-0578.4%
7#7GoogleGemini 3 Pro PreviewGoogle2025-11-1869.4%
8#8OGPT-5.2 CodexOpenAI2025-12-1866.5%
9#9OGPT-5.2(unknown thinking)OpenAI2025-12-1164.9%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1764.3%
11#11AnthropicClaude Opus 4.5(unknown thinking)Anthropic2025-11-2463.1%
12#12OGPT-5.1 Codex MiniOpenAI2025-11-1261.6%
13#13??61.2%
14#14OGPT-5.1-Codex-MaxOpenAI2025-11-1960.4%
15#15OGPT-5.1 CodexOpenAI2025-11-1257.8%
16#16xgrok-4-20xAI2026-02-1757.3%
17#17AnthropicClaude Sonnet 4.6(unknown thinking)Anthropic2026-02-1753.4%
18#18ZGLM-5Z.ai2026-02-1152.4%
19#19OGPT-5(unknown thinking)OpenAI2025-08-0749.6%
20#20OGPT-5.1(medium)OpenAI2025-11-1347.6%
21#21AnthropicClaude Sonnet 4.5(unknown thinking)Anthropic2025-09-2946.5%
22#22MiniMaxMiniMax-M2.7MiniMax2026-03-1845.1%
23#23OGPT-5-codexOpenAI2025-09-1544.3%
24#24Moonshot AIKimi K2.5Moonshot AI2026-01-2743.2%
25#25MiniMaxMiniMax-M2.5MiniMax2026-02-1242.7%
26#26DeepSeekDeepSeek-V3.2(Thinking; Novita)DeepSeek2025-12-0139.6%
27#27Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0538.0%
28#28AnthropicClaude Opus 4.1(unknown thinking)Anthropic2025-08-0538.0%
29#29MiniMaxMiniMax-M2.1MiniMax2025-12-2336.6%
30#30Moonshot AIKimi K2 ThinkingMoonshot AI2025-11-0635.7%

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings