Valumigo

Epoch AI · Raisonnement sur des puzzles inédits (ARC-AGI-2)

Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.

Les scores LMArena proviennent des votes de personnes qui comparent les réponses de deux modèles et choisissent la meilleure (méthode Elo). Si l’écart entre les scores reste dans l’intervalle de confiance, considérez les modèles comme de niveau similaire.

Comment lire ce classement

Ce qui est mesuré : ARC-AGI-2 a été créé par ARC Prize Foundation. Il consiste à déduire une règle de transformation à partir d’exemples d’entrée et de sortie sous forme de grilles colorées, puis à l’appliquer à une nouvelle entrée. Les tâches sont conçues pour être accessibles aux humains tout en restant difficiles pour l’IA.

Comment lire le score : Il s’agit du pourcentage (%) de grilles correctement prédites. L’évaluation utilise la méthode pass@2, qui autorise deux réponses par entrée de test.

Points à surveiller : Le score peut varier selon les ressources de calcul consacrées au raisonnement et la méthode de résolution. Vérifiez aussi le jeu d’évaluation, les conditions des tentatives et le coût par problème.

Ce que révèle ce classement

  • Le meilleur score est de 95.0%, obtenu par GPT-6 Astra.
  • L’écart entre la 1re et la 5e place est de 5.0%p.
  • Parmi les 10 premiers, les modèles de OpenAI sont les plus nombreux, avec 4 modèles.
  • Les résultats de ce test sont publics pour 30 modèles.

Raisonnement sur des puzzles inédits (ARC-AGI-2) Epoch AI

Ces données regroupent les scores mesurés par Epoch AI ou publiés par les développeurs et les organismes d’évaluation. Les modèles évalués varient selon les tests ; certains n’incluent donc pas encore les derniers modèles. Pour chaque modèle, nous affichons le meilleur score obtenu parmi les différents niveaux d’effort de raisonnement. · Récupéré le 2026-10-04

OGPT-6 Astra
95.0%
OGPT-5.6 Sol
92.5%
AnthropicClaude Opus 5.5
92.5%
AnthropicClaude Opus 5
90.4%
AnthropicClaude Fable 5.1
90.0%
OGPT-6 Sol
89.6%
AnthropicClaude Fable 5
89.2%
OGPT-5.5
85.0%
GoogleGemini 3.7 Flash
84.6%
GoogleGemini 3 Deep Think
84.6%
OGPT-5.5 Pro
84.6%
OGPT-5.6 Terra
83.9%
OGPT-5.4 Pro
83.3%
GoogleGemini 3.1 Pro Preview
77.1%
AnthropicClaude Opus 4.7
75.8%
OGPT-5.4
74.0%
GoogleGemini 3.5 Flash
72.1%
AnthropicClaude Opus 4.8
72.1%
AnthropicClaude Opus 4.6
69.2%
xGrok 4.6
67.1%

Les barres indiquent le taux de bonnes réponses (%) et partent de 0 %.

Voir le tableau (top 30)
RangModèleDéveloppeurDate de sortieScore
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.0%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0992.5%
3#3AnthropicClaude Opus 5.5(xhigh)Anthropic2026-09-2292.5%
4#4AnthropicClaude Opus 5(max)Anthropic2026-07-2490.4%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.0%
6#6OGPT-6 Sol(max)OpenAI2026-09-2289.6%
7#7AnthropicClaude Fable 5(max)Anthropic2026-06-0989.2%
8#8OGPT-5.5(xhigh)OpenAI2026-04-2385.0%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1384.6%
10#10GoogleGemini 3 Deep ThinkGoogle2026-02-1284.6%
11#11OGPT-5.5 Pro(high)OpenAI2026-04-2384.6%
12#12OGPT-5.6 Terra(max)OpenAI2026-07-0983.9%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0583.3%
14#14GoogleGemini 3.1 Pro PreviewGoogle2026-02-1977.1%
15#15AnthropicClaude Opus 4.7(max)Anthropic2026-04-1675.8%
16#16OGPT-5.4(xhigh)OpenAI2026-03-0574.0%
17#17GoogleGemini 3.5 FlashGoogle2026-05-1972.1%
18#18AnthropicClaude Opus 4.8Anthropic2026-05-2872.1%
19#19AnthropicClaude Opus 4.6(120k thinking)Anthropic2026-02-0569.2%
20#20xGrok 4.6(xhigh)xAI2026-08-1267.1%
21#21xgrok-4-20xAI2026-02-1765.1%
22#22DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3161.4%
23#23DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1361.3%
24#24AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1760.4%
25#25Moonshot AIKimi K3(max)Moonshot AI2026-07-1660.4%
26#26GoogleGemini 3.6 FlashGoogle2026-07-2160.4%
27#27OGPT-5.6 Luna(max)OpenAI2026-07-0959.5%
28#28OGPT-6 Luna(max)OpenAI2026-09-2259.3%
29#29OGPT-5.2 ProOpenAI2025-12-1154.2%
30#30OGPT-5.2(xhigh)OpenAI2025-12-1152.9%

Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings