Valumigo

Epoch AI · Razonamiento con acertijos nuevos (ARC-AGI-2)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: ARC-AGI-2 fue creado por ARC Prize Foundation. Consiste en deducir reglas de transformación a partir de ejemplos de entrada y salida de cuadrículas de colores y aplicarlas a nuevas entradas. Está diseñado con tareas que las personas pueden resolver, pero que resultan difíciles para la IA.

Cómo interpretar la puntuación: Es el porcentaje (%) de cuadrículas resueltas correctamente. Se evalúa mediante pass@2, que permite enviar dos respuestas por cada entrada de prueba.

Precauciones: La puntuación puede variar según los recursos de cálculo dedicados al razonamiento y el método de resolución. Comprueba también el conjunto de evaluación, las condiciones de los intentos y el coste por problema.

Claves para interpretar esta clasificación

  • La puntuación más alta es 95.0%, obtenida por GPT-6 Astra.
  • La diferencia entre el 1.º y el 5.º puesto es de 5.0%p.
  • Entre los 10 modelos mejor clasificados, OpenAI tiene la mayor cantidad, con 4 modelos.
  • Hay 30 modelos con resultados publicados para esta prueba.

Razonamiento con acertijos nuevos (ARC-AGI-2) Epoch AI

Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04

OGPT-6 Astra
95.0%
OGPT-5.6 Sol
92.5%
AnthropicClaude Opus 5.5
92.5%
AnthropicClaude Opus 5
90.4%
AnthropicClaude Fable 5.1
90.0%
OGPT-6 Sol
89.6%
AnthropicClaude Fable 5
89.2%
OGPT-5.5
85.0%
GoogleGemini 3.7 Flash
84.6%
GoogleGemini 3 Deep Think
84.6%
OGPT-5.5 Pro
84.6%
OGPT-5.6 Terra
83.9%
OGPT-5.4 Pro
83.3%
GoogleGemini 3.1 Pro Preview
77.1%
AnthropicClaude Opus 4.7
75.8%
OGPT-5.4
74.0%
GoogleGemini 3.5 Flash
72.1%
AnthropicClaude Opus 4.8
72.1%
AnthropicClaude Opus 4.6
69.2%
xGrok 4.6
67.1%

Las barras indican el porcentaje de aciertos y parten del 0%.

Ver tabla (los 30 mejores)
PuestoModeloDesarrolladorFecha de lanzamientoPuntuación
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.0%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0992.5%
3#3AnthropicClaude Opus 5.5(xhigh)Anthropic2026-09-2292.5%
4#4AnthropicClaude Opus 5(max)Anthropic2026-07-2490.4%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.0%
6#6OGPT-6 Sol(max)OpenAI2026-09-2289.6%
7#7AnthropicClaude Fable 5(max)Anthropic2026-06-0989.2%
8#8OGPT-5.5(xhigh)OpenAI2026-04-2385.0%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1384.6%
10#10GoogleGemini 3 Deep ThinkGoogle2026-02-1284.6%
11#11OGPT-5.5 Pro(high)OpenAI2026-04-2384.6%
12#12OGPT-5.6 Terra(max)OpenAI2026-07-0983.9%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0583.3%
14#14GoogleGemini 3.1 Pro PreviewGoogle2026-02-1977.1%
15#15AnthropicClaude Opus 4.7(max)Anthropic2026-04-1675.8%
16#16OGPT-5.4(xhigh)OpenAI2026-03-0574.0%
17#17GoogleGemini 3.5 FlashGoogle2026-05-1972.1%
18#18AnthropicClaude Opus 4.8Anthropic2026-05-2872.1%
19#19AnthropicClaude Opus 4.6(120k thinking)Anthropic2026-02-0569.2%
20#20xGrok 4.6(xhigh)xAI2026-08-1267.1%
21#21xgrok-4-20xAI2026-02-1765.1%
22#22DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3161.4%
23#23DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1361.3%
24#24AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1760.4%
25#25Moonshot AIKimi K3(max)Moonshot AI2026-07-1660.4%
26#26GoogleGemini 3.6 FlashGoogle2026-07-2160.4%
27#27OGPT-5.6 Luna(max)OpenAI2026-07-0959.5%
28#28OGPT-6 Luna(max)OpenAI2026-09-2259.3%
29#29OGPT-5.2 ProOpenAI2025-12-1154.2%
30#30OGPT-5.2(xhigh)OpenAI2025-12-1152.9%

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings