Valumigo

Epoch AI · Interacción con interfaces de ordenador (OSWorld 2.0)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: OSWorld 2.0 de XLANG Lab es una evaluación compuesta por 108 tareas prolongadas de escritorio y web realizadas en sistemas operativos reales. Es una prueba independiente y más difícil que el OSWorld original.

Cómo interpretar la puntuación: La métrica predeterminada de Epoch es la tasa de éxito completo (%): tareas que superan todos los puntos de control de la evaluación. Es distinta de las puntuaciones parciales por completar solo una parte.

Precauciones: La puntuación varía según el entorno de ejecución, la configuración de las herramientas y el número de pasos permitidos. Epoch muestra resultados con un límite predeterminado de 500 pasos, por lo que debes comprobar que las condiciones sean las mismas.

Claves para interpretar esta clasificación

  • La puntuación más alta es 31.4%, obtenida por Claude Opus 5.
  • La diferencia entre el 1.º y el 5.º puesto es de 18.4%p.
  • Entre los 9 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 4 modelos.
  • Hay 9 modelos con resultados publicados para esta prueba.

Interacción con interfaces de ordenador (OSWorld 2.0) Epoch AI

Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04

AnthropicClaude Opus 5
31.4%
OGPT-5.6 Sol
27.3%
AnthropicClaude Opus 4.8
20.6%
AnthropicClaude Opus 4.7
18.2%
OGPT-5.5
13.0%
AnthropicClaude Sonnet 4.6
9.3%
MiniMaxMiniMax-M3
4.6%
Moonshot AIKimi K2.6
4.6%
AlibabaQwen3.7 Plus
2.8%

Las barras indican el porcentaje de aciertos y parten del 0%.

Ver tabla (los 9 mejores)
PuestoModeloDesarrolladorFecha de lanzamientoPuntuación
1#1AnthropicClaude Opus 5(max)Anthropic2026-07-2431.4%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0927.3%
3#3AnthropicClaude Opus 4.8Anthropic2026-05-2820.6%
4#4AnthropicClaude Opus 4.7(max)Anthropic2026-04-1618.2%
5#5OGPT-5.5(xhigh)OpenAI2026-04-2313.0%
6#6AnthropicClaude Sonnet 4.6(medium)Anthropic2026-02-179.3%
7#7MiniMaxMiniMax-M3MiniMax2026-06-014.6%
8#8Moonshot AIKimi K2.6Moonshot AI2026-04-204.6%
9#9AlibabaQwen3.7 PlusAlibaba2026-06-022.8%

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings