Valumigo

LMArena · Matemáticas

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Es una clasificación basada en los votos de preguntas clasificadas como matemáticas en las conversaciones de texto de LMArena.

Cómo interpretar la puntuación: Es una puntuación relativa de los modelos preferidos por los usuarios en respuestas sobre matemáticas. Los modelos con pocos votos pueden tener intervalos de confianza amplios.

Precauciones: Es una evaluación de preferencias, no una prueba que puntúe directamente la tasa de aciertos. Para comprobar la precisión matemática, consulta también evaluaciones con corrección de respuestas como FrontierMath.

Claves para interpretar esta clasificación

  • Los intervalos de confianza del 95% de gemini-4-argon-high, en 1.º lugar, y claude-fable-5-high, en 2.º, se solapan. Esta agregación por sí sola no permite establecer con certeza el orden de ambos modelos.
  • Hay otros 37 modelos cuyos intervalos de confianza se solapan con el del 1.º. Interpreta con cautela las diferencias pequeñas de posición, teniendo en cuenta el número de votos.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 7 modelos.
  • El modelo en 1.º lugar recibió 255 votos y esta clasificación incluye 396 modelos.

Matemáticas LMArena

Publicado el 2026-10-02 · Obtenido el 2026-10-04

14701500153015601590
Googlegemini-4-argon-high
1530
Anthropicclaude-fable-5-high
1522
Anthropicclaude-opus-5-high
1521
Anthropicclaude-fable-5.1-max
1518
Googlegemini-3.8-flash-high
1517
Anthropicclaude-opus-4-6-high
1517
Anthropicclaude-opus-5.5-high
1510
Metamuse-spark-1.3-max
1509
Anthropicclaude-opus-4-7-high
1504
Googlegemini-3.7-flash-high
1503
Zglm-5.3-flash
1503
DeepSeekdeepseek-v4.1-flash-max
1503
Googlegemini-3.6-flash-high
1501
Moonshot AIkimi-k3-max
1500
Ogpt-5.5
1500
Alibabaqwen3.8-max
1498
Googlegemini-3.5-flash-high
1497
Zglm-5.3-max
1494
Anthropicclaude-opus-4-8-high
1494
Ogpt-5.6-sol-xhigh
1494

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes. El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones. Las clasificaciones de conversación y visión usan el ajuste de tono y longitud (style control), igual que la opción predeterminada del sitio de LMArena.

Mejor posición por empresa

  • GoogleGooglegemini-4-argon-high#1
  • AnthropicAnthropicclaude-fable-5-high#2
  • MetaMetamuse-spark-1.3-max#9
  • ZZ.aiglm-5.3-flash#13
  • DeepSeekDeepSeekdeepseek-v4.1-flash-max#14
  • Moonshot AIMoonshot AIkimi-k3-max#16
  • OOpenAIgpt-5.5#17
  • AlibabaAlibabaqwen3.8-max#18
  • XiaomiXiaomimimo-v2.6-pro#30
Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1#1Googlegemini-4-argon-highGoogle15301494–1566255
2#2Anthropicclaude-fable-5-highAnthropic15221509–15361,889
3#3Anthropicclaude-opus-5-highAnthropic15211509–15332,756
4#4Anthropicclaude-fable-5.1-maxAnthropic15181493–1543544
5#5Googlegemini-3.8-flash-highGoogle15171501–15341,274
6#6Anthropicclaude-opus-4-6-highAnthropic15171507–15273,978
7#7Anthropicclaude-opus-5-maxAnthropic15161499–15321,337
8#8Anthropicclaude-opus-5.5-highAnthropic15101475–1546235
9#9Metamuse-spark-1.3-maxMeta15091485–1533586
10#10Anthropicclaude-opus-4-6Anthropic15071497–15164,454
11#11Anthropicclaude-opus-4-7-highAnthropic15041493–15153,260
12#12Googlegemini-3.7-flash-highGoogle15031485–15211,097
13#13Zglm-5.3-flashZ.ai15031485–15211,131
14#14DeepSeekdeepseek-v4.1-flash-maxDeepSeek15031476–1530433
15#15Googlegemini-3.6-flash-highGoogle15011487–15161,736
16#16Moonshot AIkimi-k3-maxMoonshot AI15001483–15171,218
17#17Ogpt-5.5OpenAI15001489–15103,499
18#18Alibabaqwen3.8-maxAlibaba14981480–15151,151
19#19Googlegemini-3.5-flash-highGoogle14971485–15102,361
20#20Zglm-5.3-maxZ.ai14941473–1515739
21#21Anthropicclaude-opus-4-8-highAnthropic14941483–15052,941
22#22Ogpt-5.6-sol-xhighOpenAI14941480–15081,732
23#23Ogpt-5.5-highOpenAI14931483–15033,472
24#24Metamuse-spark-1.1Meta14921478–15071,661
25#25Ogpt-5.4-highOpenAI14921481–15023,379
26#26Anthropicclaude-opus-4-7Anthropic14921481–15023,371
27#27Ogpt-6-astra-maxOpenAI14901463–1517458
28#28Zglm-5.2-maxZ.ai14881475–15012,035
29#29Googlegemini-3.1-pro-previewGoogle14881480–14966,301
30#30Xiaomimimo-v2.6-proXiaomi14871447–1527213
31#31Alibabaqwen3.7-max-previewAlibaba14841446–1523231
32#32Googlegemini-3.5-flash-mediumGoogle14821469–14952,196
33#33Xiaomimimo-v2.5-proXiaomi14811470–14913,356
34#34Thy3Tencent14801455–1505550
35#35Moonshot AIkimi-k2.6Moonshot AI14801467–14932,075
36#36Ogpt-5.6-terra-xhighOpenAI14781464–14931,664
37#37TinklingThinky14781463–14931,581
38#38Baiduernie-5.1Baidu14771464–14911,980
39#39Ogpt-5.6-luna-xhighOpenAI14771463–14911,780
40#40Anthropicclaude-opus-4-8Anthropic14771466–14883,072
41#41Googlegemini-3-proGoogle14771465–14882,761
42#42Alibabaqwen3.6-max-previewAlibaba14761447–1505380
43#43Zglm-5.1Z.ai14751464–14872,860
44#44Googlegemini-3-flashGoogle14741461–14872,060
45#45Anthropicclaude-sonnet-5-highAnthropic14741460–14872,061
46#46xgrok-4.5xAI14731459–14871,752
47#47Xiaomimimo-v2.6-flashXiaomi14721441–1503330
48#48Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14721460–14842,334
49#49Moonshot AIkimi-k2.5-thinkingMoonshot AI14711462–14814,158
50#50Googlegemma-4-31bGoogle14691443–1496432

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings