Valumigo

Clasificación de benchmarks de IA

Actualizamos periódicamente los datos públicos de benchmarks: rankings por votos de usuarios de LMArena y puntuaciones de pruebas de Epoch AI. Cada ranking muestra la fecha de publicación y la de obtención de los datos. Las puntuaciones no las calcula este sitio.

Modelos recientes de un vistazo

Modelos lanzados en los últimos 120 días, ordenados por fecha de lanzamiento, con las puntuaciones de ambas fuentes públicas en una sola fila. Las puntuaciones indican el porcentaje de respuestas correctas.

ModeloFecha de lanzamientoÍndice generalGPQA DiamondFrontierMathHLEARC-AGI-2SWE-bench VerifiedClasificación general de LMArenaClasificación de LMArena en Español
OGPT-6.1 SolOpenAI2026-09-29–95.493.7–––#60Aún sin datos
AnthropicClaude Sonnet 5.5Anthropic2026-09-28165.295.688.8–––#34Aún sin datos
AnthropicClaude Opus 5.5Anthropic2026-09-22167.4–91.2–92.5–#2Aún sin datos
OGPT-6 SolOpenAI2026-09-22–94.389.8–89.6–#158#159
OGPT-6 LunaOpenAI2026-09-22––78.9–59.3–#163#115
DeepSeekDeepSeek V4.1 FlashDeepSeek2026-09-09155–––––#37#18
OGPT-6 AstraOpenAI2026-09-03166.595.893.754.895–#71#125
GoogleGemini 3.8 FlashGoogle2026-09-02156.995.468.444.5––#8#12
MetaMuse Spark 1.3Meta2026-09-02156.9–74.4–––#12#11
AnthropicClaude Fable 5.1Anthropic2026-09-01164.8–90.246.590–#3#3
AlibabaQwen3.8 Max (0902)Alibaba2026-09-01155.292.365.6–––Aún sin datosAún sin datos
ZGLM-5.3-FlashZ.ai2026-08-20151.9–––––#30#28
ZGLM-5.3Z.ai2026-08-14155.890.968.8–––#26#28
AlibabaQwen 3.8 27BAlibaba2026-08-14149.4–––––#74#57
GoogleGemini 3.7 FlashGoogle2026-08-13157.494.871.6–84.6–#13#8
DeepSeekDeepSeek V4 Pro 0813DeepSeek2026-08-13155.491.7––61.3–Aún sin datosAún sin datos

Los modelos nuevos necesitan suficientes votos para aparecer en las clasificaciones, especialmente las de cada idioma. Poco después del lanzamiento pueden figurar como 'Aún sin datos'.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Español LMArena

Publicado el 2026-10-02 · Obtenido el 2026-10-04

14401470150015301560
Anthropicclaude-opus-5-max
1517
Anthropicclaude-opus-4-6
1510
Anthropicclaude-fable-5.1-max
1508
Anthropicclaude-opus-4-6-high
1504
Anthropicclaude-opus-5-high
1504
Googlegemini-4-argon-high
1503
Anthropicclaude-fable-5-high
1500
Googlegemini-3.7-flash-high
1499
Alibabaqwen3.8-max
1497
Anthropicclaude-opus-4-7-high
1495
Metamuse-spark-1.3-max
1487
Googlegemini-3.8-flash-high
1485
Googlegemini-3.5-flash-high
1479
Googlegemini-3.1-pro-preview
1479
Zglm-5.2-max
1477
Moonshot AIkimi-k3-max
1477
Googlegemini-3.6-flash-high
1476
DeepSeekdeepseek-v4.1-flash-max
1475
Xiaomimimo-v2.5-pro
1474
Googlegemini-3.5-flash-medium
1474

Los puntos indican la puntuación y las líneas horizontales, el intervalo de confianza del 95%. Si las líneas se solapan, los resultados son prácticamente equivalentes.

Ver tabla (los 50 mejores)
PuestoModeloDesarrolladorPuntuaciónIntervalo de confianza del 95%Votos
1Anthropicclaude-opus-5-maxAnthropic15171496–1539803
2Anthropicclaude-opus-4-6Anthropic15101498–15232,707
3Anthropicclaude-fable-5.1-maxAnthropic15081478–1538375
4Anthropicclaude-opus-4-6-highAnthropic15041491–15172,627
5Anthropicclaude-opus-5-highAnthropic15041488–15191,676
6Googlegemini-4-argon-highGoogle15031462–1544201
7Anthropicclaude-fable-5-highAnthropic15001482–15181,167
8Googlegemini-3.7-flash-highGoogle14991475–1523639
9Alibabaqwen3.8-maxAlibaba14971473–1520689
10Anthropicclaude-opus-4-7-highAnthropic14951481–15102,043
11Metamuse-spark-1.3-maxMeta14871455–1518365
12Googlegemini-3.8-flash-highGoogle14851464–1505848
13Googlegemini-3.5-flash-highGoogle14791462–14961,410
14Googlegemini-3.1-pro-previewGoogle14791468–14893,868
15Zglm-5.2-maxZ.ai14771460–14941,314
16Moonshot AIkimi-k3-maxMoonshot AI14771456–1497843
17Googlegemini-3.6-flash-highGoogle14761456–1497914
18DeepSeekdeepseek-v4.1-flash-maxDeepSeek14751440–1510274
19Xiaomimimo-v2.5-proXiaomi14741460–14882,126
20Googlegemini-3.5-flash-mediumGoogle14741457–14921,274
21Googlegemini-2.5-proGoogle14741463–14853,439
22Baiduernie-5.1Baidu14731455–14911,292
23Baiduernie-5.0-preview-1203Baidu14731436–1510238
24Anthropicclaude-opus-4-7Anthropic14731459–14872,099
25Metamuse-sparkMeta14711445–1497518
26Alibabaqwen3.5-max-previewAlibaba14701449–1491804
27Googlegemini-3-flashGoogle14701451–1488999
28Zglm-5.3-flashZ.ai14691448–1490792
29Zglm-5.1Z.ai14681453–14821,897
30Googlegemini-3-proGoogle14681450–14851,215
31Ogpt-5.5-highOpenAI14681453–14821,937
32Anthropicclaude-opus-4-8-highAnthropic14661451–14811,840
33Metamuse-spark-1.1Meta14661447–14841,106
34Moonshot AIkimi-k2.6Moonshot AI14641447–14801,371
35Anthropicclaude-sonnet-4-6Anthropic14641450–14772,177
36Alibabaqwen3-max-previewAlibaba14621442–1483844
37ByteDancedola-seed-2.0-proByteDance14611448–14732,565
38DeepSeekdeepseek-v4-proDeepSeek14581442–14731,726
39Anthropicclaude-opus-4-5-20251101-high-32kAnthropic14571439–14751,137
40Xiaomimimo-v2-proXiaomi14571436–1478850
41Alibabaqwen3.7-plusAlibaba14571439–14751,234
42Ogpt-5.5OpenAI14571443–14712,033
43Anthropicclaude-sonnet-4-5-20250929Anthropic14561444–14692,487
44NVIDIAnvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA14551426–1483453
45Ogpt-5.4-highOpenAI14541440–14682,062
46Zglm-4.5Z.ai14541430–1477676
47Zglm-5Z.ai14531435–14711,134
48Anthropicclaude-opus-4-5-20251101Anthropic14531439–14662,156
49Thy3Tencent14531423–1483371
50Alibabaqwen3.6-max-previewAlibaba14521416–1489253

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarks