Valumigo

Epoch AI · Informes de investigación (DeepResearch Bench)

Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.

Las puntuaciones de LMArena se basan en votos de personas que comparan las respuestas de dos modelos y eligen la mejor (sistema Elo). Si la diferencia queda dentro del intervalo de confianza, considera que los modelos tienen un nivel similar.

Cómo interpretar esta clasificación

Qué mide: Deep Research Bench de FutureSearch, incluido por Epoch, evalúa la capacidad de buscar y sintetizar información de la web para responder preguntas de investigación. Debe distinguirse de otro benchmark con el mismo nombre que evalúa la calidad de informes extensos.

Cómo interpretar la puntuación: Agrega puntuaciones de 0~1 basadas en la precisión, la exhaustividad, F1, la corrección de las respuestas y el error de las estimaciones de probabilidad de cada tarea, entre otros criterios. Aunque se exprese como porcentaje, no representa la tasa de resolución de todas las tareas.

Precauciones: Utiliza RetroSearch para buscar en contenido web almacenado y condiciones predefinidas para los agentes. Parte de la evaluación incluye juicios asistidos por IA, por lo que las diferencias pequeñas deben interpretarse teniendo en cuenta las condiciones de evaluación.

Claves para interpretar esta clasificación

  • La puntuación más alta es 55.3%, obtenida por Claude Opus 4.6.
  • La diferencia entre el 1.º y el 5.º puesto es de 2.7%p.
  • Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 6 modelos.
  • Hay 25 modelos con resultados publicados para esta prueba.

Informes de investigación (DeepResearch Bench) Epoch AI

Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04

AnthropicClaude Opus 4.6
55.3%
AnthropicClaude Sonnet 4.6
54.9%
AnthropicClaude Opus 4.5
54.8%
OGPT-5.5
54.0%
AnthropicClaude Sonnet 4.5
52.6%
AnthropicClaude Opus 4.8
50.2%
GoogleGemini 3 Flash Preview
49.8%
OGPT-5
49.6%
Anthropicclaude-opus-4-1-20250805
48.3%
GoogleGemini 3.1 Pro Preview
47.8%
xgrok-4-0709
47.3%
AnthropicClaude Opus 4
46.8%
Anthropicclaude-sonnet-4-20250514_2K
46.6%
GoogleGemini 3 Pro Preview
46.3%
AnthropicClaude Haiku 4.5
45.5%
Oo3
45.2%
AnthropicClaude 3.7 Sonnet
43.6%
GoogleGemini 2.5 Pro Preview
42.8%
OGPT-5.1
42.8%
Googlegemini-2.5-pro
41.5%

Las barras indican el porcentaje de aciertos y parten del 0%.

Ver tabla (los 25 mejores)
PuestoModeloDesarrolladorFecha de lanzamientoPuntuación
1#1AnthropicClaude Opus 4.6(high)Anthropic2026-02-0555.3%
2#2AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1754.9%
3#3AnthropicClaude Opus 4.5(high)Anthropic2025-11-2454.8%
4#4OGPT-5.5(high)OpenAI2026-04-2354.0%
5#5AnthropicClaude Sonnet 4.5(2k thinking)Anthropic2025-09-2952.6%
6#6AnthropicClaude Opus 4.8Anthropic2026-05-2850.2%
7#7GoogleGemini 3 Flash PreviewGoogle2025-12-1749.8%
8#8OGPT-5(low)OpenAI2025-08-0749.6%
9#9Anthropicclaude-opus-4-1-20250805Anthropic2025-08-0548.3%
10#10GoogleGemini 3.1 Pro PreviewGoogle2026-02-1947.8%
11#11xgrok-4-0709xAI2025-07-0947.3%
12#12AnthropicClaude Opus 4Anthropic2025-05-2246.8%
13#13Anthropicclaude-sonnet-4-20250514_2KAnthropic2025-05-2246.6%
14#14GoogleGemini 3 Pro Preview(low)Google2025-11-1846.3%
15#15AnthropicClaude Haiku 4.5(low)Anthropic2025-10-1545.5%
16#16Oo3(medium)OpenAI2025-04-1645.2%
17#17AnthropicClaude 3.7 Sonnet(2k thinking)Anthropic2025-02-2443.6%
18#18GoogleGemini 2.5 Pro Preview(Jun 2025)Google2025-06-0542.8%
19#19OGPT-5.1(low)OpenAI2025-11-1342.8%
20#20Googlegemini-2.5-proGoogle2025-06-0541.5%
21#21OGPT-5.2(low)OpenAI2025-12-1141.1%
22#22GoogleGemini 3.1 Flash-LiteGoogle2026-03-0337.3%
23#23OGPT-5.4 mini(low)OpenAI2026-03-1736.3%
24#24OGPT-5.4(low)OpenAI2026-03-0535.1%
25#25DeepSeekDeepSeek-R1(May 2025)DeepSeek2025-05-2835.1%

Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings