Epoch AI · Precisión en preguntas sobre hechos (SimpleQA Verified)
Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.
Cómo interpretar esta clasificación
Qué mide: SimpleQA Verified evalúa si se responde correctamente a preguntas factuales breves. Es una evaluación de 1,000 preguntas creada por Google DeepMind y Google Research a partir de SimpleQA de OpenAI, con menos duplicados y errores en las respuestas correctas, entre otras mejoras.
Cómo interpretar la puntuación: El valor que muestra Epoch es el porcentaje (%) de respuestas correctas sobre el total de preguntas. Difiere de la métrica F1 de la evaluación oficial de Google, y esta puntuación por sí sola no permite evaluar por completo las alucinaciones ni la tendencia a negarse a responder.
Precauciones: Los modelos responden con sus conocimientos internos y sin herramientas de búsqueda, por lo que la precisión puede diferir de la de un servicio con búsqueda activada. Epoch utiliza instrucciones adicionales para reducir las negativas a responder.
Claves para interpretar esta clasificación
- La puntuación más alta es 75.6%, obtenida por GPT-6 Astra.
- La diferencia entre el 1.º y el 5.º puesto es de 4.8%p.
- Entre los 10 modelos mejor clasificados, Google tiene la mayor cantidad, con 4 modelos.
- Hay 30 modelos con resultados publicados para esta prueba.
Precisión en preguntas sobre hechos (SimpleQA Verified) Epoch AI
Estos datos reúnen puntuaciones medidas por Epoch AI o publicadas por desarrolladores y entidades evaluadoras. Los modelos evaluados varían según la prueba, por lo que algunas aún no incluyen los más recientes. Mostramos la puntuación más alta de cada modelo entre sus distintos niveles de esfuerzo de razonamiento. · Obtenido el 2026-10-04
Las barras indican el porcentaje de aciertos y parten del 0%.
Ver tabla (los 30 mejores)
| Puesto | Modelo | Desarrollador | Fecha de lanzamiento | Puntuación |
|---|---|---|---|---|
| 1 | #1OGPT-6 Astra(max) | OpenAI | 2026-09-03 | 75.6% |
| 2 | #2OGPT-6.1 Sol(max) | OpenAI | 2026-09-29 | 73.9% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 73.5% | |
| 4 | #4Claude Opus 5.5(max) | Anthropic | 2026-09-22 | 72.2% |
| 5 | #5Claude Fable 5.1(max) | Anthropic | 2026-09-01 | 70.8% |
| 6 | #6Claude Fable 5(xhigh) | Anthropic | 2026-06-09 | 70.7% |
| 7 | #7Gemini 3.8 Flash(high) | 2026-09-02 | 69.7% | |
| 8 | #8OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 69.7% |
| 9 | #9Gemini 3.7 Flash(high) | 2026-08-13 | 69.2% | |
| 10 | #10Gemini 3 Flash Preview | 2025-12-17 | 66.8% | |
| 11 | #11Gemini 3.5 Flash | 2026-05-19 | 66.2% | |
| 12 | #12Gemini 3.6 Flash | 2026-07-21 | 66.2% | |
| 13 | #13OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 63.0% |
| 14 | #14OGPT-6 Sol(max) | OpenAI | 2026-09-22 | 60.7% |
| 15 | #15Muse Spark 1.2(xhigh) | Meta | 2026-08-05 | 60.3% |
| 16 | #16Claude Opus 5(max) | Anthropic | 2026-07-24 | 59.9% |
| 17 | #17Muse Spark 1.1 | Meta | 2026-07-09 | 57.8% |
| 18 | #18xGrok 4.7(xhigh) | xAI | 2026-09-21 | 56.0% |
| 19 | #19Qwen3.7 Max | Alibaba | 2026-05-19 | 55.8% |
| 20 | #20Claude Opus 4.8 | Anthropic | 2026-05-28 | 53.0% |
| 21 | #21DeepSeek V4 Pro 0813(max) | DeepSeek | 2026-08-13 | 52.9% |
| 22 | #22Qwen 3.6 Max(Preview) | Alibaba | 2026-04-20 | 52.0% |
| 23 | #23Claude Opus 4.7(xhigh) | Anthropic | 2026-04-16 | 51.7% |
| 24 | #24Kimi K3(max) | Moonshot AI | 2026-07-16 | 50.6% |
| 25 | #25OGPT-5(high) | OpenAI | 2025-08-07 | 50.1% |
| 26 | #26Oo3(high) | OpenAI | 2025-04-16 | 49.4% |
| 27 | #27xGrok 4.6(high) | xAI | 2026-08-12 | 49.3% |
| 28 | #28Qwen3-Max-Instruct | Alibaba | 2025-09-24 | 48.7% |
| 29 | #29xGrok 4.5(high) | xAI | 2026-07-08 | 48.3% |
| 30 | #30OGPT-5.1(high) | OpenAI | 2025-11-13 | 48.0% |
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings