Epoch AI · 事实问答准确率(SimpleQA Verified)
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
如何解读此排行榜
衡量什么: SimpleQA Verified 评估模型能否准确回答简短的事实问题。这是 Google DeepMind 与 Google Research 基于 OpenAI 的 SimpleQA,减少重复题目和答案错误等问题后形成的 1,000 道题评估。
如何解读分数: Epoch 显示的是全部问题中回答正确的比例(%),不同于 Google 官方评估的 F1 指标。仅凭此分数无法全面评估幻觉或拒答倾向。
注意事项: 评估条件是不用搜索工具、仅凭模型内部知识回答,因此可能不同于开启搜索的服务的准确率。Epoch 使用额外指令来减少拒答。
本次排名的解读要点
- 最高分为 GPT-6 Astra 的 75.6%。
- 第 1 名与第 5 名的差距为 4.8%p。
- 前 10 个模型中,Google 的模型有 4 个,数量最多。
- 已有 30 个模型公开了此测试的结果。
事实问答准确率(SimpleQA Verified) Epoch AI
数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04
柱状条表示正确率(%),从 0% 起绘制。
查看表格(前 30 名)
| 排名 | 模型 | 开发方 | 发布日期 | 分数 |
|---|---|---|---|---|
| 1 | #1OGPT-6 Astra(max) | OpenAI | 2026-09-03 | 75.6% |
| 2 | #2OGPT-6.1 Sol(max) | OpenAI | 2026-09-29 | 73.9% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 73.5% | |
| 4 | #4Claude Opus 5.5(max) | Anthropic | 2026-09-22 | 72.2% |
| 5 | #5Claude Fable 5.1(max) | Anthropic | 2026-09-01 | 70.8% |
| 6 | #6Claude Fable 5(xhigh) | Anthropic | 2026-06-09 | 70.7% |
| 7 | #7Gemini 3.8 Flash(high) | 2026-09-02 | 69.7% | |
| 8 | #8OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 69.7% |
| 9 | #9Gemini 3.7 Flash(high) | 2026-08-13 | 69.2% | |
| 10 | #10Gemini 3 Flash Preview | 2025-12-17 | 66.8% | |
| 11 | #11Gemini 3.5 Flash | 2026-05-19 | 66.2% | |
| 12 | #12Gemini 3.6 Flash | 2026-07-21 | 66.2% | |
| 13 | #13OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 63.0% |
| 14 | #14OGPT-6 Sol(max) | OpenAI | 2026-09-22 | 60.7% |
| 15 | #15Muse Spark 1.2(xhigh) | Meta | 2026-08-05 | 60.3% |
| 16 | #16Claude Opus 5(max) | Anthropic | 2026-07-24 | 59.9% |
| 17 | #17Muse Spark 1.1 | Meta | 2026-07-09 | 57.8% |
| 18 | #18xGrok 4.7(xhigh) | xAI | 2026-09-21 | 56.0% |
| 19 | #19Qwen3.7 Max | Alibaba | 2026-05-19 | 55.8% |
| 20 | #20Claude Opus 4.8 | Anthropic | 2026-05-28 | 53.0% |
| 21 | #21DeepSeek V4 Pro 0813(max) | DeepSeek | 2026-08-13 | 52.9% |
| 22 | #22Qwen 3.6 Max(Preview) | Alibaba | 2026-04-20 | 52.0% |
| 23 | #23Claude Opus 4.7(xhigh) | Anthropic | 2026-04-16 | 51.7% |
| 24 | #24Kimi K3(max) | Moonshot AI | 2026-07-16 | 50.6% |
| 25 | #25OGPT-5(high) | OpenAI | 2025-08-07 | 50.1% |
| 26 | #26Oo3(high) | OpenAI | 2025-04-16 | 49.4% |
| 27 | #27xGrok 4.6(high) | xAI | 2026-08-12 | 49.3% |
| 28 | #28Qwen3-Max-Instruct | Alibaba | 2025-09-24 | 48.7% |
| 29 | #29xGrok 4.5(high) | xAI | 2026-07-08 | 48.3% |
| 30 | #30OGPT-5.1(high) | OpenAI | 2025-11-13 | 48.0% |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings