Epoch AI · 顶级难度数学(FrontierMath)
定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。
如何解读此排行榜
衡量什么: 这是 Epoch AI 与专业数学家共同创建的 FrontierMath 的 Tiers 1~3 非公开评估集。涵盖高阶本科到初级研究人员的水平,并通过不公开评估题目来尝试降低训练数据污染风险。
如何解读分数: 正确率(%)。答案需以 Python 对象按指定格式提交,由自动评分判断是否正确。
注意事项: 其评估标准不同于普通计算或作业辅助能力。非公开并不意味着数据污染风险完全消失,比较时请查看数据集版本和评估条件。
本次排名的解读要点
- 最高分为 GPT-6.1 Sol 的 93.7%。
- 第 1 名与第 5 名的差距为 3.9%p。
- 前 10 个模型中,OpenAI 的模型有 6 个,数量最多。
- 已有 30 个模型公开了此测试的结果。
顶级难度数学(FrontierMath) Epoch AI
数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04
柱状条表示正确率(%),从 0% 起绘制。
查看表格(前 30 名)
| 排名 | 模型 | 开发方 | 发布日期 | 分数 |
|---|---|---|---|---|
| 1 | #1OGPT-6.1 Sol(max) | OpenAI | 2026-09-29 | 93.7% |
| 2 | #2OGPT-6 Astra(max) | OpenAI | 2026-09-03 | 93.7% |
| 3 | #3Claude Opus 5.5(max) | Anthropic | 2026-09-22 | 91.2% |
| 4 | #4Claude Fable 5.1(max) | Anthropic | 2026-09-01 | 90.2% |
| 5 | #5OGPT-6 Sol(max) | OpenAI | 2026-09-22 | 89.8% |
| 6 | #6OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 89.1% |
| 7 | #7Claude Sonnet 5.5(max) | Anthropic | 2026-09-28 | 88.8% |
| 8 | #8OGPT-5.5 Pro(xhigh) | OpenAI | 2026-04-23 | 87.7% |
| 9 | #9Claude Fable 5(max) | Anthropic | 2026-06-09 | 87.0% |
| 10 | #10OGPT-5.6 Terra(max) | OpenAI | 2026-07-09 | 86.0% |
| 11 | #11Claude Opus 5(max) | Anthropic | 2026-07-24 | 85.6% |
| 12 | #12OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 85.3% |
| 13 | #13OGPT-5.4 Pro(xhigh) | OpenAI | 2026-03-05 | 82.5% |
| 14 | #14OGPT-5.6 Luna(max) | OpenAI | 2026-07-09 | 82.1% |
| 15 | #15Claude Opus 4.8 | Anthropic | 2026-05-28 | 80.0% |
| 16 | #16OGPT-6 Luna(max) | OpenAI | 2026-09-22 | 78.9% |
| 17 | #17OGPT-5.4(xhigh) | OpenAI | 2026-03-05 | 78.6% |
| 18 | #18Qwen3.8 Max(xhigh) | Alibaba | 2026-08-02 | 74.7% |
| 19 | #19Muse Spark 1.3(xhigh) | Meta | 2026-09-02 | 74.4% |
| 20 | #20OGPT-5.2 Pro | OpenAI | 2025-12-11 | 74.0% |
| 21 | #21Kimi K3(max) | Moonshot AI | 2026-07-16 | 72.2% |
| 22 | #22Gemini 3.7 Flash(high) | 2026-08-13 | 71.6% | |
| 23 | #23Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 70.2% |
| 24 | #24ZGLM-5.3(max) | Z.ai | 2026-08-14 | 68.8% |
| 25 | #25Gemini 3.8 Flash(high) | 2026-09-02 | 68.4% | |
| 26 | #26OGPT-5.2(xhigh) | OpenAI | 2025-12-11 | 67.4% |
| 27 | #27xGrok 4.6(xhigh) | xAI | 2026-08-12 | 66.0% |
| 28 | #28Claude Opus 4.6(max) | Anthropic | 2026-02-05 | 66.0% |
| 29 | #29Qwen3.8 Max (0902)(xhigh) | Alibaba | 2026-09-01 | 65.6% |
| 30 | #30Claude Sonnet 5(max) | Anthropic | 2026-06-30 | 65.6% |
数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings