Valumigo

Epoch AI · 顶级难度数学(FrontierMath)

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: 这是 Epoch AI 与专业数学家共同创建的 FrontierMath 的 Tiers 1~3 非公开评估集。涵盖高阶本科到初级研究人员的水平,并通过不公开评估题目来尝试降低训练数据污染风险。

如何解读分数: 正确率(%)。答案需以 Python 对象按指定格式提交,由自动评分判断是否正确。

注意事项: 其评估标准不同于普通计算或作业辅助能力。非公开并不意味着数据污染风险完全消失,比较时请查看数据集版本和评估条件。

本次排名的解读要点

  • 最高分为 GPT-6.1 Sol 的 93.7%。
  • 第 1 名与第 5 名的差距为 3.9%p。
  • 前 10 个模型中,OpenAI 的模型有 6 个,数量最多。
  • 已有 30 个模型公开了此测试的结果。

顶级难度数学(FrontierMath) Epoch AI

数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04

OGPT-6.1 Sol
93.7%
OGPT-6 Astra
93.7%
AnthropicClaude Opus 5.5
91.2%
AnthropicClaude Fable 5.1
90.2%
OGPT-6 Sol
89.8%
OGPT-5.6 Sol
89.1%
AnthropicClaude Sonnet 5.5
88.8%
OGPT-5.5 Pro
87.7%
AnthropicClaude Fable 5
87.0%
OGPT-5.6 Terra
86.0%
AnthropicClaude Opus 5
85.6%
OGPT-5.5
85.3%
OGPT-5.4 Pro
82.5%
OGPT-5.6 Luna
82.1%
AnthropicClaude Opus 4.8
80.0%
OGPT-6 Luna
78.9%
OGPT-5.4
78.6%
AlibabaQwen3.8 Max
74.7%
MetaMuse Spark 1.3
74.4%
OGPT-5.2 Pro
74.0%

柱状条表示正确率(%),从 0% 起绘制。

查看表格(前 30 名)
排名模型开发方发布日期分数
1#1OGPT-6.1 Sol(max)OpenAI2026-09-2993.7%
2#2OGPT-6 Astra(max)OpenAI2026-09-0393.7%
3#3AnthropicClaude Opus 5.5(max)Anthropic2026-09-2291.2%
4#4AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.2%
5#5OGPT-6 Sol(max)OpenAI2026-09-2289.8%
6#6OGPT-5.6 Sol(max)OpenAI2026-07-0989.1%
7#7AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2888.8%
8#8OGPT-5.5 Pro(xhigh)OpenAI2026-04-2387.7%
9#9AnthropicClaude Fable 5(max)Anthropic2026-06-0987.0%
10#10OGPT-5.6 Terra(max)OpenAI2026-07-0986.0%
11#11AnthropicClaude Opus 5(max)Anthropic2026-07-2485.6%
12#12OGPT-5.5(xhigh)OpenAI2026-04-2385.3%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0582.5%
14#14OGPT-5.6 Luna(max)OpenAI2026-07-0982.1%
15#15AnthropicClaude Opus 4.8Anthropic2026-05-2880.0%
16#16OGPT-6 Luna(max)OpenAI2026-09-2278.9%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0578.6%
18#18AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0274.7%
19#19MetaMuse Spark 1.3(xhigh)Meta2026-09-0274.4%
20#20OGPT-5.2 ProOpenAI2025-12-1174.0%
21#21Moonshot AIKimi K3(max)Moonshot AI2026-07-1672.2%
22#22GoogleGemini 3.7 Flash(high)Google2026-08-1371.6%
23#23AnthropicClaude Opus 4.7(max)Anthropic2026-04-1670.2%
24#24ZGLM-5.3(max)Z.ai2026-08-1468.8%
25#25GoogleGemini 3.8 Flash(high)Google2026-09-0268.4%
26#26OGPT-5.2(xhigh)OpenAI2025-12-1167.4%
27#27xGrok 4.6(xhigh)xAI2026-08-1266.0%
28#28AnthropicClaude Opus 4.6(max)Anthropic2026-02-0566.0%
29#29AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0165.6%
30#30AnthropicClaude Sonnet 5(max)Anthropic2026-06-3065.6%

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings