Valumigo

Epoch AI · 最高難度の数学(FrontierMath)

公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

このランキングの読み方

測定する能力: Epoch AIが専門の数学者と作成したFrontierMathのTiers 1~3の非公開評価セットです。高度な学部レベルから研究者の初期段階のレベルまでを含み、評価問題を非公開にすることで学習データへの混入リスクを減らそうとしています。

スコアの読み方: 正答率(%)です。所定の形式の答えをPythonオブジェクトとして提出し、自動採点で正誤を評価します。

注意点: 一般的な計算や宿題の支援能力とは異なる基準です。非公開でも学習データへの混入リスクが完全になくなるわけではありません。比較時にはデータセットのバージョンと評価条件を確認してください。

今回のランキングから読み取れること

  • 最高スコアはGPT-6.1 Solの93.7%です。
  • 1位と5位の差は3.9%pです。
  • 上位10モデルのうち、OpenAIのモデルが6モデルで最も多くなっています。
  • この試験の結果が公開されているモデルは30件です。

最高難度の数学(FrontierMath) Epoch AI

Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04

OGPT-6.1 Sol
93.7%
OGPT-6 Astra
93.7%
AnthropicClaude Opus 5.5
91.2%
AnthropicClaude Fable 5.1
90.2%
OGPT-6 Sol
89.8%
OGPT-5.6 Sol
89.1%
AnthropicClaude Sonnet 5.5
88.8%
OGPT-5.5 Pro
87.7%
AnthropicClaude Fable 5
87.0%
OGPT-5.6 Terra
86.0%
AnthropicClaude Opus 5
85.6%
OGPT-5.5
85.3%
OGPT-5.4 Pro
82.5%
OGPT-5.6 Luna
82.1%
AnthropicClaude Opus 4.8
80.0%
OGPT-6 Luna
78.9%
OGPT-5.4
78.6%
AlibabaQwen3.8 Max
74.7%
MetaMuse Spark 1.3
74.4%
OGPT-5.2 Pro
74.0%

棒は正答率(%)を示し、0%から描画しています。

表で見る(上位30件)
順位モデル開発元リリース日スコア
1#1OGPT-6.1 Sol(max)OpenAI2026-09-2993.7%
2#2OGPT-6 Astra(max)OpenAI2026-09-0393.7%
3#3AnthropicClaude Opus 5.5(max)Anthropic2026-09-2291.2%
4#4AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.2%
5#5OGPT-6 Sol(max)OpenAI2026-09-2289.8%
6#6OGPT-5.6 Sol(max)OpenAI2026-07-0989.1%
7#7AnthropicClaude Sonnet 5.5(max)Anthropic2026-09-2888.8%
8#8OGPT-5.5 Pro(xhigh)OpenAI2026-04-2387.7%
9#9AnthropicClaude Fable 5(max)Anthropic2026-06-0987.0%
10#10OGPT-5.6 Terra(max)OpenAI2026-07-0986.0%
11#11AnthropicClaude Opus 5(max)Anthropic2026-07-2485.6%
12#12OGPT-5.5(xhigh)OpenAI2026-04-2385.3%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0582.5%
14#14OGPT-5.6 Luna(max)OpenAI2026-07-0982.1%
15#15AnthropicClaude Opus 4.8Anthropic2026-05-2880.0%
16#16OGPT-6 Luna(max)OpenAI2026-09-2278.9%
17#17OGPT-5.4(xhigh)OpenAI2026-03-0578.6%
18#18AlibabaQwen3.8 Max(xhigh)Alibaba2026-08-0274.7%
19#19MetaMuse Spark 1.3(xhigh)Meta2026-09-0274.4%
20#20OGPT-5.2 ProOpenAI2025-12-1174.0%
21#21Moonshot AIKimi K3(max)Moonshot AI2026-07-1672.2%
22#22GoogleGemini 3.7 Flash(high)Google2026-08-1371.6%
23#23AnthropicClaude Opus 4.7(max)Anthropic2026-04-1670.2%
24#24ZGLM-5.3(max)Z.ai2026-08-1468.8%
25#25GoogleGemini 3.8 Flash(high)Google2026-09-0268.4%
26#26OGPT-5.2(xhigh)OpenAI2025-12-1167.4%
27#27xGrok 4.6(xhigh)xAI2026-08-1266.0%
28#28AnthropicClaude Opus 4.6(max)Anthropic2026-02-0566.0%
29#29AlibabaQwen3.8 Max (0902)(xhigh)Alibaba2026-09-0165.6%
30#30AnthropicClaude Sonnet 5(max)Anthropic2026-06-3065.6%

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings