Valumigo

Epoch AI · 各分野の最高難度の問題(HLE)

公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

このランキングの読み方

測定する能力: Center for AI SafetyとScale AIが作成したHumanity's Last Examです。さまざまな分野の専門家が作成した公開問題2,500問で構成され、既存ベンチマークの飽和に対応するために開発されました。

スコアの読み方: 正答率(%)です。難度の高い知識と推論を評価し、スコアはモデルやツールの使用条件によって変わります。

注意点: 問題や正解・採点の誤りが指摘されています。小さなスコア差は、問題の不備、評価条件、統計的な不確実性も確認して解釈してください。

今回のランキングから読み取れること

  • 最高スコアはGPT-6 Astraの54.8%です。
  • 1位と5位の差は10.5%pです。
  • 上位10モデルのうち、OpenAIのモデルが3モデルで最も多くなっています。
  • この試験の結果が公開されているモデルは30件です。

各分野の最高難度の問題(HLE) Epoch AI

Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04

OGPT-6 Astra
54.8%
AnthropicClaude Fable 5.1
46.5%
GoogleGemini 3.1 Pro Preview
46.4%
GoogleGemini 3.8 Flash
44.5%
OGPT-5.4 Pro
44.3%
MetaMuse Spark
40.6%
GoogleGemini 3 Pro Preview
37.5%
OGPT-5.4
36.2%
AnthropicClaude Opus 4.7
36.2%
AnthropicClaude Opus 4.6
34.4%
OGPT-5 Pro
31.6%
OGPT-5.2
27.8%
OGPT-5
25.3%
AnthropicClaude Opus 4.5
25.2%
Moonshot AIKimi K2.5
24.4%
OGPT-5.1
23.7%
GoogleGemini 2.5 Pro Preview
21.6%
Oo3
20.3%
OGPT-5 mini
19.4%
GoogleGemini 2.5 Pro Exp
18.2%

棒は正答率(%)を示し、0%から描画しています。

表で見る(上位30件)
順位モデル開発元リリース日スコア
1#1OGPT-6 Astra(unknown thinking)OpenAI2026-09-0354.8%
2#2AnthropicClaude Fable 5.1(xhigh)Anthropic2026-09-0146.5%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1946.4%
4#4GoogleGemini 3.8 Flash(unknown)Google2026-09-0244.5%
5#5OGPT-5.4 ProOpenAI2026-03-0544.3%
6#6MetaMuse SparkMeta2026-04-0840.6%
7#7GoogleGemini 3 Pro PreviewGoogle2025-11-1837.5%
8#8OGPT-5.4(xhigh)OpenAI2026-03-0536.2%
9#9AnthropicClaude Opus 4.7(unknown)Anthropic2026-04-1636.2%
10#10AnthropicClaude Opus 4.6(max)Anthropic2026-02-0534.4%
11#11OGPT-5 ProOpenAI2025-10-0731.6%
12#12OGPT-5.2(unknown thinking)OpenAI2025-12-1127.8%
13#13OGPT-5(high)OpenAI2025-08-0725.3%
14#14AnthropicClaude Opus 4.5(unknown thinking)Anthropic2025-11-2425.2%
15#15Moonshot AIKimi K2.5Moonshot AI2026-01-2724.4%
16#16OGPT-5.1(unknown thinking)OpenAI2025-11-1323.7%
17#17GoogleGemini 2.5 Pro Preview(Jun 2025)Google2025-06-0521.6%
18#18Oo3(high)OpenAI2025-04-1620.3%
19#19OGPT-5 mini(unknown thinking)OpenAI2025-08-0719.4%
20#20GoogleGemini 2.5 Pro Exp(Mar 2025)Google2025-03-2518.2%
21#21Oo4-mini(high)OpenAI2025-04-1618.1%
22#22AnthropicClaude Sonnet 4.5(unknown thinking)Anthropic2025-09-2913.7%
23#23GoogleGemini 2.5 Flash Preview(Apr 2025)Google2025-04-1712.1%
24#24AnthropicClaude Opus 4.1(unknown thinking)Anthropic2025-08-0511.5%
25#25Googlegemini-2.5-flash-preview-05-20Google2025-05-2011.0%
26#26AnthropicClaude Opus 4Anthropic2025-05-2210.7%
27#27GoogleGemini 3.1 Flash-LiteGoogle2026-03-038.6%
28#28Zglm-4.5Z.ai2025-08-038.3%
29#29ZGLM-4.5-AirZ.ai2025-07-208.1%
30#30Oo1 ProOpenAI2025-03-198.1%

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings