Epoch AI · 各分野の最高難度の問題(HLE)
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: Center for AI SafetyとScale AIが作成したHumanity's Last Examです。さまざまな分野の専門家が作成した公開問題2,500問で構成され、既存ベンチマークの飽和に対応するために開発されました。
スコアの読み方: 正答率(%)です。難度の高い知識と推論を評価し、スコアはモデルやツールの使用条件によって変わります。
注意点: 問題や正解・採点の誤りが指摘されています。小さなスコア差は、問題の不備、評価条件、統計的な不確実性も確認して解釈してください。
今回のランキングから読み取れること
- 最高スコアはGPT-6 Astraの54.8%です。
- 1位と5位の差は10.5%pです。
- 上位10モデルのうち、OpenAIのモデルが3モデルで最も多くなっています。
- この試験の結果が公開されているモデルは30件です。
各分野の最高難度の問題(HLE) Epoch AI
Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04
棒は正答率(%)を示し、0%から描画しています。
表で見る(上位30件)
| 順位 | モデル | 開発元 | リリース日 | スコア |
|---|---|---|---|---|
| 1 | #1OGPT-6 Astra(unknown thinking) | OpenAI | 2026-09-03 | 54.8% |
| 2 | #2Claude Fable 5.1(xhigh) | Anthropic | 2026-09-01 | 46.5% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 46.4% | |
| 4 | #4Gemini 3.8 Flash(unknown) | 2026-09-02 | 44.5% | |
| 5 | #5OGPT-5.4 Pro | OpenAI | 2026-03-05 | 44.3% |
| 6 | #6Muse Spark | Meta | 2026-04-08 | 40.6% |
| 7 | #7Gemini 3 Pro Preview | 2025-11-18 | 37.5% | |
| 8 | #8OGPT-5.4(xhigh) | OpenAI | 2026-03-05 | 36.2% |
| 9 | #9Claude Opus 4.7(unknown) | Anthropic | 2026-04-16 | 36.2% |
| 10 | #10Claude Opus 4.6(max) | Anthropic | 2026-02-05 | 34.4% |
| 11 | #11OGPT-5 Pro | OpenAI | 2025-10-07 | 31.6% |
| 12 | #12OGPT-5.2(unknown thinking) | OpenAI | 2025-12-11 | 27.8% |
| 13 | #13OGPT-5(high) | OpenAI | 2025-08-07 | 25.3% |
| 14 | #14Claude Opus 4.5(unknown thinking) | Anthropic | 2025-11-24 | 25.2% |
| 15 | #15Kimi K2.5 | Moonshot AI | 2026-01-27 | 24.4% |
| 16 | #16OGPT-5.1(unknown thinking) | OpenAI | 2025-11-13 | 23.7% |
| 17 | #17Gemini 2.5 Pro Preview(Jun 2025) | 2025-06-05 | 21.6% | |
| 18 | #18Oo3(high) | OpenAI | 2025-04-16 | 20.3% |
| 19 | #19OGPT-5 mini(unknown thinking) | OpenAI | 2025-08-07 | 19.4% |
| 20 | #20Gemini 2.5 Pro Exp(Mar 2025) | 2025-03-25 | 18.2% | |
| 21 | #21Oo4-mini(high) | OpenAI | 2025-04-16 | 18.1% |
| 22 | #22Claude Sonnet 4.5(unknown thinking) | Anthropic | 2025-09-29 | 13.7% |
| 23 | #23Gemini 2.5 Flash Preview(Apr 2025) | 2025-04-17 | 12.1% | |
| 24 | #24Claude Opus 4.1(unknown thinking) | Anthropic | 2025-08-05 | 11.5% |
| 25 | #25gemini-2.5-flash-preview-05-20 | 2025-05-20 | 11.0% | |
| 26 | #26Claude Opus 4 | Anthropic | 2025-05-22 | 10.7% |
| 27 | #27Gemini 3.1 Flash-Lite | 2026-03-03 | 8.6% | |
| 28 | #28Zglm-4.5 | Z.ai | 2025-08-03 | 8.3% |
| 29 | #29ZGLM-4.5-Air | Z.ai | 2025-07-20 | 8.1% |
| 30 | #30Oo1 Pro | OpenAI | 2025-03-19 | 8.1% |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings