Epoch AI · 初見のパズル推論(ARC-AGI-2)
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: ARC Prize Foundationが作成したARC-AGI-2です。色付きグリッドの入出力例から変換ルールを推論し、新しい入力に適用します。人間には解けてもAIには難しい課題として設計されています。
スコアの読み方: 正しいグリッドを回答できた割合(%)です。テスト入力ごとに2回の回答提出を認めるpass@2方式で評価します。
注意点: 推論時の計算量や解法によってスコアが変わる場合があります。評価セット、試行条件、問題あたりの費用も確認してください。
今回のランキングから読み取れること
- 最高スコアはGPT-6 Astraの95.0%です。
- 1位と5位の差は5.0%pです。
- 上位10モデルのうち、OpenAIのモデルが4モデルで最も多くなっています。
- この試験の結果が公開されているモデルは30件です。
初見のパズル推論(ARC-AGI-2) Epoch AI
Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04
棒は正答率(%)を示し、0%から描画しています。
表で見る(上位30件)
| 順位 | モデル | 開発元 | リリース日 | スコア |
|---|---|---|---|---|
| 1 | #1OGPT-6 Astra(max) | OpenAI | 2026-09-03 | 95.0% |
| 2 | #2OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 92.5% |
| 3 | #3Claude Opus 5.5(xhigh) | Anthropic | 2026-09-22 | 92.5% |
| 4 | #4Claude Opus 5(max) | Anthropic | 2026-07-24 | 90.4% |
| 5 | #5Claude Fable 5.1(max) | Anthropic | 2026-09-01 | 90.0% |
| 6 | #6OGPT-6 Sol(max) | OpenAI | 2026-09-22 | 89.6% |
| 7 | #7Claude Fable 5(max) | Anthropic | 2026-06-09 | 89.2% |
| 8 | #8OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 85.0% |
| 9 | #9Gemini 3.7 Flash(high) | 2026-08-13 | 84.6% | |
| 10 | #10Gemini 3 Deep Think | 2026-02-12 | 84.6% | |
| 11 | #11OGPT-5.5 Pro(high) | OpenAI | 2026-04-23 | 84.6% |
| 12 | #12OGPT-5.6 Terra(max) | OpenAI | 2026-07-09 | 83.9% |
| 13 | #13OGPT-5.4 Pro(xhigh) | OpenAI | 2026-03-05 | 83.3% |
| 14 | #14Gemini 3.1 Pro Preview | 2026-02-19 | 77.1% | |
| 15 | #15Claude Opus 4.7(max) | Anthropic | 2026-04-16 | 75.8% |
| 16 | #16OGPT-5.4(xhigh) | OpenAI | 2026-03-05 | 74.0% |
| 17 | #17Gemini 3.5 Flash | 2026-05-19 | 72.1% | |
| 18 | #18Claude Opus 4.8 | Anthropic | 2026-05-28 | 72.1% |
| 19 | #19Claude Opus 4.6(120k thinking) | Anthropic | 2026-02-05 | 69.2% |
| 20 | #20xGrok 4.6(xhigh) | xAI | 2026-08-12 | 67.1% |
| 21 | #21xgrok-4-20 | xAI | 2026-02-17 | 65.1% |
| 22 | #22DeepSeek V4 Flash 0731(max) | DeepSeek | 2026-07-31 | 61.4% |
| 23 | #23DeepSeek V4 Pro 0813(max) | DeepSeek | 2026-08-13 | 61.3% |
| 24 | #24Claude Sonnet 4.6(high) | Anthropic | 2026-02-17 | 60.4% |
| 25 | #25Kimi K3(max) | Moonshot AI | 2026-07-16 | 60.4% |
| 26 | #26Gemini 3.6 Flash | 2026-07-21 | 60.4% | |
| 27 | #27OGPT-5.6 Luna(max) | OpenAI | 2026-07-09 | 59.5% |
| 28 | #28OGPT-6 Luna(max) | OpenAI | 2026-09-22 | 59.3% |
| 29 | #29OGPT-5.2 Pro | OpenAI | 2025-12-11 | 54.2% |
| 30 | #30OGPT-5.2(xhigh) | OpenAI | 2025-12-11 | 52.9% |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings