Epoch AI · 事実に関する質問の正答率(SimpleQA Verified)
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: 短い事実質問に正確に答えられるかを評価するSimpleQA Verifiedです。Google DeepMind・Google ResearchがOpenAIのSimpleQAを基に、重複や正解の誤りなどを減らした1,000問の評価です。
スコアの読み方: Epochが表示する値は、全質問のうち正答した割合(%)です。Googleの公式評価のF1指標とは異なり、このスコアだけではハルシネーションや回答拒否の傾向をすべて評価できません。
注意点: 検索ツールを使わず、モデル内部の知識で回答する条件なので、検索を有効にしたサービスの正確性とは異なる場合があります。Epochは回答拒否を減らす追加指示を使用します。
今回のランキングから読み取れること
- 最高スコアはGPT-6 Astraの75.6%です。
- 1位と5位の差は4.8%pです。
- 上位10モデルのうち、Googleのモデルが4モデルで最も多くなっています。
- この試験の結果が公開されているモデルは30件です。
事実に関する質問の正答率(SimpleQA Verified) Epoch AI
Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04
棒は正答率(%)を示し、0%から描画しています。
表で見る(上位30件)
| 順位 | モデル | 開発元 | リリース日 | スコア |
|---|---|---|---|---|
| 1 | #1OGPT-6 Astra(max) | OpenAI | 2026-09-03 | 75.6% |
| 2 | #2OGPT-6.1 Sol(max) | OpenAI | 2026-09-29 | 73.9% |
| 3 | #3Gemini 3.1 Pro Preview | 2026-02-19 | 73.5% | |
| 4 | #4Claude Opus 5.5(max) | Anthropic | 2026-09-22 | 72.2% |
| 5 | #5Claude Fable 5.1(max) | Anthropic | 2026-09-01 | 70.8% |
| 6 | #6Claude Fable 5(xhigh) | Anthropic | 2026-06-09 | 70.7% |
| 7 | #7Gemini 3.8 Flash(high) | 2026-09-02 | 69.7% | |
| 8 | #8OGPT-5.6 Sol(max) | OpenAI | 2026-07-09 | 69.7% |
| 9 | #9Gemini 3.7 Flash(high) | 2026-08-13 | 69.2% | |
| 10 | #10Gemini 3 Flash Preview | 2025-12-17 | 66.8% | |
| 11 | #11Gemini 3.5 Flash | 2026-05-19 | 66.2% | |
| 12 | #12Gemini 3.6 Flash | 2026-07-21 | 66.2% | |
| 13 | #13OGPT-5.5(xhigh) | OpenAI | 2026-04-23 | 63.0% |
| 14 | #14OGPT-6 Sol(max) | OpenAI | 2026-09-22 | 60.7% |
| 15 | #15Muse Spark 1.2(xhigh) | Meta | 2026-08-05 | 60.3% |
| 16 | #16Claude Opus 5(max) | Anthropic | 2026-07-24 | 59.9% |
| 17 | #17Muse Spark 1.1 | Meta | 2026-07-09 | 57.8% |
| 18 | #18xGrok 4.7(xhigh) | xAI | 2026-09-21 | 56.0% |
| 19 | #19Qwen3.7 Max | Alibaba | 2026-05-19 | 55.8% |
| 20 | #20Claude Opus 4.8 | Anthropic | 2026-05-28 | 53.0% |
| 21 | #21DeepSeek V4 Pro 0813(max) | DeepSeek | 2026-08-13 | 52.9% |
| 22 | #22Qwen 3.6 Max(Preview) | Alibaba | 2026-04-20 | 52.0% |
| 23 | #23Claude Opus 4.7(xhigh) | Anthropic | 2026-04-16 | 51.7% |
| 24 | #24Kimi K3(max) | Moonshot AI | 2026-07-16 | 50.6% |
| 25 | #25OGPT-5(high) | OpenAI | 2025-08-07 | 50.1% |
| 26 | #26Oo3(high) | OpenAI | 2025-04-16 | 49.4% |
| 27 | #27xGrok 4.6(high) | xAI | 2026-08-12 | 49.3% |
| 28 | #28Qwen3-Max-Instruct | Alibaba | 2025-09-24 | 48.7% |
| 29 | #29xGrok 4.5(high) | xAI | 2026-07-08 | 48.3% |
| 30 | #30OGPT-5.1(high) | OpenAI | 2025-11-13 | 48.0% |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings