Valumigo

Epoch AI · 事実に関する質問の正答率(SimpleQA Verified)

公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

このランキングの読み方

測定する能力: 短い事実質問に正確に答えられるかを評価するSimpleQA Verifiedです。Google DeepMind・Google ResearchがOpenAIのSimpleQAを基に、重複や正解の誤りなどを減らした1,000問の評価です。

スコアの読み方: Epochが表示する値は、全質問のうち正答した割合(%)です。Googleの公式評価のF1指標とは異なり、このスコアだけではハルシネーションや回答拒否の傾向をすべて評価できません。

注意点: 検索ツールを使わず、モデル内部の知識で回答する条件なので、検索を有効にしたサービスの正確性とは異なる場合があります。Epochは回答拒否を減らす追加指示を使用します。

今回のランキングから読み取れること

  • 最高スコアはGPT-6 Astraの75.6%です。
  • 1位と5位の差は4.8%pです。
  • 上位10モデルのうち、Googleのモデルが4モデルで最も多くなっています。
  • この試験の結果が公開されているモデルは30件です。

事実に関する質問の正答率(SimpleQA Verified) Epoch AI

Epoch AIが直接測定したスコアや、開発元・評価機関が公表したスコアをまとめたデータです。テストごとに評価対象のモデルが異なるため、最新モデルがまだ掲載されていない場合もあります。同じモデルの推論強度別の結果から、最も高いスコアを表示しています。 · 取得日 2026-10-04

OGPT-6 Astra
75.6%
OGPT-6.1 Sol
73.9%
GoogleGemini 3.1 Pro Preview
73.5%
AnthropicClaude Opus 5.5
72.2%
AnthropicClaude Fable 5.1
70.8%
AnthropicClaude Fable 5
70.7%
GoogleGemini 3.8 Flash
69.7%
OGPT-5.6 Sol
69.7%
GoogleGemini 3.7 Flash
69.2%
GoogleGemini 3 Flash Preview
66.8%
GoogleGemini 3.5 Flash
66.2%
GoogleGemini 3.6 Flash
66.2%
OGPT-5.5
63.0%
OGPT-6 Sol
60.7%
MetaMuse Spark 1.2
60.3%
AnthropicClaude Opus 5
59.9%
MetaMuse Spark 1.1
57.8%
xGrok 4.7
56.0%
AlibabaQwen3.7 Max
55.8%
AnthropicClaude Opus 4.8
53.0%

棒は正答率(%)を示し、0%から描画しています。

表で見る(上位30件)
順位モデル開発元リリース日スコア
1#1OGPT-6 Astra(max)OpenAI2026-09-0375.6%
2#2OGPT-6.1 Sol(max)OpenAI2026-09-2973.9%
3#3GoogleGemini 3.1 Pro PreviewGoogle2026-02-1973.5%
4#4AnthropicClaude Opus 5.5(max)Anthropic2026-09-2272.2%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0170.8%
6#6AnthropicClaude Fable 5(xhigh)Anthropic2026-06-0970.7%
7#7GoogleGemini 3.8 Flash(high)Google2026-09-0269.7%
8#8OGPT-5.6 Sol(max)OpenAI2026-07-0969.7%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1369.2%
10#10GoogleGemini 3 Flash PreviewGoogle2025-12-1766.8%
11#11GoogleGemini 3.5 FlashGoogle2026-05-1966.2%
12#12GoogleGemini 3.6 FlashGoogle2026-07-2166.2%
13#13OGPT-5.5(xhigh)OpenAI2026-04-2363.0%
14#14OGPT-6 Sol(max)OpenAI2026-09-2260.7%
15#15MetaMuse Spark 1.2(xhigh)Meta2026-08-0560.3%
16#16AnthropicClaude Opus 5(max)Anthropic2026-07-2459.9%
17#17MetaMuse Spark 1.1Meta2026-07-0957.8%
18#18xGrok 4.7(xhigh)xAI2026-09-2156.0%
19#19AlibabaQwen3.7 MaxAlibaba2026-05-1955.8%
20#20AnthropicClaude Opus 4.8Anthropic2026-05-2853.0%
21#21DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1352.9%
22#22AlibabaQwen 3.6 Max(Preview)Alibaba2026-04-2052.0%
23#23AnthropicClaude Opus 4.7(xhigh)Anthropic2026-04-1651.7%
24#24Moonshot AIKimi K3(max)Moonshot AI2026-07-1650.6%
25#25OGPT-5(high)OpenAI2025-08-0750.1%
26#26Oo3(high)OpenAI2025-04-1649.4%
27#27xGrok 4.6(high)xAI2026-08-1249.3%
28#28AlibabaQwen3-Max-InstructAlibaba2025-09-2448.7%
29#29xGrok 4.5(high)xAI2026-07-0848.3%
30#30OGPT-5.1(high)OpenAI2025-11-1348.0%

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings