Valumigo

Epoch AI · 総合能力指数(ECI)

公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

このランキングの読み方

測定する能力: Epoch AIが複数のベンチマークのスコアを共通の尺度にまとめた総合能力指数です。ベンチマークごとの難易度やスコアの変化特性を統計的に推定し、異なる試験を受けたモデルも比較できるようにした値です。

スコアの読み方: 正答率ではなく、相対的な能力の推定値です。スコアの差を、実際の利用で感じる差に直接換算することはできません。複数の試験での総合的な位置を把握する際の参考にしてください。

注意点: 特定の用途に必要な能力は、該当するベンチマークも個別に確認してください。評価結果や対象ベンチマークが追加されると、推定値や不確実性が変わる場合があります。

今回のランキングから読み取れること

  • 最高スコアはClaude Opus 5.5の167.4です。
  • 1位と5位の差は4.5です。
  • 上位10モデルのうち、Anthropicのモデルが5モデルで最も多くなっています。
  • この試験の結果が公開されているモデルは60件です。

総合能力指数(ECI) Epoch AI

ECIは、Epoch AIが複数のテスト結果をまとめた総合指数です。スコアが高いほど、全般的な能力が高いことを示します。 · 取得日 2026-10-04

156159162165168
AnthropicClaude Opus 5.5
167.4
OGPT-6 Astra
166.5
AnthropicClaude Sonnet 5.5
165.2
AnthropicClaude Fable 5.1
164.8
AnthropicClaude Opus 5
162.9
OGPT-5.5 Pro
162.4
AnthropicClaude Fable 5
162.2
OGPT-5.6 Sol
161.8
OGPT-5.6 Terra
159.8
OGPT-5.5
159.2
OGPT-5.4 Pro
159.1
AnthropicClaude Opus 4.8
158.3
Moonshot AIKimi K3
157.6
GoogleGemini 3.7 Flash
157.4
GoogleGemini 3.8 Flash
156.9
OGPT-5.4
156.9
MetaMuse Spark 1.3
156.9
OGPT-5.3 Codex
156.8
xGrok 4.6
156.6
AlibabaQwen 3.8 Max
156.6
表で見る(上位40件)
順位モデル開発元リリース日スコア
1#1AnthropicClaude Opus 5.5Anthropic2026-09-22167.4
2#2OGPT-6 AstraOpenAI2026-09-03166.5
3#3AnthropicClaude Sonnet 5.5Anthropic2026-09-28165.2
4#4AnthropicClaude Fable 5.1Anthropic2026-09-01164.8
5#5AnthropicClaude Opus 5Anthropic2026-07-24162.9
6#6OGPT-5.5 ProOpenAI2026-04-23162.4
7#7AnthropicClaude Fable 5Anthropic2026-06-09162.2
8#8OGPT-5.6 SolOpenAI2026-07-09161.8
9#9OGPT-5.6 TerraOpenAI2026-07-09159.8
10#10OGPT-5.5OpenAI2026-04-23159.2
11#11OGPT-5.4 ProOpenAI2026-03-05159.1
12#12AnthropicClaude Opus 4.8Anthropic2026-05-28158.3
13#13Moonshot AIKimi K3Moonshot AI2026-07-16157.6
14#14GoogleGemini 3.7 FlashGoogle2026-08-13157.4
15#15GoogleGemini 3.8 FlashGoogle2026-09-02156.9
16#16OGPT-5.4OpenAI2026-03-05156.9
17#17MetaMuse Spark 1.3Meta2026-09-02156.9
18#18OGPT-5.3 CodexOpenAI2026-02-05156.8
19#19xGrok 4.6xAI2026-08-12156.6
20#20AlibabaQwen 3.8 MaxAlibaba2026-08-02156.6
21#21OGPT-5.6 LunaOpenAI2026-07-09156.5
22#22AnthropicClaude Opus 4.7Anthropic2026-04-16156.4
23#23AnthropicClaude Sonnet 5Anthropic2026-06-30156.3
24#24ZGLM-5.3Z.ai2026-08-14155.8
25#25OGPT-5.2 ProOpenAI2025-12-11155.4
26#26DeepSeekDeepSeek V4 Pro 0813DeepSeek2026-08-13155.4
27#27AnthropicClaude Opus 4.6Anthropic2026-02-05155.3
28#28AlibabaQwen3.8 Max (0902)Alibaba2026-09-01155.2
29#29DeepSeekDeepSeek V4.1 FlashDeepSeek2026-09-09155
30#30MetaMuse Spark 1.2Meta2026-08-05155
31#31GoogleGemini 3.1 ProGoogle2026-02-19154.8
32#32DeepSeekDeepSeek V4 Flash 0731DeepSeek2026-07-31154.5
33#33GoogleGemini 3.5 FlashGoogle2026-05-19154.5
34#34GoogleGemini 3.6 FlashGoogle2026-07-21154.3
35#35MetaMuse Spark 1.1Meta2026-07-09154.3
36#36xGrok 4.5xAI2026-07-08154
37#37AlibabaQwen3.7-MaxAlibaba2026-05-19153.7
38#38OGPT-5.2OpenAI2025-12-11153.5
39#39GoogleGemini 3 ProGoogle2025-11-18153
40#40AnthropicClaude Sonnet 4.6Anthropic2026-02-17152.3

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings