Valumigo

Epoch AI · 综合能力指数(ECI)

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: 这是 Epoch AI 将多项基准分数合并到共同尺度上的综合能力指数。通过统计方法估计各基准的难度和分数变化特征,使参加不同测试的模型也能相互比较。

如何解读分数: 这是相对能力的估计值,并非正确率。分数差距不能直接换算为实际使用中感受到的差异。可用于参考模型在多项测试中的整体位置。

注意事项: 特定用途的能力还需单独查看对应基准。新增评估结果或纳入的基准时,估计值和不确定性可能发生变化。

本次排名的解读要点

  • 最高分为 Claude Opus 5.5 的 167.4。
  • 第 1 名与第 5 名的差距为 4.5。
  • 前 10 个模型中,Anthropic 的模型有 5 个,数量最多。
  • 已有 60 个模型公开了此测试的结果。

综合能力指数(ECI) Epoch AI

ECI 是 Epoch AI 将多项测试结果整合而成的综合指数。分数越高,代表整体能力越强。 · 获取日期:2026-10-04

156159162165168
AnthropicClaude Opus 5.5
167.4
OGPT-6 Astra
166.5
AnthropicClaude Sonnet 5.5
165.2
AnthropicClaude Fable 5.1
164.8
AnthropicClaude Opus 5
162.9
OGPT-5.5 Pro
162.4
AnthropicClaude Fable 5
162.2
OGPT-5.6 Sol
161.8
OGPT-5.6 Terra
159.8
OGPT-5.5
159.2
OGPT-5.4 Pro
159.1
AnthropicClaude Opus 4.8
158.3
Moonshot AIKimi K3
157.6
GoogleGemini 3.7 Flash
157.4
GoogleGemini 3.8 Flash
156.9
OGPT-5.4
156.9
MetaMuse Spark 1.3
156.9
OGPT-5.3 Codex
156.8
xGrok 4.6
156.6
AlibabaQwen 3.8 Max
156.6
查看表格(前 40 名)
排名模型开发方发布日期分数
1#1AnthropicClaude Opus 5.5Anthropic2026-09-22167.4
2#2OGPT-6 AstraOpenAI2026-09-03166.5
3#3AnthropicClaude Sonnet 5.5Anthropic2026-09-28165.2
4#4AnthropicClaude Fable 5.1Anthropic2026-09-01164.8
5#5AnthropicClaude Opus 5Anthropic2026-07-24162.9
6#6OGPT-5.5 ProOpenAI2026-04-23162.4
7#7AnthropicClaude Fable 5Anthropic2026-06-09162.2
8#8OGPT-5.6 SolOpenAI2026-07-09161.8
9#9OGPT-5.6 TerraOpenAI2026-07-09159.8
10#10OGPT-5.5OpenAI2026-04-23159.2
11#11OGPT-5.4 ProOpenAI2026-03-05159.1
12#12AnthropicClaude Opus 4.8Anthropic2026-05-28158.3
13#13Moonshot AIKimi K3Moonshot AI2026-07-16157.6
14#14GoogleGemini 3.7 FlashGoogle2026-08-13157.4
15#15GoogleGemini 3.8 FlashGoogle2026-09-02156.9
16#16OGPT-5.4OpenAI2026-03-05156.9
17#17MetaMuse Spark 1.3Meta2026-09-02156.9
18#18OGPT-5.3 CodexOpenAI2026-02-05156.8
19#19xGrok 4.6xAI2026-08-12156.6
20#20AlibabaQwen 3.8 MaxAlibaba2026-08-02156.6
21#21OGPT-5.6 LunaOpenAI2026-07-09156.5
22#22AnthropicClaude Opus 4.7Anthropic2026-04-16156.4
23#23AnthropicClaude Sonnet 5Anthropic2026-06-30156.3
24#24ZGLM-5.3Z.ai2026-08-14155.8
25#25OGPT-5.2 ProOpenAI2025-12-11155.4
26#26DeepSeekDeepSeek V4 Pro 0813DeepSeek2026-08-13155.4
27#27AnthropicClaude Opus 4.6Anthropic2026-02-05155.3
28#28AlibabaQwen3.8 Max (0902)Alibaba2026-09-01155.2
29#29DeepSeekDeepSeek V4.1 FlashDeepSeek2026-09-09155
30#30MetaMuse Spark 1.2Meta2026-08-05155
31#31GoogleGemini 3.1 ProGoogle2026-02-19154.8
32#32DeepSeekDeepSeek V4 Flash 0731DeepSeek2026-07-31154.5
33#33GoogleGemini 3.5 FlashGoogle2026-05-19154.5
34#34GoogleGemini 3.6 FlashGoogle2026-07-21154.3
35#35MetaMuse Spark 1.1Meta2026-07-09154.3
36#36xGrok 4.5xAI2026-07-08154
37#37AlibabaQwen3.7-MaxAlibaba2026-05-19153.7
38#38OGPT-5.2OpenAI2025-12-11153.5
39#39GoogleGemini 3 ProGoogle2025-11-18153
40#40AnthropicClaude Sonnet 4.6Anthropic2026-02-17152.3

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings