Valumigo

Epoch AI · 陌生谜题推理(ARC-AGI-2)

定期获取并展示公开的基准测试资料(LMArena 用户投票排名、Epoch AI 测试分数、OpenRouter 使用量排名)。每个榜单均标注数据发布日期和获取日期。这些分数并非本站自行评定。

LMArena 分数来自用户并排查看两个模型的回答,再投票选出更好的一方(Elo 方式)。如果分数差异在置信区间内,可视为水平基本相近。

如何解读此排行榜

衡量什么: 这是 ARC Prize Foundation 创建的 ARC-AGI-2。模型需从彩色网格的输入与输出示例中推断变换规则,并应用于新输入。这些任务被设计为人类可以解决、但 AI 难以解决。

如何解读分数: 正确预测目标网格的比例(%)。采用 pass@2 方式评估,每个测试输入允许提交两次答案。

注意事项: 分数可能因推理计算量和解题方式而异。请同时查看评估集、尝试条件及每题成本。

本次排名的解读要点

  • 最高分为 GPT-6 Astra 的 95.0%。
  • 第 1 名与第 5 名的差距为 5.0%p。
  • 前 10 个模型中,OpenAI 的模型有 4 个,数量最多。
  • 已有 30 个模型公开了此测试的结果。

陌生谜题推理(ARC-AGI-2) Epoch AI

数据汇总了 Epoch AI 实测以及开发商或评测机构公布的分数。各项测试评估的模型不同,部分测试尚未包含最新模型。同一模型在不同推理强度下的结果中,仅展示最高分。 · 获取日期:2026-10-04

OGPT-6 Astra
95.0%
OGPT-5.6 Sol
92.5%
AnthropicClaude Opus 5.5
92.5%
AnthropicClaude Opus 5
90.4%
AnthropicClaude Fable 5.1
90.0%
OGPT-6 Sol
89.6%
AnthropicClaude Fable 5
89.2%
OGPT-5.5
85.0%
GoogleGemini 3.7 Flash
84.6%
GoogleGemini 3 Deep Think
84.6%
OGPT-5.5 Pro
84.6%
OGPT-5.6 Terra
83.9%
OGPT-5.4 Pro
83.3%
GoogleGemini 3.1 Pro Preview
77.1%
AnthropicClaude Opus 4.7
75.8%
OGPT-5.4
74.0%
GoogleGemini 3.5 Flash
72.1%
AnthropicClaude Opus 4.8
72.1%
AnthropicClaude Opus 4.6
69.2%
xGrok 4.6
67.1%

柱状条表示正确率(%),从 0% 起绘制。

查看表格(前 30 名)
排名模型开发方发布日期分数
1#1OGPT-6 Astra(max)OpenAI2026-09-0395.0%
2#2OGPT-5.6 Sol(max)OpenAI2026-07-0992.5%
3#3AnthropicClaude Opus 5.5(xhigh)Anthropic2026-09-2292.5%
4#4AnthropicClaude Opus 5(max)Anthropic2026-07-2490.4%
5#5AnthropicClaude Fable 5.1(max)Anthropic2026-09-0190.0%
6#6OGPT-6 Sol(max)OpenAI2026-09-2289.6%
7#7AnthropicClaude Fable 5(max)Anthropic2026-06-0989.2%
8#8OGPT-5.5(xhigh)OpenAI2026-04-2385.0%
9#9GoogleGemini 3.7 Flash(high)Google2026-08-1384.6%
10#10GoogleGemini 3 Deep ThinkGoogle2026-02-1284.6%
11#11OGPT-5.5 Pro(high)OpenAI2026-04-2384.6%
12#12OGPT-5.6 Terra(max)OpenAI2026-07-0983.9%
13#13OGPT-5.4 Pro(xhigh)OpenAI2026-03-0583.3%
14#14GoogleGemini 3.1 Pro PreviewGoogle2026-02-1977.1%
15#15AnthropicClaude Opus 4.7(max)Anthropic2026-04-1675.8%
16#16OGPT-5.4(xhigh)OpenAI2026-03-0574.0%
17#17GoogleGemini 3.5 FlashGoogle2026-05-1972.1%
18#18AnthropicClaude Opus 4.8Anthropic2026-05-2872.1%
19#19AnthropicClaude Opus 4.6(120k thinking)Anthropic2026-02-0569.2%
20#20xGrok 4.6(xhigh)xAI2026-08-1267.1%
21#21xgrok-4-20xAI2026-02-1765.1%
22#22DeepSeekDeepSeek V4 Flash 0731(max)DeepSeek2026-07-3161.4%
23#23DeepSeekDeepSeek V4 Pro 0813(max)DeepSeek2026-08-1361.3%
24#24AnthropicClaude Sonnet 4.6(high)Anthropic2026-02-1760.4%
25#25Moonshot AIKimi K3(max)Moonshot AI2026-07-1660.4%
26#26GoogleGemini 3.6 FlashGoogle2026-07-2160.4%
27#27OGPT-5.6 Luna(max)OpenAI2026-07-0959.5%
28#28OGPT-6 Luna(max)OpenAI2026-09-2259.3%
29#29OGPT-5.2 ProOpenAI2025-12-1154.2%
30#30OGPT-5.2(xhigh)OpenAI2025-12-1152.9%

数据:LMArena leaderboard dataset(CC BY 4.0)。修改:各榜单仅显示前 50 名,分数四舍五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset公司标志为各公司的商标,仅用于帮助区分(图标:Simple Icons)。数据:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings