Valumigo

AIベンチマークランキング

公開ベンチマークデータ(LMArenaのユーザー投票ランキング、Epoch AIのテストスコア)を定期的に取得して掲載しています。各ランキングの公開日と取得日を表示しています。当サイトが独自に採点したものではありません。

最新モデルを一覧で

過去120日以内に公開されたモデルをリリース日順に並べ、2つの公開データソースのスコアを1行にまとめました。スコアは正答率(%)です。

モデルリリース日総合指数GPQA DiamondFrontierMathHLEARC-AGI-2SWE-bench VerifiedLMArena総合順位LMArena 日本語順位
OGPT-6.1 SolOpenAI2026-09-29–95.493.7–––#60未掲載
AnthropicClaude Sonnet 5.5Anthropic2026-09-28165.295.688.8–––#34未掲載
AnthropicClaude Opus 5.5Anthropic2026-09-22167.4–91.2–92.5–#2未掲載
OGPT-6 SolOpenAI2026-09-22–94.389.8–89.6–#158未掲載
OGPT-6 LunaOpenAI2026-09-22––78.9–59.3–#163#115
DeepSeekDeepSeek V4.1 FlashDeepSeek2026-09-09155–––––#37未掲載
OGPT-6 AstraOpenAI2026-09-03166.595.893.754.895–#71#92
GoogleGemini 3.8 FlashGoogle2026-09-02156.995.468.444.5––#8#7
MetaMuse Spark 1.3Meta2026-09-02156.9–74.4–––#12#13
AnthropicClaude Fable 5.1Anthropic2026-09-01164.8–90.246.590–#3#1
AlibabaQwen3.8 Max (0902)Alibaba2026-09-01155.292.365.6–––未掲載未掲載
ZGLM-5.3-FlashZ.ai2026-08-20151.9–––––#30#43
ZGLM-5.3Z.ai2026-08-14155.890.968.8–––#26#33
AlibabaQwen 3.8 27BAlibaba2026-08-14149.4–––––#74#78
GoogleGemini 3.7 FlashGoogle2026-08-13157.494.871.6–84.6–#13#6
DeepSeekDeepSeek V4 Pro 0813DeepSeek2026-08-13155.491.7––61.3–未掲載未掲載

新モデルは十分な投票が集まるとランキング(特に言語別ランキング)に掲載されます。リリース直後は「未掲載」と表示されることがあります。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

日本語 LMArena

公開日 2026-10-02 · 取得日 2026-10-04

14401480152015601600
Anthropicclaude-fable-5.1-max
1551
Anthropicclaude-opus-5-high
1513
Googlegemini-3-pro
1513
Anthropicclaude-opus-5-max
1511
Anthropicclaude-fable-5-high
1510
Googlegemini-3.7-flash-high
1503
Googlegemini-3.8-flash-high
1503
Alibabaqwen3.5-max-preview
1497
Ogpt-5.5-high
1497
Googlegemini-3.1-pro-preview
1495
Moonshot AIkimi-k3-max
1488
Googlegemini-3-flash
1488
Metamuse-spark-1.3-max
1487
Googlegemini-3.5-flash-high
1486
Anthropicclaude-opus-4-6-high
1484
Ogpt-5.4-high
1483
Googlegemini-3.6-flash-high
1476
Anthropicclaude-opus-4-6
1474
Ogpt-5.5
1474
Ogpt-5.6-sol-xhigh
1471

点はスコア、横線は95%信頼区間です。線が重なる場合、実質的に同程度です。

表で見る(上位50件)
順位モデル開発元スコア95%信頼区間投票数
1Anthropicclaude-fable-5.1-maxAnthropic15511506–1596200
2Anthropicclaude-opus-5-highAnthropic15131491–1536958
3Googlegemini-3-proGoogle15131483–1543471
4Anthropicclaude-opus-5-maxAnthropic15111482–1541482
5Anthropicclaude-fable-5-highAnthropic15101482–1537538
6Googlegemini-3.7-flash-highGoogle15031470–1537340
7Googlegemini-3.8-flash-highGoogle15031473–1533462
8Alibabaqwen3.5-max-previewAlibaba14971453–1542207
9Ogpt-5.5-highOpenAI14971475–1519895
10Googlegemini-3.1-pro-previewGoogle14951477–15131,409
11Moonshot AIkimi-k3-maxMoonshot AI14881460–1517508
12Googlegemini-3-flashGoogle14881454–1522337
13Metamuse-spark-1.3-maxMeta14871441–1533188
14Googlegemini-3.5-flash-highGoogle14861461–1511672
15Anthropicclaude-opus-4-6-highAnthropic14841461–1506845
16Ogpt-5.4-highOpenAI14831459–1508671
17Googlegemini-3.6-flash-highGoogle14761450–1502598
18Anthropicclaude-opus-4-6Anthropic14741452–1496875
19Ogpt-5.5OpenAI14741451–1497800
20Ogpt-5.6-sol-xhighOpenAI14711443–1498549
21Anthropicclaude-opus-4-7-highAnthropic14701445–1494705
22Alibabaqwen3.8-maxAlibaba14681436–1500402
23Googlegemini-3.5-flash-mediumGoogle14631437–1488668
24Googlegemini-2.5-proGoogle14621447–14762,037
25Anthropicclaude-opus-4-7Anthropic14611438–1484797
26Ogpt-5.1-highOpenAI14531425–1481458
27Metamuse-spark-1.1Meta14511426–1476633
28Zglm-5.2-maxZ.ai14501426–1475702
29xgrok-4.20-beta1xAI14501410–1490225
30Ogpt-5.4OpenAI14491425–1473680
31Ogpt-5.6-terra-xhighOpenAI14471420–1474559
32DeepSeekdeepseek-v4-proDeepSeek14471423–1470715
33Zglm-5.3-maxZ.ai14451411–1480327
34Moonshot AIkimi-k2.6Moonshot AI14421413–1470497
35Zglm-4.7Z.ai14391384–1493123
36Anthropicclaude-opus-4-8Anthropic14381416–1460874
37Anthropicclaude-opus-4-8-highAnthropic14381416–1460881
38Zglm-5.1Z.ai14341410–1457754
39Alibabaqwen3.5-397b-a17bAlibaba14271407–14471,032
40Googlegemini-3.5-flash-liteGoogle14271400–1454565
41xgrok-4.5xAI14271399–1454522
42TinklingThinky14261399–1454521
43Zglm-5.3-flashZ.ai14251394–1456408
44Ogpt-5.1OpenAI14251396–1453453
45Googlegemini-3-flash (thinking-minimal)Google14231401–1445847
46Baiduernie-5.1Baidu14211394–1449510
47Moonshot AIkimi-k2.5-thinkingMoonshot AI14211399–1443842
48Ogpt-5.2-highOpenAI14211391–1450443
49Anthropicclaude-sonnet-5-highAnthropic14201395–1445662
50Anthropicclaude-sonnet-4-6Anthropic14191397–1442792

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarks