LMArena · AI検索
公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。
このランキングの読み方
測定する能力: ウェブ検索を活用するAIシステムの回答を比較し、投票したランキングです。最新情報に関する質問を含む、さまざまな検索を活用した依頼を扱います。
スコアの読み方: ユーザーがより好んだ検索回答の相対スコアです。標準の選好スコアと、事実の正確性を追加で反映するFactuality補正指標を区別してください。
注意点: 更新日と検索ツール・実行条件を確認してください。このスコアを、実際のサービスのすべての検索回答の正確性として解釈しないでください。
今回のランキングから読み取れること
- 1位のgpt-5.6-sol-xhighと2位のclaude-opus-4-6-searchの95%信頼区間は重なっています。この集計だけで2つのモデルの順位を確定するのは困難です。
- 上位10モデルのうち、Anthropicのモデルが4モデルで最も多くなっています。
- 1位のモデルが獲得した投票は29,663票で、このランキングには34件のモデルがあります。
AI検索 LMArena
公開日 2026-08-24 · 取得日 2026-10-04
点はスコア、横線は95%信頼区間です。線が重なる場合、実質的に同程度です。 グラフには、同じモデルの推論設定(high・maxなど)のうち、スコアが最も高いものだけを表示しています。表には設定ごとの順位をすべて掲載しています。
企業別の最高順位
- OOpenAIgpt-5.6-sol-xhigh#1
- Anthropicclaude-opus-4-6-search#2
- Baiduernie-5.1#6
- xxAIgrok-4.5#8
- Googlegemini-3.1-pro-grounding#9
- Perplexityppl-sonar-reasoning-pro-high#29
- DDiffbotdiffbot-small-xl#33
表で見る(上位50件)
| 順位 | モデル | 開発元 | スコア | 95%信頼区間 | 投票数 |
|---|---|---|---|---|---|
| 1 | #1Ogpt-5.6-sol-xhigh | OpenAI | 1257 | 1250–1265 | 29,663 |
| 2 | #2claude-opus-4-6-search | Anthropic | 1253 | 1248–1258 | 134,699 |
| 3 | #3Ogpt-5.5-search | OpenAI | 1242 | 1237–1247 | 89,873 |
| 4 | #4claude-opus-4-7 | Anthropic | 1233 | 1228–1239 | 91,394 |
| 5 | #5claude-fable-5 | Anthropic | 1230 | 1222–1238 | 41,795 |
| 6 | #6ernie-5.1 | Baidu | 1227 | 1217–1237 | 3,788 |
| 7 | #7claude-sonnet-4-6-search | Anthropic | 1221 | 1216–1226 | 134,905 |
| 8 | #8xgrok-4.5 | xAI | 1213 | 1206–1220 | 31,505 |
| 9 | #9gemini-3.1-pro-grounding | 1210 | 1205–1216 | 113,282 | |
| 10 | #10gemini-3-pro-grounding | 1207 | 1202–1213 | 37,024 | |
| 11 | #11Ogpt-5.2-search | OpenAI | 1207 | 1201–1213 | 52,712 |
| 12 | #12claude-opus-4-8 | Anthropic | 1204 | 1198–1211 | 70,998 |
| 13 | #13xgrok-4.20-multi-agent-beta-0309 | xAI | 1204 | 1199–1209 | 109,553 |
| 14 | #14Ogpt-5.1-search | OpenAI | 1199 | 1194–1205 | 59,909 |
| 15 | #15gemini-3-flash-grounding | 1198 | 1193–1203 | 149,334 | |
| 16 | #16Ogpt-5.4-search | OpenAI | 1197 | 1192–1203 | 110,116 |
| 17 | #17claude-sonnet-5-search | Anthropic | 1194 | 1187–1201 | 40,230 |
| 18 | #18xgrok-4.20-beta1 | xAI | 1189 | 1183–1195 | 53,921 |
| 19 | #19claude-opus-4-5-search | Anthropic | 1180 | 1174–1185 | 61,573 |
| 20 | #20Ogpt-5.2-search-non-reasoning | OpenAI | 1172 | 1167–1178 | 75,658 |
| 21 | #21xgrok-4-1-fast-search | xAI | 1171 | 1166–1176 | 81,507 |
| 22 | #22xgrok-4-fast-search | xAI | 1171 | 1166–1175 | 41,794 |
| 23 | #23xgrok-4.3 | xAI | 1165 | 1160–1170 | 91,483 |
| 24 | #24claude-sonnet-4-5-search | Anthropic | 1158 | 1153–1163 | 127,378 |
| 25 | #25claude-opus-4-1-search | Anthropic | 1148 | 1143–1153 | 76,933 |
| 26 | #26Oo3-search | OpenAI | 1144 | 1139–1150 | 20,644 |
| 27 | #27gemini-2.5-pro-grounding | 1142 | 1137–1146 | 83,404 | |
| 28 | #28xgrok-4-search | xAI | 1142 | 1136–1147 | 19,108 |
| 29 | #29ppl-sonar-reasoning-pro-high | Perplexity | 1139 | 1133–1144 | 29,055 |
| 30 | #30Ogpt-5-search | OpenAI | 1133 | 1127–1139 | 20,781 |
| 31 | #31ppl-sonar-pro-high | Perplexity | 1130 | 1124–1136 | 28,519 |
| 32 | #32claude-opus-4-search | Anthropic | 1126 | 1121–1132 | 31,037 |
| 33 | #33Ddiffbot-small-xl | Diffbot | 1023 | 1014–1031 | 6,388 |
| 34 | #34Oapi-gpt-4o-search | OpenAI | 1006 | 995–1017 | 3,411 |
データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings