LMArena · AI 검색
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: 웹 검색을 활용하는 AI 시스템의 답변을 비교해 투표한 순위입니다. 최신 정보 질문을 포함한 다양한 검색 활용 요청을 다룹니다.
점수 읽는 법: 사용자가 더 선호한 검색 답변의 상대 점수입니다. 기본 선호 점수와 사실 정확도를 추가로 반영하는 Factuality 보정 지표를 구분하세요.
주의할 점: 업데이트 날짜와 검색 도구·실행 조건을 확인하세요. 이 점수를 실제 서비스의 모든 검색 답변에 대한 정확도로 해석하지 마세요.
이번 순위에서 읽을 점
- 1위 gpt-5.6-sol-xhigh와 2위 claude-opus-4-6-search의 95% 신뢰 구간이 겹칩니다. 이 집계만으로 두 모델의 순서를 확정하기는 어렵습니다.
- 상위 10개 중 Anthropic 모델이 4개로 가장 많습니다.
- 1위 모델이 받은 투표는 29,663표이고, 이 순위표에는 모델 34개가 있습니다.
AI 검색 LMArena
공개일 2026-08-24 · 가져온 날 2026-10-04
점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다.
회사별 최고 순위
- OOpenAIgpt-5.6-sol-xhigh#1
- Anthropicclaude-opus-4-6-search#2
- Baiduernie-5.1#6
- xxAIgrok-4.5#8
- Googlegemini-3.1-pro-grounding#9
- Perplexityppl-sonar-reasoning-pro-high#29
- DDiffbotdiffbot-small-xl#33
표로 보기 (상위 50개)
| 순위 | 모델 | 만든 곳 | 점수 | 95% 신뢰 구간 | 투표 수 |
|---|---|---|---|---|---|
| 1 | #1Ogpt-5.6-sol-xhigh | OpenAI | 1257 | 1250–1265 | 29,663 |
| 2 | #2claude-opus-4-6-search | Anthropic | 1253 | 1248–1258 | 134,699 |
| 3 | #3Ogpt-5.5-search | OpenAI | 1242 | 1237–1247 | 89,873 |
| 4 | #4claude-opus-4-7 | Anthropic | 1233 | 1228–1239 | 91,394 |
| 5 | #5claude-fable-5 | Anthropic | 1230 | 1222–1238 | 41,795 |
| 6 | #6ernie-5.1 | Baidu | 1227 | 1217–1237 | 3,788 |
| 7 | #7claude-sonnet-4-6-search | Anthropic | 1221 | 1216–1226 | 134,905 |
| 8 | #8xgrok-4.5 | xAI | 1213 | 1206–1220 | 31,505 |
| 9 | #9gemini-3.1-pro-grounding | 1210 | 1205–1216 | 113,282 | |
| 10 | #10gemini-3-pro-grounding | 1207 | 1202–1213 | 37,024 | |
| 11 | #11Ogpt-5.2-search | OpenAI | 1207 | 1201–1213 | 52,712 |
| 12 | #12claude-opus-4-8 | Anthropic | 1204 | 1198–1211 | 70,998 |
| 13 | #13xgrok-4.20-multi-agent-beta-0309 | xAI | 1204 | 1199–1209 | 109,553 |
| 14 | #14Ogpt-5.1-search | OpenAI | 1199 | 1194–1205 | 59,909 |
| 15 | #15gemini-3-flash-grounding | 1198 | 1193–1203 | 149,334 | |
| 16 | #16Ogpt-5.4-search | OpenAI | 1197 | 1192–1203 | 110,116 |
| 17 | #17claude-sonnet-5-search | Anthropic | 1194 | 1187–1201 | 40,230 |
| 18 | #18xgrok-4.20-beta1 | xAI | 1189 | 1183–1195 | 53,921 |
| 19 | #19claude-opus-4-5-search | Anthropic | 1180 | 1174–1185 | 61,573 |
| 20 | #20Ogpt-5.2-search-non-reasoning | OpenAI | 1172 | 1167–1178 | 75,658 |
| 21 | #21xgrok-4-1-fast-search | xAI | 1171 | 1166–1176 | 81,507 |
| 22 | #22xgrok-4-fast-search | xAI | 1171 | 1166–1175 | 41,794 |
| 23 | #23xgrok-4.3 | xAI | 1165 | 1160–1170 | 91,483 |
| 24 | #24claude-sonnet-4-5-search | Anthropic | 1158 | 1153–1163 | 127,378 |
| 25 | #25claude-opus-4-1-search | Anthropic | 1148 | 1143–1153 | 76,933 |
| 26 | #26Oo3-search | OpenAI | 1144 | 1139–1150 | 20,644 |
| 27 | #27gemini-2.5-pro-grounding | 1142 | 1137–1146 | 83,404 | |
| 28 | #28xgrok-4-search | xAI | 1142 | 1136–1147 | 19,108 |
| 29 | #29ppl-sonar-reasoning-pro-high | Perplexity | 1139 | 1133–1144 | 29,055 |
| 30 | #30Ogpt-5-search | OpenAI | 1133 | 1127–1139 | 20,781 |
| 31 | #31ppl-sonar-pro-high | Perplexity | 1130 | 1124–1136 | 28,519 |
| 32 | #32claude-opus-4-search | Anthropic | 1126 | 1121–1132 | 31,037 |
| 33 | #33Ddiffbot-small-xl | Diffbot | 1023 | 1014–1031 | 6,388 |
| 34 | #34Oapi-gpt-4o-search | OpenAI | 1006 | 995–1017 | 3,411 |
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings