Valumigo

LMArena · AI 검색

공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.

LMArena 점수는 사람들이 두 모델의 답을 나란히 보고 더 나은 쪽에 투표한 결과(Elo 방식)입니다. 점수 차이가 신뢰 구간 안이면 사실상 비슷한 수준으로 보세요.

이 순위표 읽는 법

무엇을 재나: 웹 검색을 활용하는 AI 시스템의 답변을 비교해 투표한 순위입니다. 최신 정보 질문을 포함한 다양한 검색 활용 요청을 다룹니다.

점수 읽는 법: 사용자가 더 선호한 검색 답변의 상대 점수입니다. 기본 선호 점수와 사실 정확도를 추가로 반영하는 Factuality 보정 지표를 구분하세요.

주의할 점: 업데이트 날짜와 검색 도구·실행 조건을 확인하세요. 이 점수를 실제 서비스의 모든 검색 답변에 대한 정확도로 해석하지 마세요.

이번 순위에서 읽을 점

  • 1위 gpt-5.6-sol-xhigh와 2위 claude-opus-4-6-search의 95% 신뢰 구간이 겹칩니다. 이 집계만으로 두 모델의 순서를 확정하기는 어렵습니다.
  • 상위 10개 중 Anthropic 모델이 4개로 가장 많습니다.
  • 1위 모델이 받은 투표는 29,663표이고, 이 순위표에는 모델 34개가 있습니다.

AI 검색 LMArena

공개일 2026-08-24 · 가져온 날 2026-10-04

114011701200123012601290
Ogpt-5.6-sol-xhigh
1257
Anthropicclaude-opus-4-6-search
1253
Ogpt-5.5-search
1242
Anthropicclaude-opus-4-7
1233
Anthropicclaude-fable-5
1230
Baiduernie-5.1
1227
Anthropicclaude-sonnet-4-6-search
1221
xgrok-4.5
1213
Googlegemini-3.1-pro-grounding
1210
Googlegemini-3-pro-grounding
1207
Ogpt-5.2-search
1207
Anthropicclaude-opus-4-8
1204
xgrok-4.20-multi-agent-beta-0309
1204
Ogpt-5.1-search
1199
Googlegemini-3-flash-grounding
1198
Ogpt-5.4-search
1197
Anthropicclaude-sonnet-5-search
1194
xgrok-4.20-beta1
1189
Anthropicclaude-opus-4-5-search
1180
Ogpt-5.2-search-non-reasoning
1172

점은 점수, 가로선은 95% 신뢰 구간입니다. 선이 겹치면 사실상 비슷한 수준입니다. 그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다.

회사별 최고 순위

  • OOpenAIgpt-5.6-sol-xhigh#1
  • AnthropicAnthropicclaude-opus-4-6-search#2
  • BaiduBaiduernie-5.1#6
  • xxAIgrok-4.5#8
  • GoogleGooglegemini-3.1-pro-grounding#9
  • PerplexityPerplexityppl-sonar-reasoning-pro-high#29
  • DDiffbotdiffbot-small-xl#33
표로 보기 (상위 50개)
순위모델만든 곳점수95% 신뢰 구간투표 수
1#1Ogpt-5.6-sol-xhighOpenAI12571250–126529,663
2#2Anthropicclaude-opus-4-6-searchAnthropic12531248–1258134,699
3#3Ogpt-5.5-searchOpenAI12421237–124789,873
4#4Anthropicclaude-opus-4-7Anthropic12331228–123991,394
5#5Anthropicclaude-fable-5Anthropic12301222–123841,795
6#6Baiduernie-5.1Baidu12271217–12373,788
7#7Anthropicclaude-sonnet-4-6-searchAnthropic12211216–1226134,905
8#8xgrok-4.5xAI12131206–122031,505
9#9Googlegemini-3.1-pro-groundingGoogle12101205–1216113,282
10#10Googlegemini-3-pro-groundingGoogle12071202–121337,024
11#11Ogpt-5.2-searchOpenAI12071201–121352,712
12#12Anthropicclaude-opus-4-8Anthropic12041198–121170,998
13#13xgrok-4.20-multi-agent-beta-0309xAI12041199–1209109,553
14#14Ogpt-5.1-searchOpenAI11991194–120559,909
15#15Googlegemini-3-flash-groundingGoogle11981193–1203149,334
16#16Ogpt-5.4-searchOpenAI11971192–1203110,116
17#17Anthropicclaude-sonnet-5-searchAnthropic11941187–120140,230
18#18xgrok-4.20-beta1xAI11891183–119553,921
19#19Anthropicclaude-opus-4-5-searchAnthropic11801174–118561,573
20#20Ogpt-5.2-search-non-reasoningOpenAI11721167–117875,658
21#21xgrok-4-1-fast-searchxAI11711166–117681,507
22#22xgrok-4-fast-searchxAI11711166–117541,794
23#23xgrok-4.3xAI11651160–117091,483
24#24Anthropicclaude-sonnet-4-5-searchAnthropic11581153–1163127,378
25#25Anthropicclaude-opus-4-1-searchAnthropic11481143–115376,933
26#26Oo3-searchOpenAI11441139–115020,644
27#27Googlegemini-2.5-pro-groundingGoogle11421137–114683,404
28#28xgrok-4-searchxAI11421136–114719,108
29#29Perplexityppl-sonar-reasoning-pro-highPerplexity11391133–114429,055
30#30Ogpt-5-searchOpenAI11331127–113920,781
31#31Perplexityppl-sonar-pro-highPerplexity11301124–113628,519
32#32Anthropicclaude-opus-4-searchAnthropic11261121–113231,037
33#33Ddiffbot-small-xlDiffbot10231014–10316,388
34#34Oapi-gpt-4o-searchOpenAI1006995–10173,411

데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: OpenRouter (openrouter.ai/rankings), as of 2026-10-04. Licensed under CC BY 4.0. https://openrouter.ai/rankings