OpenRouter · 고객 응대 에이전트(τ-bench 항공)
공개된 벤치마크 자료(LMArena 사용자 투표 순위, Epoch AI 시험 점수, OpenRouter 사용량 순위)를 정기적으로 받아 보여 줍니다. 각 순위표의 공개일과 가져온 날을 함께 표시합니다. 이 사이트가 직접 매긴 점수가 아닙니다.
이 순위표 읽는 법
무엇을 재나: OpenRouter가 실행한 τ-bench(검증판, 항공 분야) 결과입니다. 항공사 고객 응대 상황에서 도구를 써서 예약 변경 같은 요청을 규칙대로 처리하는지 봅니다.
점수 읽는 법: 성공률(%)이 높을수록 좋습니다. 문제당 평균 비용도 함께 비교할 수 있습니다.
주의할 점: 한 분야(항공) 시나리오만 다루므로, 다른 업무의 에이전트 성능과는 다를 수 있습니다.
이번 순위에서 읽을 점
- 최고 점수는 Claude Fable 5의 79.9%입니다.
- 1위와 5위의 차이는 1.4%p입니다.
- 상위 10개 중 Anthropic 모델이 4개로 가장 많습니다.
- 상위 10개 중 문제당 평균 비용이 가장 낮은 모델은 Step 3.7 Flash($0.0201, 점수 77.3%)입니다.
고객 응대 에이전트(τ-bench 항공) OpenRouter
공개일 2026-10-04 · 가져온 날 2026-10-05
그래프에는 같은 모델의 추론 설정(high·max 등) 중 가장 높은 하나만 표시합니다. 표에는 설정별 순위가 모두 나옵니다.
표로 보기 (상위 60개)
| 순위 | 모델 | 만든 곳 | 점수 | 문제당 평균 비용 |
|---|---|---|---|---|
| 1 | #1Claude Fable 5 | Anthropic | 79.9% | $0.9265 |
| 2 | #2MiMo-V2.6-Flash | Xiaomi | 79.3% | $0.0204 |
| 3 | #3Claude Fable 5.1 | Anthropic | 79.2% | $0.7162 |
| 4 | #4Claude Opus 5 | Anthropic | 78.6% | $0.4868 |
| 5 | #5Gemini 3.7 Flash | 78.5% | $0.1149 | |
| 6 | #6ANova Micro 1.0 | Amazon | 78% | $1.2758 |
| 7 | #7SStep 3.7 Flash | StepFun | 77.3% | $0.0201 |
| 8 | #8Claude Opus 4.5 | Anthropic | 77.1% | $0.5319 |
| 9 | #9OGPT-5.1 | OpenAI | 77.1% | $0.4149 |
| 10 | #10Qwen3.8 27B | Alibaba | 77% | $0.0811 |
| 11 | #11ZGLM 5 | Z.ai | 77% | $0.0447 |
| 12 | #12DeepSeek V4 Pro 0813 | DeepSeek | 77% | $0.1001 |
| 13 | #13Qwen3.5 397B A17B | Alibaba | 76.9% | $0.1697 |
| 14 | #14Gemini 3.5 Flash Lite | 76.9% | $0.0978 | |
| 15 | #15Gemma 4 31B | 76.7% | $0.0282 | |
| 16 | #16Claude Opus 4.8 | Anthropic | 76.4% | $0.4977 |
| 17 | #17DeepSeek V4 Pro 0423 | DeepSeek | 76.4% | $0.0399 |
| 18 | #18DeepSeek V4.1 Flash | DeepSeek | 76.2% | $0.0315 |
| 19 | #19ZGLM 5.3 | Z.ai | 76.1% | $0.062 |
| 20 | #20Qwen3.5-122B-A10B | Alibaba | 76.1% | $0.169 |
| 21 | #21ZGLM 5.3 | Z.ai | 76% | $0.016 |
| 22 | #22Claude Opus 4.7 | Anthropic | 75.9% | $0.4192 |
| 23 | #23Gemini 3.1 Pro Preview | 75.8% | $0.3592 | |
| 24 | #24ZGLM 5.3 Flash | Z.ai | 75.6% | $0.0067 |
| 25 | #25Qwen3.8 2.4T A95B | Alibaba | 75.5% | $0.1978 |
| 26 | #26ZGLM 5.1 | Z.ai | 75.4% | $0.0778 |
| 27 | #27xGrok 4.6 | xAI | 75.3% | $0.3309 |
| 28 | #28Claude Sonnet 5 | Anthropic | 75.3% | $0.1994 |
| 29 | #29OGPT-5.4 | OpenAI | 75.3% | $0.2916 |
| 30 | #30Gemini 3 Flash Preview | 75.3% | $0.1221 | |
| 31 | #31OGPT-5.3-Codex | OpenAI | 75.3% | $0.2997 |
| 32 | #32OGPT-5.5 | OpenAI | 75.1% | $0.4875 |
| 33 | #33DeepSeek V4 Flash Vision Exp | DeepSeek | 74.8% | $0.0302 |
| 34 | #34Claude Opus 4.6 | Anthropic | 74.7% | $0.4898 |
| 35 | #35Claude Sonnet 5.5 | Anthropic | 74.7% | $0.1787 |
| 36 | #36Gemini 3.6 Flash | 74.7% | $0.2141 | |
| 37 | #37OGPT-5.6 Sol | OpenAI | 74.7% | $0.184 |
| 38 | #38Muse Glimmer 30B | Meta | 74.7% | $0.0374 |
| 39 | #39Claude Sonnet 4.6 | Anthropic | 74.6% | $0.3238 |
| 40 | #40DeepSeek V4 Flash 0423 | DeepSeek | 74.4% | $0.0111 |
| 41 | #41Claude Opus 5.5 | Anthropic | 74.3% | $0.3458 |
| 42 | #42Qwen3.6 27B | Alibaba | 74.3% | $0.1343 |
| 43 | #43Kimi K2.6 | Moonshot AI | 74.1% | $0.0733 |
| 44 | #44MiniMax M3 | MiniMax | 74.1% | $0.0235 |
| 45 | #45DeepSeek V3.2 | DeepSeek | 74% | $0.0299 |
| 46 | #46OGPT-5.6 Sol Pro | OpenAI | 73.7% | $1.288 |
| 47 | #47MiMo-V2.5-Pro | Xiaomi | 73.6% | $0.0304 |
| 48 | #48DeepSeek V4 Flash 0731 | DeepSeek | 73.4% | $0.0092 |
| 49 | #49OGPT-5.2 | OpenAI | 73.3% | $0.2413 |
| 50 | #50OGPT-5.6 Terra | OpenAI | 73.1% | $0.1054 |
| 51 | #51Gemini 3.5 Flash | 73.1% | $0.3988 | |
| 52 | #52OGPT-6 Astra Pro | OpenAI | 72.7% | $2.9136 |
| 53 | #53ZGLM 5.2 | Z.ai | 72.7% | $0.034 |
| 54 | #54Kimi K2.7 Code | Moonshot AI | 72.6% | $0.0736 |
| 55 | #55Claude Sonnet 4.5 | Anthropic | 72.4% | $0.3328 |
| 56 | #56ZGLM 4.6 | Z.ai | 72.1% | $0.0499 |
| 57 | #57ZGLM 4.7 | Z.ai | 72.1% | $0.0581 |
| 58 | #58Nemotron 3 Ultra | NVIDIA | 72% | $0.1515 |
| 59 | #59Qwen3.7 Max | Alibaba | 72% | $0.4029 |
| 60 | #60Gemini 3.1 Flash Lite | 72% | $0.0932 |
Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.
데이터: LMArena leaderboard dataset (CC BY 4.0). 변경: 각 순위표의 상위 50개만 표시, 점수는 반올림. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset회사 로고는 각 회사의 상표이며 구분을 돕기 위해서만 씁니다(아이콘: Simple Icons).데이터: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings