Valumigo

OpenRouter · 顧客対応エージェント(τ-bench 航空)

公開されているベンチマーク資料(LMArenaのユーザー投票順位、Epoch AIのテストスコア、OpenRouterの使用量順位)を定期的に取得して表示します。各ランキングの公開日と取得日を併記します。このサイトが独自に採点したものではありません。

LMArenaのスコアは、2つのモデルの回答を並べて見たユーザーが、よりよい方に投票した結果(Elo方式)です。スコアの差が信頼区間内なら、実質的には同程度と考えましょう。

このランキングの読み方

測定する能力: OpenRouterが実施したτ-bench(検証版、航空分野)の結果です。航空会社の顧客対応場面で、ツールを使って予約変更などの依頼をルールに従って処理できるかを評価します。

スコアの読み方: 成功率(%)が高いほど良い結果です。問題あたりの平均費用も併せて比較できます。

注意点: 1分野(航空)のシナリオのみを扱うため、他の業務でのエージェント性能とは異なる場合があります。

今回のランキングから読み取れること

  • 最高スコアはClaude Fable 5の79.9%です。
  • 1位と5位の差は1.4%pです。
  • 上位10モデルのうち、Anthropicのモデルが4モデルで最も多くなっています。
  • 上位10モデルのうち、問題あたりの平均費用が最も低いモデルはStep 3.7 Flash($0.0201、スコア77.3%)です。

顧客対応エージェント(τ-bench 航空) OpenRouter

公開日 2026-10-04 · 取得日 2026-10-05

AnthropicClaude Fable 5
79.9%
XiaomiMiMo-V2.6-Flash
79.3%
AnthropicClaude Fable 5.1
79.2%
AnthropicClaude Opus 5
78.6%
GoogleGemini 3.7 Flash
78.5%
ANova Micro 1.0
78.0%
SStep 3.7 Flash
77.3%
AnthropicClaude Opus 4.5
77.1%
OGPT-5.1
77.1%
AlibabaQwen3.8 27B
77.0%
ZGLM 5
77.0%
DeepSeekDeepSeek V4 Pro 0813
77.0%
AlibabaQwen3.5 397B A17B
76.9%
GoogleGemini 3.5 Flash Lite
76.9%
GoogleGemma 4 31B
76.7%
AnthropicClaude Opus 4.8
76.4%
DeepSeekDeepSeek V4 Pro 0423
76.4%
DeepSeekDeepSeek V4.1 Flash
76.2%
ZGLM 5.3
76.1%
AlibabaQwen3.5-122B-A10B
76.1%

グラフには、同じモデルの推論設定(high・maxなど)のうち、スコアが最も高いものだけを表示しています。表には設定ごとの順位をすべて掲載しています。

表で見る(上位60件)
順位モデル開発元スコア問題あたりの平均費用
1#1AnthropicClaude Fable 5Anthropic79.9%$0.9265
2#2XiaomiMiMo-V2.6-FlashXiaomi79.3%$0.0204
3#3AnthropicClaude Fable 5.1Anthropic79.2%$0.7162
4#4AnthropicClaude Opus 5Anthropic78.6%$0.4868
5#5GoogleGemini 3.7 FlashGoogle78.5%$0.1149
6#6ANova Micro 1.0Amazon78%$1.2758
7#7SStep 3.7 FlashStepFun77.3%$0.0201
8#8AnthropicClaude Opus 4.5Anthropic77.1%$0.5319
9#9OGPT-5.1OpenAI77.1%$0.4149
10#10AlibabaQwen3.8 27BAlibaba77%$0.0811
11#11ZGLM 5Z.ai77%$0.0447
12#12DeepSeekDeepSeek V4 Pro 0813DeepSeek77%$0.1001
13#13AlibabaQwen3.5 397B A17BAlibaba76.9%$0.1697
14#14GoogleGemini 3.5 Flash LiteGoogle76.9%$0.0978
15#15GoogleGemma 4 31BGoogle76.7%$0.0282
16#16AnthropicClaude Opus 4.8Anthropic76.4%$0.4977
17#17DeepSeekDeepSeek V4 Pro 0423DeepSeek76.4%$0.0399
18#18DeepSeekDeepSeek V4.1 FlashDeepSeek76.2%$0.0315
19#19ZGLM 5.3Z.ai76.1%$0.062
20#20AlibabaQwen3.5-122B-A10BAlibaba76.1%$0.169
21#21ZGLM 5.3Z.ai76%$0.016
22#22AnthropicClaude Opus 4.7Anthropic75.9%$0.4192
23#23GoogleGemini 3.1 Pro PreviewGoogle75.8%$0.3592
24#24ZGLM 5.3 FlashZ.ai75.6%$0.0067
25#25AlibabaQwen3.8 2.4T A95BAlibaba75.5%$0.1978
26#26ZGLM 5.1Z.ai75.4%$0.0778
27#27xGrok 4.6xAI75.3%$0.3309
28#28AnthropicClaude Sonnet 5Anthropic75.3%$0.1994
29#29OGPT-5.4OpenAI75.3%$0.2916
30#30GoogleGemini 3 Flash PreviewGoogle75.3%$0.1221
31#31OGPT-5.3-CodexOpenAI75.3%$0.2997
32#32OGPT-5.5OpenAI75.1%$0.4875
33#33DeepSeekDeepSeek V4 Flash Vision ExpDeepSeek74.8%$0.0302
34#34AnthropicClaude Opus 4.6Anthropic74.7%$0.4898
35#35AnthropicClaude Sonnet 5.5Anthropic74.7%$0.1787
36#36GoogleGemini 3.6 FlashGoogle74.7%$0.2141
37#37OGPT-5.6 SolOpenAI74.7%$0.184
38#38MetaMuse Glimmer 30BMeta74.7%$0.0374
39#39AnthropicClaude Sonnet 4.6Anthropic74.6%$0.3238
40#40DeepSeekDeepSeek V4 Flash 0423DeepSeek74.4%$0.0111
41#41AnthropicClaude Opus 5.5Anthropic74.3%$0.3458
42#42AlibabaQwen3.6 27BAlibaba74.3%$0.1343
43#43Moonshot AIKimi K2.6Moonshot AI74.1%$0.0733
44#44MiniMaxMiniMax M3MiniMax74.1%$0.0235
45#45DeepSeekDeepSeek V3.2DeepSeek74%$0.0299
46#46OGPT-5.6 Sol ProOpenAI73.7%$1.288
47#47XiaomiMiMo-V2.5-ProXiaomi73.6%$0.0304
48#48DeepSeekDeepSeek V4 Flash 0731DeepSeek73.4%$0.0092
49#49OGPT-5.2OpenAI73.3%$0.2413
50#50OGPT-5.6 TerraOpenAI73.1%$0.1054
51#51GoogleGemini 3.5 FlashGoogle73.1%$0.3988
52#52OGPT-6 Astra ProOpenAI72.7%$2.9136
53#53ZGLM 5.2Z.ai72.7%$0.034
54#54Moonshot AIKimi K2.7 CodeMoonshot AI72.6%$0.0736
55#55AnthropicClaude Sonnet 4.5Anthropic72.4%$0.3328
56#56ZGLM 4.6Z.ai72.1%$0.0499
57#57ZGLM 4.7Z.ai72.1%$0.0581
58#58NVIDIANemotron 3 UltraNVIDIA72%$0.1515
59#59AlibabaQwen3.7 MaxAlibaba72%$0.4029
60#60GoogleGemini 3.1 Flash LiteGoogle72%$0.0932

Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.

データ: LMArena leaderboard dataset(CC BY 4.0)。変更: 各ランキングは上位50件のみ表示。スコアは四捨五入。 https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset企業ロゴは各社の商標であり、識別のためにのみ使用しています(アイコン:Simple Icons)。データ:Epoch AI — Capabilities & benchmarking(CC BY 4.0)。 https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings