OpenRouter · Agent de service client (τ-bench, transport aérien)
Nous récupérons régulièrement les données publiques de benchmarks (classements issus des votes des utilisateurs de LMArena, scores aux tests d’Epoch AI et classements d’utilisation d’OpenRouter) pour les afficher. Chaque classement indique sa date de publication et sa date de récupération. Ces scores ne sont pas attribués par ce site.
Comment lire ce classement
Ce qui est mesuré : Il s’agit des résultats de τ-bench (version vérifiée, transport aérien), exécuté par OpenRouter. Ce test évalue si un agent utilise des outils pour traiter des demandes, comme une modification de réservation, conformément aux règles dans un contexte de service client aérien.
Comment lire le score : Plus le taux de réussite (%) est élevé, mieux c’est. Vous pouvez également comparer le coût moyen par problème.
Points à surveiller : Ce test couvre uniquement des scénarios du transport aérien. Les performances des agents peuvent donc différer dans d’autres activités.
Ce que révèle ce classement
- Le meilleur score est de 79.9%, obtenu par Claude Fable 5.
- L’écart entre la 1re et la 5e place est de 1.4%p.
- Parmi les 10 premiers, les modèles de Anthropic sont les plus nombreux, avec 4 modèles.
- Parmi les 10 premiers, le modèle au coût moyen par problème le plus bas est Step 3.7 Flash ($0.0201, score : 77.3%).
Agent de service client (τ-bench, transport aérien) OpenRouter
Publié le 2026-10-04 · Récupéré le 2026-10-05
Le graphique affiche uniquement le meilleur score parmi les réglages de raisonnement d’un même modèle (high, max, etc.). Le tableau présente les classements de tous les réglages.
Voir le tableau (top 60)
| Rang | Modèle | Développeur | Score | Coût moyen par problème |
|---|---|---|---|---|
| 1 | #1Claude Fable 5 | Anthropic | 79.9% | $0.9265 |
| 2 | #2MiMo-V2.6-Flash | Xiaomi | 79.3% | $0.0204 |
| 3 | #3Claude Fable 5.1 | Anthropic | 79.2% | $0.7162 |
| 4 | #4Claude Opus 5 | Anthropic | 78.6% | $0.4868 |
| 5 | #5Gemini 3.7 Flash | 78.5% | $0.1149 | |
| 6 | #6ANova Micro 1.0 | Amazon | 78% | $1.2758 |
| 7 | #7SStep 3.7 Flash | StepFun | 77.3% | $0.0201 |
| 8 | #8Claude Opus 4.5 | Anthropic | 77.1% | $0.5319 |
| 9 | #9OGPT-5.1 | OpenAI | 77.1% | $0.4149 |
| 10 | #10Qwen3.8 27B | Alibaba | 77% | $0.0811 |
| 11 | #11ZGLM 5 | Z.ai | 77% | $0.0447 |
| 12 | #12DeepSeek V4 Pro 0813 | DeepSeek | 77% | $0.1001 |
| 13 | #13Qwen3.5 397B A17B | Alibaba | 76.9% | $0.1697 |
| 14 | #14Gemini 3.5 Flash Lite | 76.9% | $0.0978 | |
| 15 | #15Gemma 4 31B | 76.7% | $0.0282 | |
| 16 | #16Claude Opus 4.8 | Anthropic | 76.4% | $0.4977 |
| 17 | #17DeepSeek V4 Pro 0423 | DeepSeek | 76.4% | $0.0399 |
| 18 | #18DeepSeek V4.1 Flash | DeepSeek | 76.2% | $0.0315 |
| 19 | #19ZGLM 5.3 | Z.ai | 76.1% | $0.062 |
| 20 | #20Qwen3.5-122B-A10B | Alibaba | 76.1% | $0.169 |
| 21 | #21ZGLM 5.3 | Z.ai | 76% | $0.016 |
| 22 | #22Claude Opus 4.7 | Anthropic | 75.9% | $0.4192 |
| 23 | #23Gemini 3.1 Pro Preview | 75.8% | $0.3592 | |
| 24 | #24ZGLM 5.3 Flash | Z.ai | 75.6% | $0.0067 |
| 25 | #25Qwen3.8 2.4T A95B | Alibaba | 75.5% | $0.1978 |
| 26 | #26ZGLM 5.1 | Z.ai | 75.4% | $0.0778 |
| 27 | #27xGrok 4.6 | xAI | 75.3% | $0.3309 |
| 28 | #28Claude Sonnet 5 | Anthropic | 75.3% | $0.1994 |
| 29 | #29OGPT-5.4 | OpenAI | 75.3% | $0.2916 |
| 30 | #30Gemini 3 Flash Preview | 75.3% | $0.1221 | |
| 31 | #31OGPT-5.3-Codex | OpenAI | 75.3% | $0.2997 |
| 32 | #32OGPT-5.5 | OpenAI | 75.1% | $0.4875 |
| 33 | #33DeepSeek V4 Flash Vision Exp | DeepSeek | 74.8% | $0.0302 |
| 34 | #34Claude Opus 4.6 | Anthropic | 74.7% | $0.4898 |
| 35 | #35Claude Sonnet 5.5 | Anthropic | 74.7% | $0.1787 |
| 36 | #36Gemini 3.6 Flash | 74.7% | $0.2141 | |
| 37 | #37OGPT-5.6 Sol | OpenAI | 74.7% | $0.184 |
| 38 | #38Muse Glimmer 30B | Meta | 74.7% | $0.0374 |
| 39 | #39Claude Sonnet 4.6 | Anthropic | 74.6% | $0.3238 |
| 40 | #40DeepSeek V4 Flash 0423 | DeepSeek | 74.4% | $0.0111 |
| 41 | #41Claude Opus 5.5 | Anthropic | 74.3% | $0.3458 |
| 42 | #42Qwen3.6 27B | Alibaba | 74.3% | $0.1343 |
| 43 | #43Kimi K2.6 | Moonshot AI | 74.1% | $0.0733 |
| 44 | #44MiniMax M3 | MiniMax | 74.1% | $0.0235 |
| 45 | #45DeepSeek V3.2 | DeepSeek | 74% | $0.0299 |
| 46 | #46OGPT-5.6 Sol Pro | OpenAI | 73.7% | $1.288 |
| 47 | #47MiMo-V2.5-Pro | Xiaomi | 73.6% | $0.0304 |
| 48 | #48DeepSeek V4 Flash 0731 | DeepSeek | 73.4% | $0.0092 |
| 49 | #49OGPT-5.2 | OpenAI | 73.3% | $0.2413 |
| 50 | #50OGPT-5.6 Terra | OpenAI | 73.1% | $0.1054 |
| 51 | #51Gemini 3.5 Flash | 73.1% | $0.3988 | |
| 52 | #52OGPT-6 Astra Pro | OpenAI | 72.7% | $2.9136 |
| 53 | #53ZGLM 5.2 | Z.ai | 72.7% | $0.034 |
| 54 | #54Kimi K2.7 Code | Moonshot AI | 72.6% | $0.0736 |
| 55 | #55Claude Sonnet 4.5 | Anthropic | 72.4% | $0.3328 |
| 56 | #56ZGLM 4.6 | Z.ai | 72.1% | $0.0499 |
| 57 | #57ZGLM 4.7 | Z.ai | 72.1% | $0.0581 |
| 58 | #58Nemotron 3 Ultra | NVIDIA | 72% | $0.1515 |
| 59 | #59Qwen3.7 Max | Alibaba | 72% | $0.4029 |
| 60 | #60Gemini 3.1 Flash Lite | 72% | $0.0932 |
Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.
Données : LMArena leaderboard dataset (CC BY 4.0). Modifications : Seuls les 50 premiers de chaque classement sont affichés. Les scores sont arrondis.. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLes logos sont des marques de leurs entreprises respectives et servent uniquement à les distinguer (icônes : Simple Icons).Données : Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings