OpenRouter · Agentes de atención al cliente (τ-bench, sector aéreo)
Recopilamos y mostramos periódicamente datos públicos de benchmarks (clasificaciones por votos de usuarios de LMArena, puntuaciones de pruebas de Epoch AI y clasificaciones de uso de OpenRouter). Cada clasificación indica tanto la fecha de publicación como la fecha de recopilación. Las puntuaciones no las asigna este sitio.
Cómo interpretar esta clasificación
Qué mide: Son los resultados de τ-bench (versión verificada, sector aéreo) ejecutado por OpenRouter. Evalúa si el modelo utiliza herramientas para atender solicitudes, como cambios de reserva, siguiendo las reglas en situaciones de atención al cliente de aerolíneas.
Cómo interpretar la puntuación: Cuanto mayor sea la tasa de éxito (%), mejor. También se puede comparar el costo medio por pregunta.
Precauciones: Solo abarca escenarios de un sector (el aéreo), por lo que puede diferir del rendimiento de los agentes en otras tareas.
Claves para interpretar esta clasificación
- La puntuación más alta es 79.9%, obtenida por Claude Fable 5.
- La diferencia entre el 1.º y el 5.º puesto es de 1.4%p.
- Entre los 10 modelos mejor clasificados, Anthropic tiene la mayor cantidad, con 4 modelos.
- Entre los 10 primeros, el modelo con el menor costo medio por pregunta es Step 3.7 Flash ($0.0201, puntuación 77.3%).
Agentes de atención al cliente (τ-bench, sector aéreo) OpenRouter
Publicado el 2026-10-04 · Obtenido el 2026-10-05
El gráfico muestra solo la configuración de razonamiento de cada modelo (high, max, etc.) con la puntuación más alta. La tabla muestra las posiciones de todas las configuraciones.
Ver tabla (los 60 mejores)
| Puesto | Modelo | Desarrollador | Puntuación | Costo medio por pregunta |
|---|---|---|---|---|
| 1 | #1Claude Fable 5 | Anthropic | 79.9% | $0.9265 |
| 2 | #2MiMo-V2.6-Flash | Xiaomi | 79.3% | $0.0204 |
| 3 | #3Claude Fable 5.1 | Anthropic | 79.2% | $0.7162 |
| 4 | #4Claude Opus 5 | Anthropic | 78.6% | $0.4868 |
| 5 | #5Gemini 3.7 Flash | 78.5% | $0.1149 | |
| 6 | #6ANova Micro 1.0 | Amazon | 78% | $1.2758 |
| 7 | #7SStep 3.7 Flash | StepFun | 77.3% | $0.0201 |
| 8 | #8Claude Opus 4.5 | Anthropic | 77.1% | $0.5319 |
| 9 | #9OGPT-5.1 | OpenAI | 77.1% | $0.4149 |
| 10 | #10Qwen3.8 27B | Alibaba | 77% | $0.0811 |
| 11 | #11ZGLM 5 | Z.ai | 77% | $0.0447 |
| 12 | #12DeepSeek V4 Pro 0813 | DeepSeek | 77% | $0.1001 |
| 13 | #13Qwen3.5 397B A17B | Alibaba | 76.9% | $0.1697 |
| 14 | #14Gemini 3.5 Flash Lite | 76.9% | $0.0978 | |
| 15 | #15Gemma 4 31B | 76.7% | $0.0282 | |
| 16 | #16Claude Opus 4.8 | Anthropic | 76.4% | $0.4977 |
| 17 | #17DeepSeek V4 Pro 0423 | DeepSeek | 76.4% | $0.0399 |
| 18 | #18DeepSeek V4.1 Flash | DeepSeek | 76.2% | $0.0315 |
| 19 | #19ZGLM 5.3 | Z.ai | 76.1% | $0.062 |
| 20 | #20Qwen3.5-122B-A10B | Alibaba | 76.1% | $0.169 |
| 21 | #21ZGLM 5.3 | Z.ai | 76% | $0.016 |
| 22 | #22Claude Opus 4.7 | Anthropic | 75.9% | $0.4192 |
| 23 | #23Gemini 3.1 Pro Preview | 75.8% | $0.3592 | |
| 24 | #24ZGLM 5.3 Flash | Z.ai | 75.6% | $0.0067 |
| 25 | #25Qwen3.8 2.4T A95B | Alibaba | 75.5% | $0.1978 |
| 26 | #26ZGLM 5.1 | Z.ai | 75.4% | $0.0778 |
| 27 | #27xGrok 4.6 | xAI | 75.3% | $0.3309 |
| 28 | #28Claude Sonnet 5 | Anthropic | 75.3% | $0.1994 |
| 29 | #29OGPT-5.4 | OpenAI | 75.3% | $0.2916 |
| 30 | #30Gemini 3 Flash Preview | 75.3% | $0.1221 | |
| 31 | #31OGPT-5.3-Codex | OpenAI | 75.3% | $0.2997 |
| 32 | #32OGPT-5.5 | OpenAI | 75.1% | $0.4875 |
| 33 | #33DeepSeek V4 Flash Vision Exp | DeepSeek | 74.8% | $0.0302 |
| 34 | #34Claude Opus 4.6 | Anthropic | 74.7% | $0.4898 |
| 35 | #35Claude Sonnet 5.5 | Anthropic | 74.7% | $0.1787 |
| 36 | #36Gemini 3.6 Flash | 74.7% | $0.2141 | |
| 37 | #37OGPT-5.6 Sol | OpenAI | 74.7% | $0.184 |
| 38 | #38Muse Glimmer 30B | Meta | 74.7% | $0.0374 |
| 39 | #39Claude Sonnet 4.6 | Anthropic | 74.6% | $0.3238 |
| 40 | #40DeepSeek V4 Flash 0423 | DeepSeek | 74.4% | $0.0111 |
| 41 | #41Claude Opus 5.5 | Anthropic | 74.3% | $0.3458 |
| 42 | #42Qwen3.6 27B | Alibaba | 74.3% | $0.1343 |
| 43 | #43Kimi K2.6 | Moonshot AI | 74.1% | $0.0733 |
| 44 | #44MiniMax M3 | MiniMax | 74.1% | $0.0235 |
| 45 | #45DeepSeek V3.2 | DeepSeek | 74% | $0.0299 |
| 46 | #46OGPT-5.6 Sol Pro | OpenAI | 73.7% | $1.288 |
| 47 | #47MiMo-V2.5-Pro | Xiaomi | 73.6% | $0.0304 |
| 48 | #48DeepSeek V4 Flash 0731 | DeepSeek | 73.4% | $0.0092 |
| 49 | #49OGPT-5.2 | OpenAI | 73.3% | $0.2413 |
| 50 | #50OGPT-5.6 Terra | OpenAI | 73.1% | $0.1054 |
| 51 | #51Gemini 3.5 Flash | 73.1% | $0.3988 | |
| 52 | #52OGPT-6 Astra Pro | OpenAI | 72.7% | $2.9136 |
| 53 | #53ZGLM 5.2 | Z.ai | 72.7% | $0.034 |
| 54 | #54Kimi K2.7 Code | Moonshot AI | 72.6% | $0.0736 |
| 55 | #55Claude Sonnet 4.5 | Anthropic | 72.4% | $0.3328 |
| 56 | #56ZGLM 4.6 | Z.ai | 72.1% | $0.0499 |
| 57 | #57ZGLM 4.7 | Z.ai | 72.1% | $0.0581 |
| 58 | #58Nemotron 3 Ultra | NVIDIA | 72% | $0.1515 |
| 59 | #59Qwen3.7 Max | Alibaba | 72% | $0.4029 |
| 60 | #60Gemini 3.1 Flash Lite | 72% | $0.0932 |
Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0.
Datos: LMArena leaderboard dataset (CC BY 4.0). Cambios: Solo se muestran los 50 primeros de cada clasificación; las puntuaciones se redondean. https://huggingface.co/datasets/lmarena-ai/leaderboard-datasetLos logotipos son marcas comerciales de sus respectivas empresas y solo se usan para identificarlas (iconos: Simple Icons).Datos: Epoch AI — Capabilities & benchmarking (CC BY 4.0). https://epoch.ai/benchmarksSource: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). Licensed under CC BY 4.0. Source: OpenRouter (openrouter.ai/rankings), as of 2026-10-05. Licensed under CC BY 4.0. https://openrouter.ai/rankings