TAU-bench Airline
TAU-bench Airline est un benchmark créé par Sierra Research pour évaluer des agents conversationnels dans le domaine aérien. Il repose sur des dialogues dynamiques à plusieurs tours, au cours desquels l’agent échange avec un utilisateur, applique des règles métier et mobilise des API ou…
TAU-bench Airline est un benchmark créé par Sierra Research pour évaluer des agents conversationnels dans le domaine aérien. Il repose sur des dialogues dynamiques à plusieurs tours, au cours desquels l’agent échange avec un utilisateur, applique des règles métier et mobilise des API ou des outils.
Intégré à TAU-bench, il mesure conjointement l’usage d’outils, le respect des politiques et la qualité de l’interaction. Il sert ainsi à apprécier la capacité des modèles à accomplir de manière fiable des tâches proches de scénarios opérationnels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Sierra Research |
| Capacités mesurées | agents conversationnels, usage d'outils (function calling), respect de règles/politiques métier, communication avec l'utilisateur |
| Modalité | Texte |
| Type de questions | dialogues dynamiques multi-tours agent-utilisateur avec API/outils et règles métier (domaine compagnie aérienne) |
| Métrique d'évaluation | pass^k (fiabilité sur k essais), comparaison de l'état final de la base au but annoté |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | 50 tâches (domaine airline); 115 tâches pour le retail |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (22)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 70,0 % | 29 septembre 2025 | Auto-déclaré |
| 2 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 60,8 % | 28 juillet 2025 | Auto-déclaré |
| 3 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 60,4 % | 28 juillet 2025 | Auto-déclaré |
| 4 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 60,0 % | 22 mai 2025 | Auto-déclaré |
| 5 | MiniMax M1 | MiniMax | 🟢 Ouvert | 60,0 % | 17 juin 2025 | Auto-déclaré |
| 6 | Qwen3-Coder 480B A35B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,0 % | 31 janvier 2025 | Auto-déclaré |
| 7 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 59,6 % | 22 mai 2025 | Auto-déclaré |
| 8 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 58,4 % | 24 février 2025 | Auto-déclaré |
| 9 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 56,0 % | 5 août 2025 | Auto-déclaré |
| 10 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 50,0 % | 5 mars 2026 | Auto-déclaré |
| 11 | o1 | OpenAI | 🔒 Propriétaire | 50,0 % | 17 décembre 2024 | Auto-déclaré |
| 12 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 49,4 % | 14 avril 2025 | Auto-déclaré |
| 13 | o4-mini | OpenAI | 🔒 Propriétaire | 49,2 % | 16 avril 2025 | Auto-déclaré |
| 14 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,0 % | 10 septembre 2025 | Auto-déclaré |
| 15 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 46,0 % | 22 octobre 2024 | Auto-déclaré |
| 16 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,0 % | 25 juillet 2025 | Auto-déclaré |
| 17 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,0 % | 10 septembre 2025 | Auto-déclaré |
| 18 | GPT-4o | OpenAI | 🔒 Propriétaire | 42,8 % | 27 mars 2025 | Auto-déclaré |
| 19 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 36,0 % | 14 avril 2025 | Auto-déclaré |
| 20 | o3-mini | OpenAI | 🔒 Propriétaire | 32,4 % | 30 janvier 2025 | Auto-déclaré |
| 21 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 22,8 % | 4 novembre 2024 | Auto-déclaré |
| 22 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 14,0 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 22 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 49,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent atteint fréquemment l’état final attendu dans la base, tout en conduisant la conversation, en utilisant les outils appropriés et en respectant les règles du domaine. La métrique pass^k met l’accent sur la fiabilité au fil de plusieurs essais, plutôt que sur une réussite isolée. L’évaluation repose donc sur un résultat mesurable, comparé à un but annoté. La lecture du classement demande toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs.
Sur les 22 modèles évalués, la médiane de 50 % et le meilleur résultat de 70 %, obtenu par Claude Sonnet 4.5, montrent un écart notable entre les systèmes et une marge de progression avant saturation. La portée reste circonscrite à 50 tâches en anglais dans le domaine des compagnies aériennes. Les dialogues dynamiques limitent une lecture fondée sur de simples réponses statiques, mais le benchmark ne couvre qu’un cadre métier particulier. Comme pour tout jeu public, le risque de contamination doit être pris en compte lors de l’interprétation des performances.
Sources des scores : llm-stats.