TAU-bench Airline

TAU-bench Airline est un benchmark créé par Sierra Research pour évaluer des agents conversationnels dans le domaine aérien. Il repose sur des dialogues dynamiques à plusieurs tours, au cours desquels l’agent échange avec un utilisateur, applique des règles métier et mobilise des API ou…

TAU-bench Airline est un benchmark créé par Sierra Research pour évaluer des agents conversationnels dans le domaine aérien. Il repose sur des dialogues dynamiques à plusieurs tours, au cours desquels l’agent échange avec un utilisateur, applique des règles métier et mobilise des API ou des outils.

Intégré à TAU-bench, il mesure conjointement l’usage d’outils, le respect des politiques et la qualité de l’interaction. Il sert ainsi à apprécier la capacité des modèles à accomplir de manière fiable des tâches proches de scénarios opérationnels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSierra Research
Capacités mesuréesagents conversationnels, usage d'outils (function calling), respect de règles/politiques métier, communication avec l'utilisateur
ModalitéTexte
Type de questionsdialogues dynamiques multi-tours agent-utilisateur avec API/outils et règles métier (domaine compagnie aérienne)
Métrique d'évaluationpass^k (fiabilité sur k essais), comparaison de l'état final de la base au but annoté
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeu50 tâches (domaine airline); 115 tâches pour le retail
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (22)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Sonnet 4.5Anthropic🔒 Propriétaire70,0 %29 septembre 2025Auto-déclaré
2GLM-4.5-AirZhipu AI🟢 Ouvert60,8 %28 juillet 2025Auto-déclaré
3GLM-4.5Zhipu AI🟢 Ouvert60,4 %28 juillet 2025Auto-déclaré
4Claude Sonnet 4Anthropic🔒 Propriétaire60,0 %22 mai 2025Auto-déclaré
5MiniMax M1MiniMax🟢 Ouvert60,0 %17 juin 2025Auto-déclaré
6Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team🟢 Ouvert60,0 %31 janvier 2025Auto-déclaré
7Claude Opus 4Anthropic🔒 Propriétaire59,6 %22 mai 2025Auto-déclaré
8Claude 3.7 SonnetAnthropic🔒 Propriétaire58,4 %24 février 2025Auto-déclaré
9Claude Opus 4.1Anthropic🔒 Propriétaire56,0 %5 août 2025Auto-déclaré
10GPT-4.5OpenAI🔒 Propriétaire50,0 %5 mars 2026Auto-déclaré
11o1OpenAI🔒 Propriétaire50,0 %17 décembre 2024Auto-déclaré
12GPT-4.1OpenAI🔒 Propriétaire49,4 %14 avril 2025Auto-déclaré
13o4-miniOpenAI🔒 Propriétaire49,2 %16 avril 2025Auto-déclaré
14Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert49,0 %10 septembre 2025Auto-déclaré
15Claude 3.5 SonnetAnthropic🔒 Propriétaire46,0 %22 octobre 2024Auto-déclaré
16Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert46,0 %25 juillet 2025Auto-déclaré
17Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert44,0 %10 septembre 2025Auto-déclaré
18GPT-4oOpenAI🔒 Propriétaire42,8 %27 mars 2025Auto-déclaré
19GPT-4.1 miniOpenAI🔒 Propriétaire36,0 %14 avril 2025Auto-déclaré
20o3-miniOpenAI🔒 Propriétaire32,4 %30 janvier 2025Auto-déclaré
21Claude 3.5 HaikuAnthropic🔒 Propriétaire22,8 %4 novembre 2024Auto-déclaré
22GPT-4.1 nanoOpenAI🔒 Propriétaire14,0 %14 avril 2025Auto-déclaré

Classement établi sur 22 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 49,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent atteint fréquemment l’état final attendu dans la base, tout en conduisant la conversation, en utilisant les outils appropriés et en respectant les règles du domaine. La métrique pass^k met l’accent sur la fiabilité au fil de plusieurs essais, plutôt que sur une réussite isolée. L’évaluation repose donc sur un résultat mesurable, comparé à un but annoté. La lecture du classement demande toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs.

Sur les 22 modèles évalués, la médiane de 50 % et le meilleur résultat de 70 %, obtenu par Claude Sonnet 4.5, montrent un écart notable entre les systèmes et une marge de progression avant saturation. La portée reste circonscrite à 50 tâches en anglais dans le domaine des compagnies aériennes. Les dialogues dynamiques limitent une lecture fondée sur de simples réponses statiques, mais le benchmark ne couvre qu’un cadre métier particulier. Comme pour tout jeu public, le risque de contamination doit être pris en compte lors de l’interprétation des performances.


Sources des scores : llm-stats.