Tau2 Airline

Tau2 Airline est un benchmark publié en 2025 par Sierra Research pour évaluer des agents conversationnels dans des scénarios de service client aérien. Il repose sur des dialogues multi-tours où l’agent et l’utilisateur disposent chacun d’outils et doivent agir de manière coordonnée.

Tau2 Airline est un benchmark publié en 2025 par Sierra Research pour évaluer des agents conversationnels dans des scénarios de service client aérien. Il repose sur des dialogues multi-tours où l’agent et l’utilisateur disposent chacun d’outils et doivent agir de manière coordonnée.

Les tâches couvrent notamment la réservation, la modification et l’annulation de vols, ainsi que les remboursements. Le benchmark mesure l’usage d’outils, le respect des règles, la communication et la capacité de l’agent à guider les actions de l’utilisateur dans un environnement dual-control.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSierra Research
Capacités mesuréesagents conversationnels dual-control, usage d'outils, coordination agent-utilisateur, respect de règles, communication
ModalitéTexte
Type de questionsdialogues multi-tours agent-utilisateur en environnement dual-control avec appels d'outils (domaine compagnie aérienne)
Métrique d'évaluationpass^k (proportion de tâches réussies sur k essais)
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeudomaine airline de τ²-bench (~50 tâches)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (22)

#ModèleÉditeurLicenceScoreSortieFiabilité
1LongCat-Flash-Thinking-2601Meituan🟢 Ouvert76,5 %14 janvier 2026Auto-déclaré
2Nova 2 OmniAmazon🔒 Propriétaire68,8 %2 décembre 2025Auto-déclaré
3LongCat-Flash-ThinkingMeituan🟢 Ouvert67,5 %22 septembre 2025Auto-déclaré
4GPT-5.1OpenAI🔒 Propriétaire67,0 %13 novembre 2025Auto-déclaré
5GPT-5.1 InstantOpenAI🔒 Propriétaire67,0 %12 novembre 2025Auto-déclaré
6Nova 2 ProAmazon🔒 Propriétaire65,2 %2 décembre 2025Auto-déclaré
7Nova 2 LiteAmazon🔒 Propriétaire64,8 %2 décembre 2025Auto-déclaré
8o3OpenAI🔒 Propriétaire64,8 %16 avril 2025Auto-déclaré
9Claude Haiku 4.5Anthropic🔒 Propriétaire63,6 %15 octobre 2025Auto-déclaré
10GPT-5OpenAI🔒 Propriétaire62,6 %7 août 2025Auto-déclaré
11Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert60,5 %10 septembre 2025Auto-déclaré
12LongCat-Flash-ChatMeituan🟢 Ouvert58,0 %29 août 2025Auto-déclaré
13LongCat-Flash-LiteMeituan🟢 Ouvert58,0 %5 février 2026Auto-déclaré
14Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert58,0 %25 juillet 2025Auto-déclaré
15Kimi K2 InstructMoonshot AI🟢 Ouvert56,5 %11 juillet 2025Auto-déclaré
16Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert56,5 %5 septembre 2025Auto-déclaré
17Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert56,2 %11 mars 2026Auto-déclaré
18Mercury 2Inception🔒 Propriétaire53,0 %24 février 2026Auto-déclaré
19Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert48,0 %15 décembre 2025Auto-déclaré
20GPT-4oOpenAI🔒 Propriétaire45,5 %27 mars 2025Auto-déclaré
21Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert45,5 %10 septembre 2025Auto-déclaré
22Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert44,0 %22 juillet 2025Auto-déclaré

Classement établi sur 22 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 59,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé en pass^k indique qu’un modèle réussit une forte proportion de tâches sur plusieurs essais. Il traduit donc une capacité à combiner dialogue, appels d’outils, respect des règles et coordination avec l’utilisateur, plutôt qu’une simple maîtrise de réponses isolées. Le classement montre cependant une difficulté encore réelle : le meilleur modèle, LongCat-Flash-Thinking-2601 de Meituan, atteint 76 %, tandis que la médiane des 22 modèles évalués s’établit à 59 %. Cet écart distingue les systèmes les plus efficaces, sans indiquer une saturation complète du benchmark. L’interprétation demande néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une rigueur moins homogène qu’une évaluation centralisée selon un protocole unique. L’accès public peut aussi exposer le jeu à un risque de contamination lors du développement des modèles. Enfin, sa portée reste ciblée : environ 50 tâches, en anglais, dans le seul domaine aérien. Les résultats renseignent donc précisément sur ce cadre dual-control, mais ne suffisent pas à caractériser l’ensemble des capacités agentiques.


Sources des scores : llm-stats.