Tau2 Airline
Tau2 Airline est un benchmark publié en 2025 par Sierra Research pour évaluer des agents conversationnels dans des scénarios de service client aérien. Il repose sur des dialogues multi-tours où l’agent et l’utilisateur disposent chacun d’outils et doivent agir de manière coordonnée.
Tau2 Airline est un benchmark publié en 2025 par Sierra Research pour évaluer des agents conversationnels dans des scénarios de service client aérien. Il repose sur des dialogues multi-tours où l’agent et l’utilisateur disposent chacun d’outils et doivent agir de manière coordonnée.
Les tâches couvrent notamment la réservation, la modification et l’annulation de vols, ainsi que les remboursements. Le benchmark mesure l’usage d’outils, le respect des règles, la communication et la capacité de l’agent à guider les actions de l’utilisateur dans un environnement dual-control.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Sierra Research |
| Capacités mesurées | agents conversationnels dual-control, usage d'outils, coordination agent-utilisateur, respect de règles, communication |
| Modalité | Texte |
| Type de questions | dialogues multi-tours agent-utilisateur en environnement dual-control avec appels d'outils (domaine compagnie aérienne) |
| Métrique d'évaluation | pass^k (proportion de tâches réussies sur k essais) |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | domaine airline de τ²-bench (~50 tâches) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (22)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 76,5 % | 14 janvier 2026 | Auto-déclaré |
| 2 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 68,8 % | 2 décembre 2025 | Auto-déclaré |
| 3 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 67,5 % | 22 septembre 2025 | Auto-déclaré |
| 4 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 67,0 % | 13 novembre 2025 | Auto-déclaré |
| 5 | GPT-5.1 Instant | OpenAI | 🔒 Propriétaire | 67,0 % | 12 novembre 2025 | Auto-déclaré |
| 6 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 65,2 % | 2 décembre 2025 | Auto-déclaré |
| 7 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 64,8 % | 2 décembre 2025 | Auto-déclaré |
| 8 | o3 | OpenAI | 🔒 Propriétaire | 64,8 % | 16 avril 2025 | Auto-déclaré |
| 9 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 63,6 % | 15 octobre 2025 | Auto-déclaré |
| 10 | GPT-5 | OpenAI | 🔒 Propriétaire | 62,6 % | 7 août 2025 | Auto-déclaré |
| 11 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,5 % | 10 septembre 2025 | Auto-déclaré |
| 12 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 58,0 % | 29 août 2025 | Auto-déclaré |
| 13 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 58,0 % | 5 février 2026 | Auto-déclaré |
| 14 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,0 % | 25 juillet 2025 | Auto-déclaré |
| 15 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 56,5 % | 11 juillet 2025 | Auto-déclaré |
| 16 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 56,5 % | 5 septembre 2025 | Auto-déclaré |
| 17 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 56,2 % | 11 mars 2026 | Auto-déclaré |
| 18 | Mercury 2 | Inception | 🔒 Propriétaire | 53,0 % | 24 février 2026 | Auto-déclaré |
| 19 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 48,0 % | 15 décembre 2025 | Auto-déclaré |
| 20 | GPT-4o | OpenAI | 🔒 Propriétaire | 45,5 % | 27 mars 2025 | Auto-déclaré |
| 21 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 45,5 % | 10 septembre 2025 | Auto-déclaré |
| 22 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,0 % | 22 juillet 2025 | Auto-déclaré |
Classement établi sur 22 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 59,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé en pass^k indique qu’un modèle réussit une forte proportion de tâches sur plusieurs essais. Il traduit donc une capacité à combiner dialogue, appels d’outils, respect des règles et coordination avec l’utilisateur, plutôt qu’une simple maîtrise de réponses isolées. Le classement montre cependant une difficulté encore réelle : le meilleur modèle, LongCat-Flash-Thinking-2601 de Meituan, atteint 76 %, tandis que la médiane des 22 modèles évalués s’établit à 59 %. Cet écart distingue les systèmes les plus efficaces, sans indiquer une saturation complète du benchmark. L’interprétation demande néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une rigueur moins homogène qu’une évaluation centralisée selon un protocole unique. L’accès public peut aussi exposer le jeu à un risque de contamination lors du développement des modèles. Enfin, sa portée reste ciblée : environ 50 tâches, en anglais, dans le seul domaine aérien. Les résultats renseignent donc précisément sur ce cadre dual-control, mais ne suffisent pas à caractériser l’ensemble des capacités agentiques.
Sources des scores : llm-stats.