Tau-bench
Créé par Sierra Research en 2024, Tau-bench évalue des agents de langage dans des interactions dynamiques proches de scénarios métier. Les tâches associent un utilisateur simulé, des conversations en anglais, des règles propres à un domaine et l’utilisation d’outils ou d’API.
Créé par Sierra Research en 2024, Tau-bench évalue des agents de langage dans des interactions dynamiques proches de scénarios métier. Les tâches associent un utilisateur simulé, des conversations en anglais, des règles propres à un domaine et l’utilisation d’outils ou d’API.
Le benchmark mesure la capacité d’un agent à accomplir une tâche tout en dialoguant correctement, en appliquant les politiques imposées et en choisissant les appels d’outils adaptés. Il sert ainsi à examiner la fiabilité et la constance des comportements sur plusieurs essais dans les domaines retail et airline.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Sierra Research |
| Capacités mesurées | agents, généraliste, raisonnement, appels d'outils |
| Modalité | Texte |
| Type de questions | tâches agentiques interactives avec utilisateur simulé, règles de domaine et appels d’outils/API |
| Métrique d'évaluation | task success rate / pass^k |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 165 tâches utilisateur, dans les domaines retail et airline |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Step-3.5-Flash | StepFun | 🟢 Ouvert | 88,2 % | 2 février 2026 | Auto-déclaré |
| 2 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 87,4 % | 22 décembre 2025 | Auto-déclaré |
| 3 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 80,3 % | 16 décembre 2025 | Auto-déclaré |
| 4 | GLM-4.7-Flash | Zhipu AI | 🟢 Ouvert | 79,5 % | 19 janvier 2026 | Auto-déclaré |
| 5 | MiniMax M2 | MiniMax | 🟢 Ouvert | 77,2 % | 27 octobre 2025 | Auto-déclaré |
| 6 | o3 | OpenAI | 🔒 Propriétaire | 63,0 % | 16 avril 2025 | Auto-déclaré |
Classement établi sur 6 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 79,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Tau-bench indique qu’un agent réussit fréquemment les tâches complètes, et pas seulement une étape isolée. Il doit coordonner la conversation, les règles métier et les appels d’API, puis reproduire ce comportement sur plusieurs essais, dimension reflétée par le task success rate et pass^k. Le classement de la base place Step-3.5-Flash en tête à 88 %, face à une médiane de 80 % sur six modèles. Cet écart relativement limité signale des performances déjà élevées dans cet ensemble et invite à surveiller un possible effet de saturation, sans assimiler ces scores à une maîtrise générale des tâches agentiques. La portée reste circonscrite à environ 165 tâches en anglais, réparties entre retail et airline. Le caractère public du benchmark impose aussi de considérer le risque de contamination lors de l’interprétation. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison offre une indication utile, mais avec une rigueur moins homogène qu’une évaluation entièrement mesurée selon un protocole indépendant commun.
Sources des scores : llm-stats.