Tau-bench

Créé par Sierra Research en 2024, Tau-bench évalue des agents de langage dans des interactions dynamiques proches de scénarios métier. Les tâches associent un utilisateur simulé, des conversations en anglais, des règles propres à un domaine et l’utilisation d’outils ou d’API.

Créé par Sierra Research en 2024, Tau-bench évalue des agents de langage dans des interactions dynamiques proches de scénarios métier. Les tâches associent un utilisateur simulé, des conversations en anglais, des règles propres à un domaine et l’utilisation d’outils ou d’API.

Le benchmark mesure la capacité d’un agent à accomplir une tâche tout en dialoguant correctement, en appliquant les politiques imposées et en choisissant les appels d’outils adaptés. Il sert ainsi à examiner la fiabilité et la constance des comportements sur plusieurs essais dans les domaines retail et airline.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSierra Research
Capacités mesuréesagents, généraliste, raisonnement, appels d'outils
ModalitéTexte
Type de questionstâches agentiques interactives avec utilisateur simulé, règles de domaine et appels d’outils/API
Métrique d'évaluationtask success rate / pass^k
AccèsPublic
Languesanglais
Taille du jeuenviron 165 tâches utilisateur, dans les domaines retail et airline
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Step-3.5-FlashStepFun🟢 Ouvert88,2 %2 février 2026Auto-déclaré
2GLM-4.7Zhipu AI🟢 Ouvert87,4 %22 décembre 2025Auto-déclaré
3MiMo-V2-FlashXiaomi🟢 Ouvert80,3 %16 décembre 2025Auto-déclaré
4GLM-4.7-FlashZhipu AI🟢 Ouvert79,5 %19 janvier 2026Auto-déclaré
5MiniMax M2MiniMax🟢 Ouvert77,2 %27 octobre 2025Auto-déclaré
6o3OpenAI🔒 Propriétaire63,0 %16 avril 2025Auto-déclaré

Classement établi sur 6 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 79,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Tau-bench indique qu’un agent réussit fréquemment les tâches complètes, et pas seulement une étape isolée. Il doit coordonner la conversation, les règles métier et les appels d’API, puis reproduire ce comportement sur plusieurs essais, dimension reflétée par le task success rate et pass^k. Le classement de la base place Step-3.5-Flash en tête à 88 %, face à une médiane de 80 % sur six modèles. Cet écart relativement limité signale des performances déjà élevées dans cet ensemble et invite à surveiller un possible effet de saturation, sans assimiler ces scores à une maîtrise générale des tâches agentiques. La portée reste circonscrite à environ 165 tâches en anglais, réparties entre retail et airline. Le caractère public du benchmark impose aussi de considérer le risque de contamination lors de l’interprétation. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison offre une indication utile, mais avec une rigueur moins homogène qu’une évaluation entièrement mesurée selon un protocole indépendant commun.


Sources des scores : llm-stats.