TAU-bench Retail

TAU-bench Retail est un benchmark créé par Sierra pour évaluer les agents conversationnels dans des environnements de vente au détail. Il repose sur des échanges dynamiques et multi-tours avec un utilisateur simulé, associés à l’utilisation d’outils métier.

TAU-bench Retail est un benchmark créé par Sierra pour évaluer les agents conversationnels dans des environnements de vente au détail. Il repose sur des échanges dynamiques et multi-tours avec un utilisateur simulé, associés à l’utilisation d’outils métier.

L’évaluation porte sur la capacité d’un modèle à comprendre une demande, à appeler correctement les API adaptées et à respecter les politiques opérationnelles. Les scénarios couvrent notamment l’annulation de commandes, les changements d’adresse et le suivi de statut, afin d’apprécier l’exécution complète de tâches agentiques.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSierra
Capacités mesuréescommunication, raisonnement, appels d'outils
ModalitéTexte
Type de questionstâches agentiques multi-tours avec appels d’outils et utilisateur simulé
Métrique d'évaluationsuccess rate
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeuenviron 115 tâches pour le domaine Retail
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (24)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Sonnet 4.5Anthropic🔒 Propriétaire86,2 %29 septembre 2025Auto-déclaré
2Claude Opus 4.1Anthropic🔒 Propriétaire82,4 %5 août 2025Auto-déclaré
3Claude Opus 4Anthropic🔒 Propriétaire81,4 %22 mai 2025Auto-déclaré
4Claude 3.7 SonnetAnthropic🔒 Propriétaire81,2 %24 février 2025Auto-déclaré
5Claude Sonnet 4Anthropic🔒 Propriétaire80,5 %22 mai 2025Auto-déclaré
6GLM-4.5Zhipu AI🟢 Ouvert79,7 %28 juillet 2025Auto-déclaré
7GLM-4.5-AirZhipu AI🟢 Ouvert77,9 %28 juillet 2025Auto-déclaré
8Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,5 %31 janvier 2025Auto-déclaré
9o4-miniOpenAI🔒 Propriétaire71,8 %16 avril 2025Auto-déclaré
10o1OpenAI🔒 Propriétaire70,8 %17 décembre 2024Auto-déclaré
11Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert69,6 %10 septembre 2025Auto-déclaré
12Claude 3.5 SonnetAnthropic🔒 Propriétaire69,2 %22 octobre 2024Auto-déclaré
13GPT-4.5OpenAI🔒 Propriétaire68,4 %5 mars 2026Auto-déclaré
14GPT-4.1OpenAI🔒 Propriétaire68,0 %14 avril 2025Auto-déclaré
15GPT OSS 120BOpenAI🟢 Ouvert67,8 %5 août 2025Auto-déclaré
16MiniMax M1MiniMax🟢 Ouvert67,8 %17 juin 2025Auto-déclaré
17Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert67,8 %25 juillet 2025Auto-déclaré
18Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert60,9 %10 septembre 2025Auto-déclaré
19GPT-4oOpenAI🔒 Propriétaire60,3 %27 mars 2025Auto-déclaré
20o3-miniOpenAI🔒 Propriétaire57,6 %30 janvier 2025Auto-déclaré
21GPT-4.1 miniOpenAI🔒 Propriétaire55,8 %14 avril 2025Auto-déclaré
22GPT OSS 20BOpenAI🟢 Ouvert54,8 %5 août 2025Auto-déclaré
23Claude 3.5 HaikuAnthropic🔒 Propriétaire51,0 %4 novembre 2024Auto-déclaré
24GPT-4.1 nanoOpenAI🔒 Propriétaire22,6 %14 avril 2025Auto-déclaré

Classement établi sur 24 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 68,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent mène à bien une forte proportion de scénarios combinant dialogue, choix d’outils et respect des règles métier. La métrique mesure donc la réussite finale de la tâche, plutôt qu’une aptitude isolée. Dans la base, la médiane de 69 % et le meilleur résultat de 86 %, obtenu par Claude Sonnet 4.5, montrent un écart entre le niveau central et la tête du classement, tout en laissant une marge avant une saturation complète.

La comparaison doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure unique. Le caractère public du benchmark peut aussi accroître le risque de contamination au fil de sa diffusion. Sa portée reste ciblée sur environ 115 tâches en anglais dans le domaine Retail, ce qui limite l’extrapolation à d’autres langues, secteurs ou formes d’interaction. Sur les 24 modèles évalués, le classement met surtout en évidence la capacité de Claude Sonnet 4.5 à réussir ces parcours agentiques spécialisés.


Sources des scores : llm-stats.