TAU-bench Retail
TAU-bench Retail est un benchmark créé par Sierra pour évaluer les agents conversationnels dans des environnements de vente au détail. Il repose sur des échanges dynamiques et multi-tours avec un utilisateur simulé, associés à l’utilisation d’outils métier.
TAU-bench Retail est un benchmark créé par Sierra pour évaluer les agents conversationnels dans des environnements de vente au détail. Il repose sur des échanges dynamiques et multi-tours avec un utilisateur simulé, associés à l’utilisation d’outils métier.
L’évaluation porte sur la capacité d’un modèle à comprendre une demande, à appeler correctement les API adaptées et à respecter les politiques opérationnelles. Les scénarios couvrent notamment l’annulation de commandes, les changements d’adresse et le suivi de statut, afin d’apprécier l’exécution complète de tâches agentiques.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Sierra |
| Capacités mesurées | communication, raisonnement, appels d'outils |
| Modalité | Texte |
| Type de questions | tâches agentiques multi-tours avec appels d’outils et utilisateur simulé |
| Métrique d'évaluation | success rate |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | environ 115 tâches pour le domaine Retail |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (24)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 86,2 % | 29 septembre 2025 | Auto-déclaré |
| 2 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 82,4 % | 5 août 2025 | Auto-déclaré |
| 3 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 81,4 % | 22 mai 2025 | Auto-déclaré |
| 4 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 81,2 % | 24 février 2025 | Auto-déclaré |
| 5 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 80,5 % | 22 mai 2025 | Auto-déclaré |
| 6 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 79,7 % | 28 juillet 2025 | Auto-déclaré |
| 7 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 77,9 % | 28 juillet 2025 | Auto-déclaré |
| 8 | Qwen3-Coder 480B A35B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,5 % | 31 janvier 2025 | Auto-déclaré |
| 9 | o4-mini | OpenAI | 🔒 Propriétaire | 71,8 % | 16 avril 2025 | Auto-déclaré |
| 10 | o1 | OpenAI | 🔒 Propriétaire | 70,8 % | 17 décembre 2024 | Auto-déclaré |
| 11 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,6 % | 10 septembre 2025 | Auto-déclaré |
| 12 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 69,2 % | 22 octobre 2024 | Auto-déclaré |
| 13 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 68,4 % | 5 mars 2026 | Auto-déclaré |
| 14 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 68,0 % | 14 avril 2025 | Auto-déclaré |
| 15 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 67,8 % | 5 août 2025 | Auto-déclaré |
| 16 | MiniMax M1 | MiniMax | 🟢 Ouvert | 67,8 % | 17 juin 2025 | Auto-déclaré |
| 17 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,8 % | 25 juillet 2025 | Auto-déclaré |
| 18 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,9 % | 10 septembre 2025 | Auto-déclaré |
| 19 | GPT-4o | OpenAI | 🔒 Propriétaire | 60,3 % | 27 mars 2025 | Auto-déclaré |
| 20 | o3-mini | OpenAI | 🔒 Propriétaire | 57,6 % | 30 janvier 2025 | Auto-déclaré |
| 21 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 55,8 % | 14 avril 2025 | Auto-déclaré |
| 22 | GPT OSS 20B | OpenAI | 🟢 Ouvert | 54,8 % | 5 août 2025 | Auto-déclaré |
| 23 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 51,0 % | 4 novembre 2024 | Auto-déclaré |
| 24 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 22,6 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 24 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 68,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent mène à bien une forte proportion de scénarios combinant dialogue, choix d’outils et respect des règles métier. La métrique mesure donc la réussite finale de la tâche, plutôt qu’une aptitude isolée. Dans la base, la médiane de 69 % et le meilleur résultat de 86 %, obtenu par Claude Sonnet 4.5, montrent un écart entre le niveau central et la tête du classement, tout en laissant une marge avant une saturation complète.
La comparaison doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure unique. Le caractère public du benchmark peut aussi accroître le risque de contamination au fil de sa diffusion. Sa portée reste ciblée sur environ 115 tâches en anglais dans le domaine Retail, ce qui limite l’extrapolation à d’autres langues, secteurs ou formes d’interaction. Sur les 24 modèles évalués, le classement met surtout en évidence la capacité de Claude Sonnet 4.5 à réussir ces parcours agentiques spécialisés.
Sources des scores : llm-stats.