Tau2 Retail

Tau2 Retail est un benchmark conçu par Sierra Research pour évaluer des agents conversationnels dans des scénarios de service client liés au commerce électronique. Les tâches prennent la forme de dialogues multi-tours au cours desquels l’agent et l’utilisateur peuvent interagir avec des…

Tau2 Retail est un benchmark conçu par Sierra Research pour évaluer des agents conversationnels dans des scénarios de service client liés au commerce électronique. Les tâches prennent la forme de dialogues multi-tours au cours desquels l’agent et l’utilisateur peuvent interagir avec des outils dans un environnement dual-control.

L’évaluation porte sur l’usage d’outils, le respect des règles métier, la communication et la coordination entre les parties. Elle vise ainsi à mesurer la capacité des modèles à conduire une demande client jusqu’à un état final conforme à l’objectif annoté.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSierra Research
Capacités mesuréesagents conversationnels, usage d'outils, respect de règles métier, communication, coordination en dual-control
ModalitéTexte
Type de questionsdialogues multi-tours agent-utilisateur en environnement dual-control avec appels d'outils (domaine retail / service client e-commerce)
Métrique d'évaluationpass^k (proportion de tâches réussies sur k essais), comparaison de l'état final de la base au but annoté
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeudomaine retail de τ²-bench (~115 tâches)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (25)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 4.6Anthropic🔒 Propriétaire91,9 %5 février 2026Auto-déclaré
2Claude Sonnet 4.6Anthropic🔒 Propriétaire91,7 %17 février 2026Auto-déclaré
3Claude Opus 4.5Anthropic🔒 Propriétaire88,9 %24 novembre 2025Auto-déclaré
4LongCat-Flash-Thinking-2601Meituan🟢 Ouvert88,6 %14 janvier 2026Auto-déclaré
5Claude Haiku 4.5Anthropic🔒 Propriétaire83,2 %15 octobre 2025Auto-déclaré
6GPT-5.2OpenAI🔒 Propriétaire82,0 %11 décembre 2025Auto-déclaré
7GPT-5OpenAI🔒 Propriétaire81,1 %7 août 2025Auto-déclaré
8o3OpenAI🔒 Propriétaire80,2 %16 avril 2025Auto-déclaré
9Nova 2 OmniAmazon🔒 Propriétaire78,3 %2 décembre 2025Auto-déclaré
10GPT-5.1OpenAI🔒 Propriétaire77,9 %13 novembre 2025Auto-déclaré
11GPT-5.1 InstantOpenAI🔒 Propriétaire77,9 %12 novembre 2025Auto-déclaré
12Nova 2 ProAmazon🔒 Propriétaire77,7 %2 décembre 2025Auto-déclaré
13Nova 2 LiteAmazon🔒 Propriétaire76,5 %2 décembre 2025Auto-déclaré
14LongCat-Flash-LiteMeituan🟢 Ouvert73,1 %5 février 2026Auto-déclaré
15Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert71,9 %25 juillet 2025Auto-déclaré
16LongCat-Flash-ThinkingMeituan🟢 Ouvert71,5 %22 septembre 2025Auto-déclaré
17Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert71,3 %22 juillet 2025Auto-déclaré
18LongCat-Flash-ChatMeituan🟢 Ouvert71,3 %29 août 2025Auto-déclaré
19Kimi K2 InstructMoonshot AI🟢 Ouvert70,6 %11 juillet 2025Auto-déclaré
20Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert70,6 %5 septembre 2025Auto-déclaré
21Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert67,8 %10 septembre 2025Auto-déclaré
22GPT-4oOpenAI🔒 Propriétaire63,4 %27 mars 2025Auto-déclaré
23Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert62,8 %11 mars 2026Auto-déclaré
24Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,3 %10 septembre 2025Auto-déclaré
25Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert56,9 %15 décembre 2025Auto-déclaré

Classement établi sur 25 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 76,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Tau2 Retail indique qu’un agent accomplit régulièrement les tâches demandées sur plusieurs essais, tout en coordonnant dialogue, appels d’outils et contraintes métier. La validation repose sur la comparaison entre l’état final de la base et le but annoté, ce qui fournit un critère mesurable au-delà de la seule qualité apparente de la conversation. La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Avec une médiane de 76 % parmi 25 modèles et un meilleur résultat de 92 % pour Claude Opus 4.6, le benchmark révèle un écart réel entre le niveau central et la tête, mais aussi une marge de progression limitée au sommet, susceptible de réduire progressivement son pouvoir discriminant. Son accès public impose également de garder à l’esprit le risque de contamination lors de l’interprétation des performances. Enfin, sa portée reste ciblée sur environ 115 tâches en anglais, dans le domaine retail et le service client e-commerce, sans représenter l’ensemble des usages possibles des agents conversationnels.


Sources des scores : llm-stats.