Tau2 Retail
Tau2 Retail est un benchmark conçu par Sierra Research pour évaluer des agents conversationnels dans des scénarios de service client liés au commerce électronique. Les tâches prennent la forme de dialogues multi-tours au cours desquels l’agent et l’utilisateur peuvent interagir avec des…
Tau2 Retail est un benchmark conçu par Sierra Research pour évaluer des agents conversationnels dans des scénarios de service client liés au commerce électronique. Les tâches prennent la forme de dialogues multi-tours au cours desquels l’agent et l’utilisateur peuvent interagir avec des outils dans un environnement dual-control.
L’évaluation porte sur l’usage d’outils, le respect des règles métier, la communication et la coordination entre les parties. Elle vise ainsi à mesurer la capacité des modèles à conduire une demande client jusqu’à un état final conforme à l’objectif annoté.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Sierra Research |
| Capacités mesurées | agents conversationnels, usage d'outils, respect de règles métier, communication, coordination en dual-control |
| Modalité | Texte |
| Type de questions | dialogues multi-tours agent-utilisateur en environnement dual-control avec appels d'outils (domaine retail / service client e-commerce) |
| Métrique d'évaluation | pass^k (proportion de tâches réussies sur k essais), comparaison de l'état final de la base au but annoté |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | domaine retail de τ²-bench (~115 tâches) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (25)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 91,9 % | 5 février 2026 | Auto-déclaré |
| 2 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 91,7 % | 17 février 2026 | Auto-déclaré |
| 3 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 88,9 % | 24 novembre 2025 | Auto-déclaré |
| 4 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 88,6 % | 14 janvier 2026 | Auto-déclaré |
| 5 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 83,2 % | 15 octobre 2025 | Auto-déclaré |
| 6 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 82,0 % | 11 décembre 2025 | Auto-déclaré |
| 7 | GPT-5 | OpenAI | 🔒 Propriétaire | 81,1 % | 7 août 2025 | Auto-déclaré |
| 8 | o3 | OpenAI | 🔒 Propriétaire | 80,2 % | 16 avril 2025 | Auto-déclaré |
| 9 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 78,3 % | 2 décembre 2025 | Auto-déclaré |
| 10 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 77,9 % | 13 novembre 2025 | Auto-déclaré |
| 11 | GPT-5.1 Instant | OpenAI | 🔒 Propriétaire | 77,9 % | 12 novembre 2025 | Auto-déclaré |
| 12 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 77,7 % | 2 décembre 2025 | Auto-déclaré |
| 13 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 76,5 % | 2 décembre 2025 | Auto-déclaré |
| 14 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 73,1 % | 5 février 2026 | Auto-déclaré |
| 15 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,9 % | 25 juillet 2025 | Auto-déclaré |
| 16 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 71,5 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,3 % | 22 juillet 2025 | Auto-déclaré |
| 18 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 71,3 % | 29 août 2025 | Auto-déclaré |
| 19 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 70,6 % | 11 juillet 2025 | Auto-déclaré |
| 20 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 70,6 % | 5 septembre 2025 | Auto-déclaré |
| 21 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,8 % | 10 septembre 2025 | Auto-déclaré |
| 22 | GPT-4o | OpenAI | 🔒 Propriétaire | 63,4 % | 27 mars 2025 | Auto-déclaré |
| 23 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 62,8 % | 11 mars 2026 | Auto-déclaré |
| 24 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,3 % | 10 septembre 2025 | Auto-déclaré |
| 25 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 56,9 % | 15 décembre 2025 | Auto-déclaré |
Classement établi sur 25 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 76,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Tau2 Retail indique qu’un agent accomplit régulièrement les tâches demandées sur plusieurs essais, tout en coordonnant dialogue, appels d’outils et contraintes métier. La validation repose sur la comparaison entre l’état final de la base et le but annoté, ce qui fournit un critère mesurable au-delà de la seule qualité apparente de la conversation. La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Avec une médiane de 76 % parmi 25 modèles et un meilleur résultat de 92 % pour Claude Opus 4.6, le benchmark révèle un écart réel entre le niveau central et la tête, mais aussi une marge de progression limitée au sommet, susceptible de réduire progressivement son pouvoir discriminant. Son accès public impose également de garder à l’esprit le risque de contamination lors de l’interprétation des performances. Enfin, sa portée reste ciblée sur environ 115 tâches en anglais, dans le domaine retail et le service client e-commerce, sans représenter l’ensemble des usages possibles des agents conversationnels.
Sources des scores : llm-stats.