TAU3-Bench
Créé par Sierra Research, TAU3-Bench évalue les capacités d’agents généralistes dans des scénarios de service client en anglais. Il met en jeu des interactions multi-tours avec un utilisateur simulé, la recherche d’informations, l’appel d’outils et des prises de décision complexes.
Créé par Sierra Research, TAU3-Bench évalue les capacités d’agents généralistes dans des scénarios de service client en anglais. Il met en jeu des interactions multi-tours avec un utilisateur simulé, la recherche d’informations, l’appel d’outils et des prises de décision complexes.
Issu de la lignée tau-bench, le benchmark examine la capacité d’un modèle à coordonner ces compétences au fil d’une tâche, plutôt qu’à produire une réponse isolée. Il étend aussi l’évaluation aux interactions vocales full-duplex, afin de couvrir une autre modalité d’échange entre agent et utilisateur.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Sierra Research |
| Capacités mesurées | Capacités d'agent généraliste : interactions multi-tours avec un utilisateur simulé, retrieval, appel d'outils et prise de décision complexe ; ajoute l'évaluation vocale full-duplex. |
| Modalité | Texte |
| Type de questions | Agent généraliste multi-tours / interaction outil-agent-utilisateur (service client) |
| Métrique d'évaluation | pass^k (fiabilité sur plusieurs essais), lignée tau-bench |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 5 domaines : mock, airline, retail, telecom, banking_knowledge |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel |
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 72,9 % | 27 avril 2026 | Auto-déclaré |
| 2 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 70,7 % | 31 mars 2026 | Auto-déclaré |
| 3 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 70,6 % | 7 avril 2026 | Auto-déclaré |
| 4 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,2 % | 16 avril 2026 | Auto-déclaré |
| 5 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 22,6 % | 4 juin 2026 | Auto-déclaré |
Classement établi sur 5 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 70,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur TAU3-Bench indique qu’un agent accomplit fréquemment des tâches complètes malgré l’enchaînement des dialogues, du retrieval, des outils et des décisions. La métrique pass^k met l’accent sur la fiabilité au fil de plusieurs essais, et pas seulement sur une réussite ponctuelle. L’interprétation reste toutefois prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole externe commun.
Le classement est resserré au sommet : MiMo-V2.5-Pro atteint 73 %, contre une médiane de 71 % pour les cinq modèles évalués. Cet écart limité suggère une faible séparation entre la meilleure performance et le niveau central de cet ensemble, ce qui peut réduire le pouvoir discriminant du classement et signaler un début de saturation parmi ces modèles. La portée demeure circonscrite à cinq domaines de service client et à l’anglais. Enfin, l’accès public appelle à considérer le risque de contamination ou de familiarisation avec les tâches lors de l’interprétation des résultats.
Sources des scores : llm-stats.