TAU3-Bench

Créé par Sierra Research, TAU3-Bench évalue les capacités d’agents généralistes dans des scénarios de service client en anglais. Il met en jeu des interactions multi-tours avec un utilisateur simulé, la recherche d’informations, l’appel d’outils et des prises de décision complexes.

Créé par Sierra Research, TAU3-Bench évalue les capacités d’agents généralistes dans des scénarios de service client en anglais. Il met en jeu des interactions multi-tours avec un utilisateur simulé, la recherche d’informations, l’appel d’outils et des prises de décision complexes.

Issu de la lignée tau-bench, le benchmark examine la capacité d’un modèle à coordonner ces compétences au fil d’une tâche, plutôt qu’à produire une réponse isolée. Il étend aussi l’évaluation aux interactions vocales full-duplex, afin de couvrir une autre modalité d’échange entre agent et utilisateur.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSierra Research
Capacités mesuréesCapacités d'agent généraliste : interactions multi-tours avec un utilisateur simulé, retrieval, appel d'outils et prise de décision complexe ; ajoute l'évaluation vocale full-duplex.
ModalitéTexte
Type de questionsAgent généraliste multi-tours / interaction outil-agent-utilisateur (service client)
Métrique d'évaluationpass^k (fiabilité sur plusieurs essais), lignée tau-bench
AccèsPublic
LanguesAnglais
Taille du jeu5 domaines : mock, airline, retail, telecom, banking_knowledge
Année de publication2026
RessourcesSite / dépôt officiel

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiMo-V2.5-ProXiaomi🟢 Ouvert72,9 %27 avril 2026Auto-déclaré
2Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire70,7 %31 mars 2026Auto-déclaré
3GLM-5.1Zhipu AI🟢 Ouvert70,6 %7 avril 2026Auto-déclaré
4Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert67,2 %16 avril 2026Auto-déclaré
5Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert22,6 %4 juin 2026Auto-déclaré

Classement établi sur 5 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 70,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur TAU3-Bench indique qu’un agent accomplit fréquemment des tâches complètes malgré l’enchaînement des dialogues, du retrieval, des outils et des décisions. La métrique pass^k met l’accent sur la fiabilité au fil de plusieurs essais, et pas seulement sur une réussite ponctuelle. L’interprétation reste toutefois prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole externe commun.

Le classement est resserré au sommet : MiMo-V2.5-Pro atteint 73 %, contre une médiane de 71 % pour les cinq modèles évalués. Cet écart limité suggère une faible séparation entre la meilleure performance et le niveau central de cet ensemble, ce qui peut réduire le pouvoir discriminant du classement et signaler un début de saturation parmi ces modèles. La portée demeure circonscrite à cinq domaines de service client et à l’anglais. Enfin, l’accès public appelle à considérer le risque de contamination ou de familiarisation avec les tâches lors de l’interprétation des résultats.


Sources des scores : llm-stats.