Tau2 Telecom

Créé par Sierra Research, Tau2 Telecom est un benchmark consacré aux agents conversationnels capables d’utiliser des outils dans des scénarios de dépannage télécom. Il modélise ces interactions comme un environnement partagé en dual-control, de type Dec-POMDP, dans lequel l’agent et…

Créé par Sierra Research, Tau2 Telecom est un benchmark consacré aux agents conversationnels capables d’utiliser des outils dans des scénarios de dépannage télécom. Il modélise ces interactions comme un environnement partagé en dual-control, de type Dec-POMDP, dans lequel l’agent et l’utilisateur peuvent tous deux agir.

Les conversations multi-tours évaluent surtout la coordination, la communication et l’exécution correcte d’une procédure à l’aide d’outils. Tau2 Telecom sert ainsi à mesurer la capacité des modèles à mener une tâche interactive jusqu’à sa résolution vérifiable.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSierra Research
Capacités mesuréesAgents conversationnels avec outils dans un environnement partage, coordination agent-utilisateur sur des scenarios de depannage telecom
ModalitéTexte
Type de questionsscenarios conversationnels multi-tours en dual-control (Dec-POMDP) avec appels d'outils par l'agent et l'utilisateur
Métrique d'évaluationtaux de reussite des taches (pass^k / reward verifiable)
AccèsPublic
Languesanglais
Taille du jeudomaine telecom de tau2-bench (taches de depannage generees par un generateur compositionnel)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (34)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 4.6Anthropic🔒 Propriétaire99,3 %5 février 2026Auto-déclaré
2LongCat-Flash-Thinking-2601Meituan🟢 Ouvert99,3 %14 janvier 2026Auto-déclaré
3GPT-4.5OpenAI🔒 Propriétaire98,9 %5 mars 2026Auto-déclaré
4GPT-5.2OpenAI🔒 Propriétaire98,7 %11 décembre 2025Auto-déclaré
5Claude Opus 4.5Anthropic🔒 Propriétaire98,2 %24 novembre 2025Auto-déclaré
6GPT-5.5OpenAI🔒 Propriétaire98,0 %23 avril 2026Auto-déclaré
7Claude Sonnet 4.6Anthropic🔒 Propriétaire97,9 %17 février 2026Auto-déclaré
8MiMo-V2-ProXiaomi🔒 Propriétaire96,8 %18 mars 2026Auto-déclaré
9GPT-5OpenAI🔒 Propriétaire96,7 %7 août 2025Auto-déclaré
10GPT-5.1OpenAI🔒 Propriétaire95,6 %13 novembre 2025Auto-déclaré
11GPT-5.1 InstantOpenAI🔒 Propriétaire95,6 %12 novembre 2025Auto-déclaré
12GPT-5.4 miniOpenAI🔒 Propriétaire93,4 %17 mars 2026Auto-déclaré
13Nova 2 ProAmazon🔒 Propriétaire92,7 %2 décembre 2025Auto-déclaré
14GPT-5.4 nanoOpenAI🔒 Propriétaire92,5 %17 mars 2026Auto-déclaré
15Muse SparkMeta🔒 Propriétaire91,5 %8 avril 2026Auto-déclaré
16MiniMax M2MiniMax🟢 Ouvert87,0 %27 octobre 2025Auto-déclaré
17MiniMax M2.1MiniMax🟢 Ouvert87,0 %23 décembre 2025Auto-déclaré
18Command A+Cohere🟢 Ouvert85,0 %20 mai 2026Auto-déclaré
19LongCat-Flash-ThinkingMeituan🟢 Ouvert83,1 %22 septembre 2025Auto-déclaré
20Claude Haiku 4.5Anthropic🔒 Propriétaire83,0 %15 octobre 2025Auto-déclaré
21Nova 2 OmniAmazon🔒 Propriétaire80,0 %2 décembre 2025Auto-déclaré
22Nova 2 LiteAmazon🔒 Propriétaire76,0 %2 décembre 2025Auto-déclaré
23LongCat-Flash-ChatMeituan🟢 Ouvert73,7 %29 août 2025Auto-déclaré
24LongCat-Flash-LiteMeituan🟢 Ouvert72,8 %5 février 2026Auto-déclaré
25MAI-Code-1-FlashMicrosoft🔒 Propriétaire71,7 %2 juin 2026Auto-déclaré
26Kimi K2 InstructMoonshot AI🟢 Ouvert65,8 %11 juillet 2025Auto-déclaré
27Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert65,8 %5 septembre 2025Auto-déclaré
28Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert64,4 %11 mars 2026Auto-déclaré
29o3OpenAI🔒 Propriétaire58,2 %16 avril 2025Auto-déclaré
30Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert45,6 %25 juillet 2025Auto-déclaré
31Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert43,9 %10 septembre 2025Auto-déclaré
32Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert42,2 %15 décembre 2025Auto-déclaré
33GPT-4oOpenAI🔒 Propriétaire23,5 %27 mars 2025Auto-déclaré
34Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert13,2 %10 septembre 2025Auto-déclaré

Classement établi sur 34 modèles évalués, dont 21 de grands éditeurs. Score médian de l'ensemble : 86,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent réussit fréquemment les tâches de dépannage générées de manière compositionnelle, en coordonnant ses appels d’outils avec les actions de l’utilisateur. La réussite repose sur une récompense vérifiable, ce qui fournit un critère mesurable. Toutefois, les scores de la base étant majoritairement auto-déclarés par les éditeurs, leur comparaison dépend aussi de la cohérence des protocoles d’exécution et de publication.

Le niveau médian de 86 % et le meilleur résultat, 99 % pour Claude Opus 4.6, signalent une forte concentration vers le haut du barème. Cette proximité du plafond peut réduire le pouvoir discriminant du benchmark entre les modèles les plus performants. Son accès public impose également de considérer un risque de contamination lors de l’interprétation, sans que cela établisse qu’elle a eu lieu. Enfin, la portée reste ciblée sur des conversations en anglais et sur le dépannage télécom avec outils. Le classement révèle donc surtout la maîtrise de cette forme précise de coordination agent-utilisateur, plutôt qu’une aptitude générale à toutes les tâches conversationnelles ou agentiques.


Sources des scores : llm-stats.