Tau2 Telecom
Créé par Sierra Research, Tau2 Telecom est un benchmark consacré aux agents conversationnels capables d’utiliser des outils dans des scénarios de dépannage télécom. Il modélise ces interactions comme un environnement partagé en dual-control, de type Dec-POMDP, dans lequel l’agent et…
Créé par Sierra Research, Tau2 Telecom est un benchmark consacré aux agents conversationnels capables d’utiliser des outils dans des scénarios de dépannage télécom. Il modélise ces interactions comme un environnement partagé en dual-control, de type Dec-POMDP, dans lequel l’agent et l’utilisateur peuvent tous deux agir.
Les conversations multi-tours évaluent surtout la coordination, la communication et l’exécution correcte d’une procédure à l’aide d’outils. Tau2 Telecom sert ainsi à mesurer la capacité des modèles à mener une tâche interactive jusqu’à sa résolution vérifiable.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Sierra Research |
| Capacités mesurées | Agents conversationnels avec outils dans un environnement partage, coordination agent-utilisateur sur des scenarios de depannage telecom |
| Modalité | Texte |
| Type de questions | scenarios conversationnels multi-tours en dual-control (Dec-POMDP) avec appels d'outils par l'agent et l'utilisateur |
| Métrique d'évaluation | taux de reussite des taches (pass^k / reward verifiable) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | domaine telecom de tau2-bench (taches de depannage generees par un generateur compositionnel) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (34)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 99,3 % | 5 février 2026 | Auto-déclaré |
| 2 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 99,3 % | 14 janvier 2026 | Auto-déclaré |
| 3 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 98,9 % | 5 mars 2026 | Auto-déclaré |
| 4 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 98,7 % | 11 décembre 2025 | Auto-déclaré |
| 5 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 98,2 % | 24 novembre 2025 | Auto-déclaré |
| 6 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 98,0 % | 23 avril 2026 | Auto-déclaré |
| 7 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 97,9 % | 17 février 2026 | Auto-déclaré |
| 8 | MiMo-V2-Pro | Xiaomi | 🔒 Propriétaire | 96,8 % | 18 mars 2026 | Auto-déclaré |
| 9 | GPT-5 | OpenAI | 🔒 Propriétaire | 96,7 % | 7 août 2025 | Auto-déclaré |
| 10 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 95,6 % | 13 novembre 2025 | Auto-déclaré |
| 11 | GPT-5.1 Instant | OpenAI | 🔒 Propriétaire | 95,6 % | 12 novembre 2025 | Auto-déclaré |
| 12 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 93,4 % | 17 mars 2026 | Auto-déclaré |
| 13 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 92,7 % | 2 décembre 2025 | Auto-déclaré |
| 14 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 92,5 % | 17 mars 2026 | Auto-déclaré |
| 15 | Muse Spark | Meta | 🔒 Propriétaire | 91,5 % | 8 avril 2026 | Auto-déclaré |
| 16 | MiniMax M2 | MiniMax | 🟢 Ouvert | 87,0 % | 27 octobre 2025 | Auto-déclaré |
| 17 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 87,0 % | 23 décembre 2025 | Auto-déclaré |
| 18 | Command A+ | Cohere | 🟢 Ouvert | 85,0 % | 20 mai 2026 | Auto-déclaré |
| 19 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 83,1 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 83,0 % | 15 octobre 2025 | Auto-déclaré |
| 21 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 80,0 % | 2 décembre 2025 | Auto-déclaré |
| 22 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 76,0 % | 2 décembre 2025 | Auto-déclaré |
| 23 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 73,7 % | 29 août 2025 | Auto-déclaré |
| 24 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 72,8 % | 5 février 2026 | Auto-déclaré |
| 25 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 71,7 % | 2 juin 2026 | Auto-déclaré |
| 26 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 65,8 % | 11 juillet 2025 | Auto-déclaré |
| 27 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 65,8 % | 5 septembre 2025 | Auto-déclaré |
| 28 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 64,4 % | 11 mars 2026 | Auto-déclaré |
| 29 | o3 | OpenAI | 🔒 Propriétaire | 58,2 % | 16 avril 2025 | Auto-déclaré |
| 30 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 45,6 % | 25 juillet 2025 | Auto-déclaré |
| 31 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,9 % | 10 septembre 2025 | Auto-déclaré |
| 32 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 42,2 % | 15 décembre 2025 | Auto-déclaré |
| 33 | GPT-4o | OpenAI | 🔒 Propriétaire | 23,5 % | 27 mars 2025 | Auto-déclaré |
| 34 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 13,2 % | 10 septembre 2025 | Auto-déclaré |
Classement établi sur 34 modèles évalués, dont 21 de grands éditeurs. Score médian de l'ensemble : 86,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent réussit fréquemment les tâches de dépannage générées de manière compositionnelle, en coordonnant ses appels d’outils avec les actions de l’utilisateur. La réussite repose sur une récompense vérifiable, ce qui fournit un critère mesurable. Toutefois, les scores de la base étant majoritairement auto-déclarés par les éditeurs, leur comparaison dépend aussi de la cohérence des protocoles d’exécution et de publication.
Le niveau médian de 86 % et le meilleur résultat, 99 % pour Claude Opus 4.6, signalent une forte concentration vers le haut du barème. Cette proximité du plafond peut réduire le pouvoir discriminant du benchmark entre les modèles les plus performants. Son accès public impose également de considérer un risque de contamination lors de l’interprétation, sans que cela établisse qu’elle a eu lieu. Enfin, la portée reste ciblée sur des conversations en anglais et sur le dépannage télécom avec outils. Le classement révèle donc surtout la maîtrise de cette forme précise de coordination agent-utilisateur, plutôt qu’une aptitude générale à toutes les tâches conversationnelles ou agentiques.
Sources des scores : llm-stats.