t2-bench

Créé par Victor Barres et al. chez Sierra, t2-bench évalue les capacités agentiques d’utilisation d’outils dans des tâches conversationnelles complexes. Les modèles doivent sélectionner, ordonner et employer des outils afin de planifier puis d’exécuter des scénarios en plusieurs étapes.

Créé par Victor Barres et al. chez Sierra, t2-bench évalue les capacités agentiques d’utilisation d’outils dans des tâches conversationnelles complexes. Les modèles doivent sélectionner, ordonner et employer des outils afin de planifier puis d’exécuter des scénarios en plusieurs étapes.

Sa particularité réside dans un environnement partagé à double contrôle, où l’agent et l’utilisateur simulé peuvent tous deux modifier l’état. Ce dispositif aide à distinguer les erreurs de raisonnement des problèmes de communication et à apprécier plus finement l’autonomie opérationnelle des modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkVictor Barres et al. (Sierra)
Capacités mesuréesÉvalue les agents conversationnels capables d'utiliser des outils dans un environnement partagé où l'agent ET l'utilisateur simulé peuvent modifier l'état, en distinguant erreurs de raisonnement et de communication.
ModalitéTexte
Type de questionstâches agentiques conversationnelles d'usage d'outils (Tool-Agent-User) en environnement à double contrôle
Métrique d'évaluationpass^k (évaluation basée sur la récompense / vérification d'actions)
AccèsPublic
LicenceMIT (code) ; papier CC BY 4.0
Languesanglais
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (23)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.99,3 %19 février 2026Auto-déclaré
2Gemini 3 FlashGoogle🔒 Propriétaire90,2 %17 décembre 2025Auto-déclaré
3GLM-5Zhipu AI🟢 Ouvert89,7 %11 février 2026Auto-déclaré
4Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert86,7 %16 février 2026Auto-déclaré
5Gemma 4 31BGoogle🟢 Ouvert86,4 %2 avril 2026Auto-déclaré
6Gemma 4 26B-A4BGoogle🟢 Ouvert85,5 %2 avril 2026Auto-déclaré
7Gemini 3 ProGoogle🔒 Propriétaire85,4 %18 novembre 2025Auto-déclaré
8Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert81,2 %24 février 2026Auto-déclaré
9DeepSeek-V3.2DeepSeek🟢 Ouvert80,3 %1 décembre 2025Auto-déclaré
10DeepSeek-V3.2-SpecialeDeepSeek🟢 Ouvert80,3 %1 décembre 2025Auto-déclaré
11DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert80,2 %1 décembre 2025Auto-déclaré
12Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert79,9 %2 mars 2026Auto-déclaré
13Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert79,5 %24 février 2026Auto-déclaré
14Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert79,1 %2 mars 2026Auto-déclaré
15Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert79,0 %24 février 2026Auto-déclaré
16Qwen3 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire74,8 %15 décembre 2025Auto-déclaré
17K-EXAONE-236B-A23BLG AI Research🔒 Propriétaire73,2 %31 décembre 2025Auto-déclaré
18GPT OSS 120BOpenAI🟢 Ouvert63,9 %5 août 2025Auto-déclaré
19Gemma 4 E4BGoogle🟢 Ouvert57,5 %2 avril 2026Auto-déclaré
20DiffusionGemma 26B-A4BGoogle🟢 Ouvert56,2 %10 juin 2026Auto-déclaré
21Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert48,8 %2 mars 2026Auto-déclaré
22Gemma 4 E2BGoogle🟢 Ouvert29,4 %2 avril 2026Auto-déclaré
23Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert11,6 %2 mars 2026Auto-déclaré

Classement établi sur 23 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 79,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle réussit régulièrement les tâches en choisissant et en enchaînant correctement les outils, tout en tenant compte des modifications apportées par l’utilisateur simulé. La métrique pass^k repose sur la récompense et la vérification des actions, ce qui ancre l’évaluation dans l’exécution effective. La prudence reste toutefois nécessaire, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. Avec une médiane de 80 % sur 23 modèles et un meilleur résultat de 99 % pour Gemini 3.1 Pro Preview, le classement montre un niveau globalement élevé et une forte proximité avec le plafond pour le modèle de tête. Cette situation peut réduire le pouvoir discriminant du benchmark au sommet du classement. Sa portée demeure ciblée sur des tâches conversationnelles en anglais, fondées sur l’usage d’outils dans un environnement partagé. Les résultats caractérisent donc cette forme précise d’interaction agentique, plutôt qu’une compétence générale couvrant tous les contextes d’usage des modèles.


Sources des scores : llm-stats.