t2-bench
Créé par Victor Barres et al. chez Sierra, t2-bench évalue les capacités agentiques d’utilisation d’outils dans des tâches conversationnelles complexes. Les modèles doivent sélectionner, ordonner et employer des outils afin de planifier puis d’exécuter des scénarios en plusieurs étapes.
Créé par Victor Barres et al. chez Sierra, t2-bench évalue les capacités agentiques d’utilisation d’outils dans des tâches conversationnelles complexes. Les modèles doivent sélectionner, ordonner et employer des outils afin de planifier puis d’exécuter des scénarios en plusieurs étapes.
Sa particularité réside dans un environnement partagé à double contrôle, où l’agent et l’utilisateur simulé peuvent tous deux modifier l’état. Ce dispositif aide à distinguer les erreurs de raisonnement des problèmes de communication et à apprécier plus finement l’autonomie opérationnelle des modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Victor Barres et al. (Sierra) |
| Capacités mesurées | Évalue les agents conversationnels capables d'utiliser des outils dans un environnement partagé où l'agent ET l'utilisateur simulé peuvent modifier l'état, en distinguant erreurs de raisonnement et de communication. |
| Modalité | Texte |
| Type de questions | tâches agentiques conversationnelles d'usage d'outils (Tool-Agent-User) en environnement à double contrôle |
| Métrique d'évaluation | pass^k (évaluation basée sur la récompense / vérification d'actions) |
| Accès | Public |
| Licence | MIT (code) ; papier CC BY 4.0 |
| Langues | anglais |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (23)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 99,3 % | 19 février 2026 | Auto-déclaré | |
| 2 | Gemini 3 Flash | 🔒 Propriétaire | 90,2 % | 17 décembre 2025 | Auto-déclaré | |
| 3 | GLM-5 | Zhipu AI | 🟢 Ouvert | 89,7 % | 11 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,7 % | 16 février 2026 | Auto-déclaré |
| 5 | Gemma 4 31B | 🟢 Ouvert | 86,4 % | 2 avril 2026 | Auto-déclaré | |
| 6 | Gemma 4 26B-A4B | 🟢 Ouvert | 85,5 % | 2 avril 2026 | Auto-déclaré | |
| 7 | Gemini 3 Pro | 🔒 Propriétaire | 85,4 % | 18 novembre 2025 | Auto-déclaré | |
| 8 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,2 % | 24 février 2026 | Auto-déclaré |
| 9 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 80,3 % | 1 décembre 2025 | Auto-déclaré |
| 10 | DeepSeek-V3.2-Speciale | DeepSeek | 🟢 Ouvert | 80,3 % | 1 décembre 2025 | Auto-déclaré |
| 11 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 80,2 % | 1 décembre 2025 | Auto-déclaré |
| 12 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,9 % | 2 mars 2026 | Auto-déclaré |
| 13 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,5 % | 24 février 2026 | Auto-déclaré |
| 14 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,1 % | 2 mars 2026 | Auto-déclaré |
| 15 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,0 % | 24 février 2026 | Auto-déclaré |
| 16 | Qwen3 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 74,8 % | 15 décembre 2025 | Auto-déclaré |
| 17 | K-EXAONE-236B-A23B | LG AI Research | 🔒 Propriétaire | 73,2 % | 31 décembre 2025 | Auto-déclaré |
| 18 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 63,9 % | 5 août 2025 | Auto-déclaré |
| 19 | Gemma 4 E4B | 🟢 Ouvert | 57,5 % | 2 avril 2026 | Auto-déclaré | |
| 20 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 56,2 % | 10 juin 2026 | Auto-déclaré | |
| 21 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 48,8 % | 2 mars 2026 | Auto-déclaré |
| 22 | Gemma 4 E2B | 🟢 Ouvert | 29,4 % | 2 avril 2026 | Auto-déclaré | |
| 23 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 11,6 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 23 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 79,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle réussit régulièrement les tâches en choisissant et en enchaînant correctement les outils, tout en tenant compte des modifications apportées par l’utilisateur simulé. La métrique pass^k repose sur la récompense et la vérification des actions, ce qui ancre l’évaluation dans l’exécution effective. La prudence reste toutefois nécessaire, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. Avec une médiane de 80 % sur 23 modèles et un meilleur résultat de 99 % pour Gemini 3.1 Pro Preview, le classement montre un niveau globalement élevé et une forte proximité avec le plafond pour le modèle de tête. Cette situation peut réduire le pouvoir discriminant du benchmark au sommet du classement. Sa portée demeure ciblée sur des tâches conversationnelles en anglais, fondées sur l’usage d’outils dans un environnement partagé. Les résultats caractérisent donc cette forme précise d’interaction agentique, plutôt qu’une compétence générale couvrant tous les contextes d’usage des modèles.
Sources des scores : llm-stats.