Terminal-Bench 2.0
Terminal-Bench 2.0 est un benchmark créé par l’équipe Terminal-Bench du Laude Institute et de Stanford University. Il évalue la capacité d’agents d’intelligence artificielle à utiliser de manière autonome une interface en ligne de commande pour accomplir des tâches réalistes de bout en…
Terminal-Bench 2.0 est un benchmark créé par l’équipe Terminal-Bench du Laude Institute et de Stanford University. Il évalue la capacité d’agents d’intelligence artificielle à utiliser de manière autonome une interface en ligne de commande pour accomplir des tâches réalistes de bout en bout.
Les scénarios couvrent notamment la compilation de code, la configuration de serveurs, l’entraînement de modèles, l’administration système, la science des données et la cybersécurité. Le benchmark sert ainsi à comparer l’efficacité opérationnelle des modèles lorsqu’ils doivent mobiliser des outils dans des environnements Dockerisés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Laude Institute / Stanford University (équipe Terminal-Bench) |
| Capacités mesurées | Agents autonomes en interface terminal : tâches réalistes de bout en bout (compilation de code, configuration de serveurs, entraînement de modèles, usage d'outils). |
| Modalité | Texte |
| Type de questions | Tâches agentiques de bout en bout en terminal (ligne de commande) |
| Métrique d'évaluation | Taux de réussite des tâches (vérification par tests pytest) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | Anglais (+ environnements de code Dockerisés) |
| Taille du jeu | 89 tâches (Terminal-Bench 2.0) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (49)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 82,7 % | 23 avril 2026 | Auto-déclaré |
| 2 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 82,0 % | — | Auto-déclaré |
| 3 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 80,4 % | 30 juin 2026 | Auto-déclaré |
| 4 | GPT-5.3 Codex | OpenAI | 🔒 Propriétaire | 77,3 % | 5 février 2026 | Auto-déclaré |
| 5 | Gemini 3.5 Flash | 🔒 Propriétaire | 76,2 % | 19 mai 2026 | Auto-déclaré | |
| 6 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 75,1 % | 5 mars 2026 | Auto-déclaré |
| 7 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 74,6 % | 28 mai 2026 | Auto-déclaré |
| 8 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 70,3 % | 31 mai 2026 | Auto-déclaré |
| 9 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 69,7 % | 19 mai 2026 | Auto-déclaré |
| 10 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 69,4 % | 16 avril 2026 | Auto-déclaré |
| 11 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 69,0 % | 7 avril 2026 | Auto-déclaré |
| 12 | Gemini 3.1 Pro Preview | ▫ n.d. | 68,5 % | 19 février 2026 | Auto-déclaré | |
| 13 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 68,4 % | 27 avril 2026 | Auto-déclaré |
| 14 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 67,9 % | 23 avril 2026 | Auto-déclaré |
| 15 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 66,7 % | 20 avril 2026 | Auto-déclaré |
| 16 | MiMo-V2.5 | Xiaomi | 🟢 Ouvert | 65,8 % | 22 avril 2026 | Auto-déclaré |
| 17 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 65,4 % | 5 février 2026 | Auto-déclaré |
| 18 | GPT-5.2 Codex | OpenAI | 🔒 Propriétaire | 64,0 % | 14 janvier 2026 | Auto-déclaré |
| 19 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 61,6 % | 31 mars 2026 | Auto-déclaré |
| 20 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 60,0 % | 17 mars 2026 | Auto-déclaré |
| 21 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 59,3 % | 24 novembre 2025 | Auto-déclaré |
| 22 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,3 % | 21 avril 2026 | Auto-déclaré |
| 23 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 59,1 % | 17 février 2026 | Auto-déclaré |
| 24 | Muse Spark | Meta | 🔒 Propriétaire | 59,0 % | 8 avril 2026 | Auto-déclaré |
| 25 | MiMo-V2-Pro | Xiaomi | 🔒 Propriétaire | 57,1 % | 18 mars 2026 | Auto-déclaré |
| 26 | MiniMax M2.7 | MiniMax | 🟢 Ouvert | 57,0 % | 18 mars 2026 | Auto-déclaré |
| 27 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 56,9 % | 23 avril 2026 | Auto-déclaré |
| 28 | GLM-5 | Zhipu AI | 🟢 Ouvert | 56,2 % | 11 février 2026 | Auto-déclaré |
| 29 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 54,8 % | 2 juin 2026 | Auto-déclaré |
| 30 | Gemini 3 Pro | 🔒 Propriétaire | 54,2 % | 18 novembre 2025 | Auto-déclaré | |
| 31 | GPT-5.1 Codex | OpenAI | 🔒 Propriétaire | 52,8 % | 19 novembre 2025 | Auto-déclaré |
| 32 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,5 % | 16 février 2026 | Auto-déclaré |
| 33 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,5 % | 16 avril 2026 | Auto-déclaré |
| 34 | Step-3.5-Flash | StepFun | 🟢 Ouvert | 51,0 % | 2 février 2026 | Auto-déclaré |
| 35 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 50,8 % | 27 janvier 2026 | Auto-déclaré |
| 36 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,4 % | 24 février 2026 | Auto-déclaré |
| 37 | Gemini 3 Flash | 🔒 Propriétaire | 47,6 % | 17 décembre 2025 | Auto-déclaré | |
| 38 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 46,4 % | 1 décembre 2025 | Auto-déclaré |
| 39 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 46,4 % | 1 décembre 2025 | Auto-déclaré |
| 40 | DeepSeek-V3.2-Speciale | DeepSeek | 🟢 Ouvert | 46,4 % | 1 décembre 2025 | Auto-déclaré |
| 41 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 46,3 % | 17 mars 2026 | Auto-déclaré |
| 42 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 46,0 % | 2 juin 2026 | Auto-déclaré |
| 43 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 41,6 % | 24 février 2026 | Auto-déclaré |
| 44 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 41,0 % | 22 décembre 2025 | Auto-déclaré |
| 45 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 40,5 % | 24 février 2026 | Auto-déclaré |
| 46 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 38,5 % | 16 décembre 2025 | Auto-déclaré |
| 47 | Qwen3-Coder 480B A35B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 37,5 % | 31 janvier 2025 | Auto-déclaré |
| 48 | North Mini Code 1.0 | Cohere | 🟢 Ouvert | 36,0 % | 9 juin 2026 | Auto-déclaré |
| 49 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 31,0 % | 11 mars 2026 | Auto-déclaré |
Classement établi sur 49 modèles évalués, dont 27 de grands éditeurs. Score médian de l'ensemble : 57,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent mène à bien une forte proportion de tâches complètes en terminal, depuis l’interprétation de l’objectif jusqu’à l’exécution des commandes et à l’obtention d’un résultat conforme. La réussite est vérifiée par des tests pytest, ce qui fournit un critère mesurable au niveau de chaque tâche. La fiabilité comparative doit néanmoins être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole de mesure centralisé.
Le classement fait apparaître un écart notable entre la médiane de l’ensemble, à 57 %, et GPT-5.5, premier à 83 %. Cette avance traduit une meilleure réussite sur ce corpus, sans équivaloir à une maîtrise générale de l’usage informatique. La portée reste celle des 89 tâches retenues, de leurs environnements Dockerisés et des domaines couverts. Le meilleur résultat demeure inférieur à une réussite totale, ce qui ne signale pas une saturation complète du benchmark. Comme l’évaluation porte sur un jeu public, le classement décrit avant tout les performances obtenues sur Terminal-Bench 2.0.
Sources des scores : llm-stats.