Terminal-Bench
Terminal-Bench est un benchmark conçu par Stanford University, le Laude Institute et sa communauté pour éprouver des agents d’IA dans de véritables environnements de terminal isolés. Il repose sur des tâches complètes, élaborées et vérifiées par des humains.
Terminal-Bench est un benchmark conçu par Stanford University, le Laude Institute et sa communauté pour éprouver des agents d’IA dans de véritables environnements de terminal isolés. Il repose sur des tâches complètes, élaborées et vérifiées par des humains.
Les agents doivent agir de manière autonome pour compiler du code, entraîner des modèles, configurer des serveurs, administrer des systèmes ou résoudre des problèmes de débogage. Terminal-Bench évalue ainsi leur capacité à mener des workflows Linux et CLI concrets jusqu’à un résultat vérifiable.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Stanford University et Laude Institute (+ communauté Terminal-Bench) |
| Capacités mesurées | Exécution autonome de tâches terminal réelles : compilation de code, entraînement de modèles, configuration de serveurs, administration système et débogage. |
| Modalité | Texte |
| Type de questions | Tâches end-to-end en ligne de commande pour agents (environnements Docker isolés) |
| Métrique d'évaluation | Scripts de test de vérification par tâche (réussite/échec), taux de succès |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais (+ environnements Linux/CLI) |
| Taille du jeu | ~100 tâches (Terminal-Bench-Core v0.1.x) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (25)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 50,0 % | 29 septembre 2025 | Auto-déclaré |
| 2 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 47,9 % | 23 décembre 2025 | Auto-déclaré |
| 3 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 47,1 % | 5 septembre 2025 | Auto-déclaré |
| 4 | MiniMax M2 | MiniMax | 🟢 Ouvert | 46,3 % | 27 octobre 2025 | Auto-déclaré |
| 5 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 43,3 % | 5 août 2025 | Auto-déclaré |
| 6 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 41,3 % | 2 décembre 2025 | Auto-déclaré |
| 7 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 41,0 % | 15 octobre 2025 | Auto-déclaré |
| 8 | GLM-4.6 | Zhipu AI | 🟢 Ouvert | 40,5 % | 30 septembre 2025 | Auto-déclaré |
| 9 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 39,5 % | 29 août 2025 | Auto-déclaré |
| 10 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 39,2 % | 22 mai 2025 | Auto-déclaré |
| 11 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 37,7 % | 29 septembre 2025 | Auto-déclaré |
| 12 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 37,5 % | 28 juillet 2025 | Auto-déclaré |
| 13 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 35,5 % | 22 mai 2025 | Auto-déclaré |
| 14 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 35,2 % | 24 février 2025 | Auto-déclaré |
| 15 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 33,8 % | 5 février 2026 | Auto-déclaré |
| 16 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 33,3 % | 22 décembre 2025 | Auto-déclaré |
| 17 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 32,5 % | 2 décembre 2025 | Auto-déclaré |
| 18 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 31,3 % | 10 janvier 2025 | Auto-déclaré |
| 19 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 30,5 % | 16 décembre 2025 | Auto-déclaré |
| 20 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 30,0 % | 28 juillet 2025 | Auto-déclaré |
| 21 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 30,0 % | 11 juillet 2025 | Auto-déclaré |
| 22 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 25,8 % | 11 mars 2026 | Auto-déclaré |
| 23 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 25,0 % | 5 septembre 2025 | Auto-déclaré |
| 24 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 8,5 % | 15 décembre 2025 | Auto-déclaré |
| 25 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 5,7 % | 28 mai 2025 | Auto-déclaré |
Classement établi sur 25 modèles évalués, dont 13 de grands éditeurs. Score médian de l'ensemble : 35,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent réussit une plus grande part des tâches de bout en bout selon les scripts de vérification associés. Cette validation par réussite ou échec apporte un critère d’évaluation concret, centré sur le résultat obtenu dans un environnement Docker isolé. La comparaison doit néanmoins rester prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité du contrôle entre modèles. Avec un meilleur résultat de 50 % pour Claude Sonnet 4.5 et une médiane de 36 % sur 25 modèles, le classement montre que même le modèle de tête ne réussit que la moitié des tâches. Le benchmark ne paraît donc pas saturé à ce stade. Son accès public implique aussi un risque de contamination si les tâches sont intégrées aux données ou aux procédures d’optimisation. Enfin, sa portée reste spécialisée : il mesure l’autonomie dans des workflows Linux et CLI, plutôt que l’ensemble des capacités générales d’un modèle.
Sources des scores : llm-stats.