Terminal-Bench

Terminal-Bench est un benchmark conçu par Stanford University, le Laude Institute et sa communauté pour éprouver des agents d’IA dans de véritables environnements de terminal isolés. Il repose sur des tâches complètes, élaborées et vérifiées par des humains.

Terminal-Bench est un benchmark conçu par Stanford University, le Laude Institute et sa communauté pour éprouver des agents d’IA dans de véritables environnements de terminal isolés. Il repose sur des tâches complètes, élaborées et vérifiées par des humains.

Les agents doivent agir de manière autonome pour compiler du code, entraîner des modèles, configurer des serveurs, administrer des systèmes ou résoudre des problèmes de débogage. Terminal-Bench évalue ainsi leur capacité à mener des workflows Linux et CLI concrets jusqu’à un résultat vérifiable.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkStanford University et Laude Institute (+ communauté Terminal-Bench)
Capacités mesuréesExécution autonome de tâches terminal réelles : compilation de code, entraînement de modèles, configuration de serveurs, administration système et débogage.
ModalitéTexte
Type de questionsTâches end-to-end en ligne de commande pour agents (environnements Docker isolés)
Métrique d'évaluationScripts de test de vérification par tâche (réussite/échec), taux de succès
AccèsPublic
LicenceApache-2.0
Languesanglais (+ environnements Linux/CLI)
Taille du jeu~100 tâches (Terminal-Bench-Core v0.1.x)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (25)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Sonnet 4.5Anthropic🔒 Propriétaire50,0 %29 septembre 2025Auto-déclaré
2MiniMax M2.1MiniMax🟢 Ouvert47,9 %23 décembre 2025Auto-déclaré
3Kimi K2 0905Moonshot AI🔒 Propriétaire47,1 %5 septembre 2025Auto-déclaré
4MiniMax M2MiniMax🟢 Ouvert46,3 %27 octobre 2025Auto-déclaré
5Claude Opus 4.1Anthropic🔒 Propriétaire43,3 %5 août 2025Auto-déclaré
6Nova 2 ProAmazon🔒 Propriétaire41,3 %2 décembre 2025Auto-déclaré
7Claude Haiku 4.5Anthropic🔒 Propriétaire41,0 %15 octobre 2025Auto-déclaré
8GLM-4.6Zhipu AI🟢 Ouvert40,5 %30 septembre 2025Auto-déclaré
9LongCat-Flash-ChatMeituan🟢 Ouvert39,5 %29 août 2025Auto-déclaré
10Claude Opus 4Anthropic🔒 Propriétaire39,2 %22 mai 2025Auto-déclaré
11DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert37,7 %29 septembre 2025Auto-déclaré
12GLM-4.5Zhipu AI🟢 Ouvert37,5 %28 juillet 2025Auto-déclaré
13Claude Sonnet 4Anthropic🔒 Propriétaire35,5 %22 mai 2025Auto-déclaré
14Claude 3.7 SonnetAnthropic🔒 Propriétaire35,2 %24 février 2025Auto-déclaré
15LongCat-Flash-LiteMeituan🟢 Ouvert33,8 %5 février 2026Auto-déclaré
16GLM-4.7Zhipu AI🟢 Ouvert33,3 %22 décembre 2025Auto-déclaré
17Nova 2 LiteAmazon🔒 Propriétaire32,5 %2 décembre 2025Auto-déclaré
18DeepSeek-V3.1DeepSeek🟢 Ouvert31,3 %10 janvier 2025Auto-déclaré
19MiMo-V2-FlashXiaomi🟢 Ouvert30,5 %16 décembre 2025Auto-déclaré
20GLM-4.5-AirZhipu AI🟢 Ouvert30,0 %28 juillet 2025Auto-déclaré
21Kimi K2 InstructMoonshot AI🟢 Ouvert30,0 %11 juillet 2025Auto-déclaré
22Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert25,8 %11 mars 2026Auto-déclaré
23Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert25,0 %5 septembre 2025Auto-déclaré
24Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert8,5 %15 décembre 2025Auto-déclaré
25DeepSeek-R1-0528DeepSeek🟢 Ouvert5,7 %28 mai 2025Auto-déclaré

Classement établi sur 25 modèles évalués, dont 13 de grands éditeurs. Score médian de l'ensemble : 35,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent réussit une plus grande part des tâches de bout en bout selon les scripts de vérification associés. Cette validation par réussite ou échec apporte un critère d’évaluation concret, centré sur le résultat obtenu dans un environnement Docker isolé. La comparaison doit néanmoins rester prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité du contrôle entre modèles. Avec un meilleur résultat de 50 % pour Claude Sonnet 4.5 et une médiane de 36 % sur 25 modèles, le classement montre que même le modèle de tête ne réussit que la moitié des tâches. Le benchmark ne paraît donc pas saturé à ce stade. Son accès public implique aussi un risque de contamination si les tâches sont intégrées aux données ou aux procédures d’optimisation. Enfin, sa portée reste spécialisée : il mesure l’autonomie dans des workflows Linux et CLI, plutôt que l’ensemble des capacités générales d’un modèle.


Sources des scores : llm-stats.