Terminal-Bench 2.1

Terminal-Bench 2.1 est un benchmark créé par le Laude Institute et Stanford University pour évaluer la capacité des agents IA à piloter un ordinateur depuis un terminal. Il repose sur des tâches réelles, complètes et exécutées de manière autonome en ligne de commande.

Terminal-Bench 2.1 est un benchmark créé par le Laude Institute et Stanford University pour évaluer la capacité des agents IA à piloter un ordinateur depuis un terminal. Il repose sur des tâches réelles, complètes et exécutées de manière autonome en ligne de commande.

Les scénarios couvrent notamment la compilation de code, l’entraînement de modèles, la configuration de serveurs, l’administration système, les workflows de data science, le débogage et la sécurité. Le benchmark sert ainsi à comparer les modèles sur leur aptitude à accomplir concrètement des opérations informatiques, au-delà de la simple production de réponses textuelles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkLaude Institute & Stanford University
Capacités mesuréesCapacité des agents IA à opérer un ordinateur via le terminal sur des tâches réelles end-to-end (compiler du code, entraîner des modèles, configurer des serveurs, déboguer).
ModalitéTexte
Type de questionsAgents IA en terminal / tâches end-to-end en ligne de commande
Métrique d'évaluationTaux de résolution de tâches (tâches vérifiées par tests)
AccèsPublic
LicenceApache-2.0
Languesanglais
Taille du jeu89 tâches (la 2.1 corrige 28 des 89 tâches de la 2.0)
Année de publication2026
RessourcesSite / dépôt officiel

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire88,8 %9 juillet 2026Auto-déclaré
2Kimi K3Moonshot AI▫ n.d.88,3 %16 juillet 2026Auto-déclaré
3GPT-5.6 TerraOpenAI🔒 Propriétaire87,4 %9 juillet 2026Auto-déclaré
4GPT-5.6 LunaOpenAI🔒 Propriétaire84,7 %9 juillet 2026Auto-déclaré
5Claude Fable 5Anthropic🔒 Propriétaire84,3 %9 juin 2026Auto-déclaré
6Grok 4.5xAI🔒 Propriétaire83,3 %16 juillet 2026Auto-déclaré
7GLM-5.2Zhipu AI🟢 Ouvert82,7 %16 juin 2026Auto-déclaré
8Muse Spark 1.1Meta🔒 Propriétaire80,0 %9 juillet 2026Auto-déclaré
9Hy3Tencent🟢 Ouvert71,7 %6 juillet 2026Auto-déclaré
10Seed 2.1 ProByteDance🔒 Propriétaire71,0 %24 juin 2026Auto-déclaré
11Seed 2.1 TurboByteDance🔒 Propriétaire67,6 %24 juin 2026Auto-déclaré
12MiniMax M3MiniMax🟢 Ouvert66,0 %1 juin 2026Auto-déclaré
13Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert56,4 %4 juin 2026Auto-déclaré

Classement établi sur 13 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 82,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent résout une grande proportion de tâches de bout en bout, avec une réussite validée par des tests. Il traduit donc une capacité à enchaîner correctement des actions dans un terminal et à obtenir le résultat attendu sur des scénarios variés. Le classement place Claude Fable 5 en tête à 84 %, devant un ensemble de six modèles dont le score médian atteint 69 %. Cet écart met en évidence une avance sur ce jeu, sans équivaloir à une maîtrise complète de toutes les tâches.

La validation par tests apporte un critère mesurable, mais la fiabilité comparative doit être nuancée puisque les scores sont majoritairement auto-déclarés par les éditeurs. La version 2.1 corrige 28 des 89 tâches de la version 2.0, ce qui souligne l’importance de la qualité des exercices dans l’interprétation des résultats. La saturation n’est pas atteinte par le meilleur score observé. L’accès public peut aussi exposer le benchmark à un risque de contamination. Enfin, sa portée reste centrée sur des tâches informatiques en anglais réalisées dans un terminal, et non sur l’ensemble des capacités d’un modèle.»


Sources des scores : llm-stats.