Terminal-Bench 2.0

Terminal-Bench 2.0 est un benchmark créé par l’équipe Terminal-Bench du Laude Institute et de Stanford University. Il évalue la capacité d’agents d’intelligence artificielle à utiliser de manière autonome une interface en ligne de commande pour accomplir des tâches réalistes de bout en…

Terminal-Bench 2.0 est un benchmark créé par l’équipe Terminal-Bench du Laude Institute et de Stanford University. Il évalue la capacité d’agents d’intelligence artificielle à utiliser de manière autonome une interface en ligne de commande pour accomplir des tâches réalistes de bout en bout.

Les scénarios couvrent notamment la compilation de code, la configuration de serveurs, l’entraînement de modèles, l’administration système, la science des données et la cybersécurité. Le benchmark sert ainsi à comparer l’efficacité opérationnelle des modèles lorsqu’ils doivent mobiliser des outils dans des environnements Dockerisés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkLaude Institute / Stanford University (équipe Terminal-Bench)
Capacités mesuréesAgents autonomes en interface terminal : tâches réalistes de bout en bout (compilation de code, configuration de serveurs, entraînement de modèles, usage d'outils).
ModalitéTexte
Type de questionsTâches agentiques de bout en bout en terminal (ligne de commande)
Métrique d'évaluationTaux de réussite des tâches (vérification par tests pytest)
AccèsPublic
LicenceApache-2.0
LanguesAnglais (+ environnements de code Dockerisés)
Taille du jeu89 tâches (Terminal-Bench 2.0)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (49)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.5OpenAI🔒 Propriétaire82,7 %23 avril 2026Auto-déclaré
2Claude Mythos PreviewAnthropic🔒 Propriétaire82,0 %Auto-déclaré
3Claude Sonnet 5Anthropic🔒 Propriétaire80,4 %30 juin 2026Auto-déclaré
4GPT-5.3 CodexOpenAI🔒 Propriétaire77,3 %5 février 2026Auto-déclaré
5Gemini 3.5 FlashGoogle🔒 Propriétaire76,2 %19 mai 2026Auto-déclaré
6GPT-4.5OpenAI🔒 Propriétaire75,1 %5 mars 2026Auto-déclaré
7Claude Opus 4.8Anthropic🔒 Propriétaire74,6 %28 mai 2026Auto-déclaré
8Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire70,3 %31 mai 2026Auto-déclaré
9Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire69,7 %19 mai 2026Auto-déclaré
10Claude Opus 4.7Anthropic🔒 Propriétaire69,4 %16 avril 2026Auto-déclaré
11GLM-5.1Zhipu AI🟢 Ouvert69,0 %7 avril 2026Auto-déclaré
12Gemini 3.1 Pro PreviewGoogle▫ n.d.68,5 %19 février 2026Auto-déclaré
13MiMo-V2.5-ProXiaomi🟢 Ouvert68,4 %27 avril 2026Auto-déclaré
14DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert67,9 %23 avril 2026Auto-déclaré
15Kimi K2.6Moonshot AI🟢 Ouvert66,7 %20 avril 2026Auto-déclaré
16MiMo-V2.5Xiaomi🟢 Ouvert65,8 %22 avril 2026Auto-déclaré
17Claude Opus 4.6Anthropic🔒 Propriétaire65,4 %5 février 2026Auto-déclaré
18GPT-5.2 CodexOpenAI🔒 Propriétaire64,0 %14 janvier 2026Auto-déclaré
19Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire61,6 %31 mars 2026Auto-déclaré
20GPT-5.4 miniOpenAI🔒 Propriétaire60,0 %17 mars 2026Auto-déclaré
21Claude Opus 4.5Anthropic🔒 Propriétaire59,3 %24 novembre 2025Auto-déclaré
22Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert59,3 %21 avril 2026Auto-déclaré
23Claude Sonnet 4.6Anthropic🔒 Propriétaire59,1 %17 février 2026Auto-déclaré
24Muse SparkMeta🔒 Propriétaire59,0 %8 avril 2026Auto-déclaré
25MiMo-V2-ProXiaomi🔒 Propriétaire57,1 %18 mars 2026Auto-déclaré
26MiniMax M2.7MiniMax🟢 Ouvert57,0 %18 mars 2026Auto-déclaré
27DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert56,9 %23 avril 2026Auto-déclaré
28GLM-5Zhipu AI🟢 Ouvert56,2 %11 février 2026Auto-déclaré
29MAI-Code-1-FlashMicrosoft🔒 Propriétaire54,8 %2 juin 2026Auto-déclaré
30Gemini 3 ProGoogle🔒 Propriétaire54,2 %18 novembre 2025Auto-déclaré
31GPT-5.1 CodexOpenAI🔒 Propriétaire52,8 %19 novembre 2025Auto-déclaré
32Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert52,5 %16 février 2026Auto-déclaré
33Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert51,5 %16 avril 2026Auto-déclaré
34Step-3.5-FlashStepFun🟢 Ouvert51,0 %2 février 2026Auto-déclaré
35Kimi K2.5Moonshot AI🟢 Ouvert50,8 %27 janvier 2026Auto-déclaré
36Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert49,4 %24 février 2026Auto-déclaré
37Gemini 3 FlashGoogle🔒 Propriétaire47,6 %17 décembre 2025Auto-déclaré
38DeepSeek-V3.2DeepSeek🟢 Ouvert46,4 %1 décembre 2025Auto-déclaré
39DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert46,4 %1 décembre 2025Auto-déclaré
40DeepSeek-V3.2-SpecialeDeepSeek🟢 Ouvert46,4 %1 décembre 2025Auto-déclaré
41GPT-5.4 nanoOpenAI🔒 Propriétaire46,3 %17 mars 2026Auto-déclaré
42MAI-Thinking-1Microsoft🔒 Propriétaire46,0 %2 juin 2026Auto-déclaré
43Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert41,6 %24 février 2026Auto-déclaré
44GLM-4.7Zhipu AI🟢 Ouvert41,0 %22 décembre 2025Auto-déclaré
45Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert40,5 %24 février 2026Auto-déclaré
46MiMo-V2-FlashXiaomi🟢 Ouvert38,5 %16 décembre 2025Auto-déclaré
47Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team🟢 Ouvert37,5 %31 janvier 2025Auto-déclaré
48North Mini Code 1.0Cohere🟢 Ouvert36,0 %9 juin 2026Auto-déclaré
49Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert31,0 %11 mars 2026Auto-déclaré

Classement établi sur 49 modèles évalués, dont 27 de grands éditeurs. Score médian de l'ensemble : 57,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent mène à bien une forte proportion de tâches complètes en terminal, depuis l’interprétation de l’objectif jusqu’à l’exécution des commandes et à l’obtention d’un résultat conforme. La réussite est vérifiée par des tests pytest, ce qui fournit un critère mesurable au niveau de chaque tâche. La fiabilité comparative doit néanmoins être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole de mesure centralisé.

Le classement fait apparaître un écart notable entre la médiane de l’ensemble, à 57 %, et GPT-5.5, premier à 83 %. Cette avance traduit une meilleure réussite sur ce corpus, sans équivaloir à une maîtrise générale de l’usage informatique. La portée reste celle des 89 tâches retenues, de leurs environnements Dockerisés et des domaines couverts. Le meilleur résultat demeure inférieur à une réussite totale, ce qui ne signale pas une saturation complète du benchmark. Comme l’évaluation porte sur un jeu public, le classement décrit avant tout les performances obtenues sur Terminal-Bench 2.0.


Sources des scores : llm-stats.