Terminal-Bench 2.1
Terminal-Bench 2.1 est un benchmark créé par le Laude Institute et Stanford University pour évaluer la capacité des agents IA à piloter un ordinateur depuis un terminal. Il repose sur des tâches réelles, complètes et exécutées de manière autonome en ligne de commande.
Terminal-Bench 2.1 est un benchmark créé par le Laude Institute et Stanford University pour évaluer la capacité des agents IA à piloter un ordinateur depuis un terminal. Il repose sur des tâches réelles, complètes et exécutées de manière autonome en ligne de commande.
Les scénarios couvrent notamment la compilation de code, l’entraînement de modèles, la configuration de serveurs, l’administration système, les workflows de data science, le débogage et la sécurité. Le benchmark sert ainsi à comparer les modèles sur leur aptitude à accomplir concrètement des opérations informatiques, au-delà de la simple production de réponses textuelles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Laude Institute & Stanford University |
| Capacités mesurées | Capacité des agents IA à opérer un ordinateur via le terminal sur des tâches réelles end-to-end (compiler du code, entraîner des modèles, configurer des serveurs, déboguer). |
| Modalité | Texte |
| Type de questions | Agents IA en terminal / tâches end-to-end en ligne de commande |
| Métrique d'évaluation | Taux de résolution de tâches (tâches vérifiées par tests) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais |
| Taille du jeu | 89 tâches (la 2.1 corrige 28 des 89 tâches de la 2.0) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 88,8 % | 9 juillet 2026 | Auto-déclaré |
| 2 | Kimi K3 | Moonshot AI | ▫ n.d. | 88,3 % | 16 juillet 2026 | Auto-déclaré |
| 3 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 87,4 % | 9 juillet 2026 | Auto-déclaré |
| 4 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 84,7 % | 9 juillet 2026 | Auto-déclaré |
| 5 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 84,3 % | 9 juin 2026 | Auto-déclaré |
| 6 | Grok 4.5 | xAI | 🔒 Propriétaire | 83,3 % | 16 juillet 2026 | Auto-déclaré |
| 7 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 82,7 % | 16 juin 2026 | Auto-déclaré |
| 8 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 80,0 % | 9 juillet 2026 | Auto-déclaré |
| 9 | Hy3 | Tencent | 🟢 Ouvert | 71,7 % | 6 juillet 2026 | Auto-déclaré |
| 10 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 71,0 % | 24 juin 2026 | Auto-déclaré |
| 11 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 67,6 % | 24 juin 2026 | Auto-déclaré |
| 12 | MiniMax M3 | MiniMax | 🟢 Ouvert | 66,0 % | 1 juin 2026 | Auto-déclaré |
| 13 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 56,4 % | 4 juin 2026 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 82,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent résout une grande proportion de tâches de bout en bout, avec une réussite validée par des tests. Il traduit donc une capacité à enchaîner correctement des actions dans un terminal et à obtenir le résultat attendu sur des scénarios variés. Le classement place Claude Fable 5 en tête à 84 %, devant un ensemble de six modèles dont le score médian atteint 69 %. Cet écart met en évidence une avance sur ce jeu, sans équivaloir à une maîtrise complète de toutes les tâches.
La validation par tests apporte un critère mesurable, mais la fiabilité comparative doit être nuancée puisque les scores sont majoritairement auto-déclarés par les éditeurs. La version 2.1 corrige 28 des 89 tâches de la version 2.0, ce qui souligne l’importance de la qualité des exercices dans l’interprétation des résultats. La saturation n’est pas atteinte par le meilleur score observé. L’accès public peut aussi exposer le benchmark à un risque de contamination. Enfin, sa portée reste centrée sur des tâches informatiques en anglais réalisées dans un terminal, et non sur l’ensemble des capacités d’un modèle.»
Sources des scores : llm-stats.