Terminal-Bench 2.1
Terminal-Bench 2.1 est un benchmark créé par le Laude Institute et Stanford University pour évaluer la capacité des agents IA à piloter un ordinateur depuis un terminal. Il repose sur des tâches réelles, complètes et exécutées de manière autonome en ligne de commande.