Agentic Coding

LiveBench: Agentic Coding est une catégorie de LiveBench ajoutée en 2025 par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle évalue le codage agentique au moyen de tâches réalisées sur plusieurs tours dans un…

LiveBench: Agentic Coding est une catégorie de LiveBench ajoutée en 2025 par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle évalue le codage agentique au moyen de tâches réalisées sur plusieurs tours dans un environnement de développement.

Le benchmark mesure la capacité d’un agent autonome à progresser dans ce cadre et à produire des résultats conformes à une vérité-terrain objective. Sa notation automatique, sans juge LLM, permet de comparer les performances opérationnelles des modèles sur plusieurs tâches de développement.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAbacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench)
Capacités mesuréesCodage agentique : capacite d'un agent de developpement autonome a operer sur plusieurs tours dans un environnement de developpement
ModalitéTexte
Type de questionsTaches de codage agentique multi-tours en environnement de developpement
Métrique d'évaluationScoring automatique sur verite-terrain objective et verifiable, sans juge LLM
AccèsPublic
LicenceApache-2.0 (depot avec composants sous MIT)
Languesanglais
Taille du jeu40-100 questions par tache (plusieurs taches par categorie)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.2OpenAI🔒 Propriétaire50,3 %11 décembre 2025✅ Mesuré
2Kimi K2.6 ThinkingMoonshot AI▫ n.d.46,9 %✅ Mesuré
3xAI: Grok Build 0.1xAI▫ n.d.45,8 %20 mai 2026✅ Mesuré
4Gemini 3.1 Pro PreviewGoogle▫ n.d.45,4 %19 février 2026✅ Mesuré
5DeepSeek V4 ProDeepSeek▫ n.d.42,6 %24 avril 2026✅ Mesuré
6Claude Opus 4.5Anthropic🔒 Propriétaire39,7 %24 novembre 2025✅ Mesuré
7DeepSeek V4 FlashDeepSeek▫ n.d.37,6 %24 avril 2026✅ Mesuré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 45,4 %.

Notre analyse

Un score élevé indique qu’un agent réussit une plus grande part des tâches multi-tours selon des critères objectifs et vérifiables. La méthode de notation automatique réduit la subjectivité associée à un juge LLM. La fiabilité pratique du classement doit néanmoins être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment dans un cadre unique.

Avec une médiane de 46 % parmi les 26 modèles évalués et un meilleur résultat de 56 % pour Claude Opus 4.8, le classement montre un avantage limité du premier modèle sur le centre de la distribution et ne suggère pas une saturation des résultats. La portée reste ciblée sur le codage agentique en anglais, dans un environnement de développement multi-tours. Le caractère public du benchmark constitue aussi un point d’attention pour la contamination potentielle des évaluations, en particulier lorsque les résultats sont déclarés par les éditeurs. Le classement renseigne donc sur l’efficacité dans ce cadre précis, sans étendre directement cette mesure à d’autres capacités.


Sources des scores : livebench.