Agentic Coding
LiveBench: Agentic Coding est une catégorie de LiveBench ajoutée en 2025 par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle évalue le codage agentique au moyen de tâches réalisées sur plusieurs tours dans un…
LiveBench: Agentic Coding est une catégorie de LiveBench ajoutée en 2025 par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle évalue le codage agentique au moyen de tâches réalisées sur plusieurs tours dans un environnement de développement.
Le benchmark mesure la capacité d’un agent autonome à progresser dans ce cadre et à produire des résultats conformes à une vérité-terrain objective. Sa notation automatique, sans juge LLM, permet de comparer les performances opérationnelles des modèles sur plusieurs tâches de développement.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Abacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench) |
| Capacités mesurées | Codage agentique : capacite d'un agent de developpement autonome a operer sur plusieurs tours dans un environnement de developpement |
| Modalité | Texte |
| Type de questions | Taches de codage agentique multi-tours en environnement de developpement |
| Métrique d'évaluation | Scoring automatique sur verite-terrain objective et verifiable, sans juge LLM |
| Accès | Public |
| Licence | Apache-2.0 (depot avec composants sous MIT) |
| Langues | anglais |
| Taille du jeu | 40-100 questions par tache (plusieurs taches par categorie) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 50,3 % | 11 décembre 2025 | ✅ Mesuré |
| 2 | Kimi K2.6 Thinking | Moonshot AI | ▫ n.d. | 46,9 % | — | ✅ Mesuré |
| 3 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 45,8 % | 20 mai 2026 | ✅ Mesuré |
| 4 | Gemini 3.1 Pro Preview | ▫ n.d. | 45,4 % | 19 février 2026 | ✅ Mesuré | |
| 5 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 42,6 % | 24 avril 2026 | ✅ Mesuré |
| 6 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 39,7 % | 24 novembre 2025 | ✅ Mesuré |
| 7 | DeepSeek V4 Flash | DeepSeek | ▫ n.d. | 37,6 % | 24 avril 2026 | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 45,4 %.
Notre analyse
Un score élevé indique qu’un agent réussit une plus grande part des tâches multi-tours selon des critères objectifs et vérifiables. La méthode de notation automatique réduit la subjectivité associée à un juge LLM. La fiabilité pratique du classement doit néanmoins être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment dans un cadre unique.
Avec une médiane de 46 % parmi les 26 modèles évalués et un meilleur résultat de 56 % pour Claude Opus 4.8, le classement montre un avantage limité du premier modèle sur le centre de la distribution et ne suggère pas une saturation des résultats. La portée reste ciblée sur le codage agentique en anglais, dans un environnement de développement multi-tours. Le caractère public du benchmark constitue aussi un point d’attention pour la contamination potentielle des évaluations, en particulier lorsque les résultats sont déclarés par les éditeurs. Le classement renseigne donc sur l’efficacité dans ce cadre précis, sans étendre directement cette mesure à d’autres capacités.
Sources des scores : livebench.