Coding
LiveBench: Coding est la catégorie consacrée au code de LiveBench, créée par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle repose sur des problèmes récents issus de concours de programmation afin de limiter…
LiveBench: Coding est la catégorie consacrée au code de LiveBench, créée par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle repose sur des problèmes récents issus de concours de programmation afin de limiter la contamination des évaluations.
Le benchmark mesure les capacités de génération et de complétion de code en anglais. Sa notation automatique s’appuie sur une vérité-terrain objective et vérifiable, sans juge LLM, ce qui permet de comparer les modèles sur des tâches de programmation aux résultats directement contrôlables.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Abacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench) |
| Capacités mesurées | Generation et completion de code a partir de problemes de concours de programmation recents |
| Modalité | Texte |
| Type de questions | Generation et completion de code (issues de concours de programmation recents) |
| Métrique d'évaluation | Scoring automatique sur verite-terrain objective et verifiable, sans juge LLM |
| Accès | Public |
| Licence | Apache-2.0 (depot avec composants sous MIT) |
| Langues | anglais |
| Taille du jeu | 40-100 questions par tache (plusieurs taches par categorie) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 79,7 % | 24 novembre 2025 | ✅ Mesuré |
| 2 | Kimi K2.6 Thinking | Moonshot AI | ▫ n.d. | 78,6 % | — | ✅ Mesuré |
| 3 | Gemini 3.1 Pro Preview | ▫ n.d. | 76,5 % | 19 février 2026 | ✅ Mesuré | |
| 4 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 76,1 % | 11 décembre 2025 | ✅ Mesuré |
| 5 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 70,0 % | 24 avril 2026 | ✅ Mesuré |
| 6 | DeepSeek V4 Flash | DeepSeek | ▫ n.d. | 69,2 % | 24 avril 2026 | ✅ Mesuré |
| 7 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 65,4 % | 20 mai 2026 | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 76,1 %.
Notre analyse
Un score élevé sur LiveBench: Coding indique qu’un modèle réussit fréquemment les tâches de génération et de complétion de code proposées à partir de problèmes récents de concours. L’évaluation bénéficie d’un protocole rigoureux au niveau du benchmark, puisque la notation est automatique, fondée sur une vérité-terrain objective et ne dépend pas de l’appréciation d’un autre LLM. La lecture comparative demande néanmoins de la prudence, car les scores réunis dans la base sont majoritairement auto-déclarés par les éditeurs.
Le classement montre un niveau globalement élevé parmi les 26 modèles évalués, avec une médiane de 78 % et GPT-5.2 Codex en tête à 84 %. L’écart limité entre la médiane et le meilleur résultat peut signaler une différenciation réduite dans la partie haute du classement, voire un début de saturation. Le recours à des problèmes récents vise à limiter la contamination, sans constituer une garantie absolue. Enfin, la portée reste centrée sur le code de concours en anglais, et non sur l’ensemble des usages possibles de la programmation.
Sources des scores : livebench.