Coding

LiveBench: Coding est la catégorie consacrée au code de LiveBench, créée par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle repose sur des problèmes récents issus de concours de programmation afin de limiter…

LiveBench: Coding est la catégorie consacrée au code de LiveBench, créée par l’équipe réunissant Abacus.AI, New York University, NVIDIA, University of Maryland et University of Southern California. Elle repose sur des problèmes récents issus de concours de programmation afin de limiter la contamination des évaluations.

Le benchmark mesure les capacités de génération et de complétion de code en anglais. Sa notation automatique s’appuie sur une vérité-terrain objective et vérifiable, sans juge LLM, ce qui permet de comparer les modèles sur des tâches de programmation aux résultats directement contrôlables.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAbacus.AI, New York University, NVIDIA, University of Maryland, University of Southern California (equipe LiveBench)
Capacités mesuréesGeneration et completion de code a partir de problemes de concours de programmation recents
ModalitéTexte
Type de questionsGeneration et completion de code (issues de concours de programmation recents)
Métrique d'évaluationScoring automatique sur verite-terrain objective et verifiable, sans juge LLM
AccèsPublic
LicenceApache-2.0 (depot avec composants sous MIT)
Languesanglais
Taille du jeu40-100 questions par tache (plusieurs taches par categorie)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 4.5Anthropic🔒 Propriétaire79,7 %24 novembre 2025✅ Mesuré
2Kimi K2.6 ThinkingMoonshot AI▫ n.d.78,6 %✅ Mesuré
3Gemini 3.1 Pro PreviewGoogle▫ n.d.76,5 %19 février 2026✅ Mesuré
4GPT-5.2OpenAI🔒 Propriétaire76,1 %11 décembre 2025✅ Mesuré
5DeepSeek V4 ProDeepSeek▫ n.d.70,0 %24 avril 2026✅ Mesuré
6DeepSeek V4 FlashDeepSeek▫ n.d.69,2 %24 avril 2026✅ Mesuré
7xAI: Grok Build 0.1xAI▫ n.d.65,4 %20 mai 2026✅ Mesuré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 76,1 %.

Notre analyse

Un score élevé sur LiveBench: Coding indique qu’un modèle réussit fréquemment les tâches de génération et de complétion de code proposées à partir de problèmes récents de concours. L’évaluation bénéficie d’un protocole rigoureux au niveau du benchmark, puisque la notation est automatique, fondée sur une vérité-terrain objective et ne dépend pas de l’appréciation d’un autre LLM. La lecture comparative demande néanmoins de la prudence, car les scores réunis dans la base sont majoritairement auto-déclarés par les éditeurs.

Le classement montre un niveau globalement élevé parmi les 26 modèles évalués, avec une médiane de 78 % et GPT-5.2 Codex en tête à 84 %. L’écart limité entre la médiane et le meilleur résultat peut signaler une différenciation réduite dans la partie haute du classement, voire un début de saturation. Le recours à des problèmes récents vise à limiter la contamination, sans constituer une garantie absolue. Enfin, la portée reste centrée sur le code de concours en anglais, et non sur l’ensemble des usages possibles de la programmation.


Sources des scores : livebench.