LiveCodeBench v5

LiveCodeBench v5 est un benchmark public conçu en 2025 par l’équipe LiveCodeBench, issue de l’UC Berkeley, du MIT et de Cornell, avec Naman Jain et ses collaborateurs. Il propose une évaluation globale des grands modèles de langage spécialisés dans le code.

LiveCodeBench v5 est un benchmark public conçu en 2025 par l’équipe LiveCodeBench, issue de l’UC Berkeley, du MIT et de Cornell, avec Naman Jain et ses collaborateurs. Il propose une évaluation globale des grands modèles de langage spécialisés dans le code.

À partir de problèmes récents de programmation compétitive, il examine la génération et l’auto-réparation de code, son exécution ainsi que la prédiction de sorties de tests. La collecte continue et la datation des problèmes visent à évaluer les modèles sur des exercices postérieurs à leur période d’entraînement.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkLiveCodeBench (UC Berkeley, MIT, Cornell - Naman Jain et al.)
Capacités mesuréesEvaluation holistique et sans contamination du code : generation, auto-reparation, execution de code et prediction de sortie de tests
ModalitéTexte
Type de questionsProblemes de programmation competitive (generation de code, auto-reparation, prediction de sortie de tests, execution de code)
Métrique d'évaluationpass@1
AccèsPublic
LanguesAnglais (enonces), code Python
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 2.5 ProGoogle🔒 Propriétaire75,6 %20 mai 2025Auto-déclaré
2Gemini 2.5 FlashGoogle🔒 Propriétaire63,9 %20 mai 2025Auto-déclaré
3Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert61,4 %22 septembre 2025Auto-déclaré
4MiniCPM-SALAOpenBMB🟢 Ouvert60,5 %11 février 2026Auto-déclaré
5Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire28,9 %5 février 2025Auto-déclaré
6Gemma 3n E4B InstructedGoogle🔒 Propriétaire25,7 %26 juin 2025Auto-déclaré
7Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert25,7 %20 mai 2025Auto-déclaré
8Gemma 3n E2B InstructedGoogle🔒 Propriétaire18,6 %26 juin 2025Auto-déclaré
9Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert18,6 %20 mai 2025Auto-déclaré

Classement établi sur 9 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 28,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score pass@1 élevé traduit une capacité à produire dès la première tentative une réponse correcte aux tâches couvertes, qu’il s’agisse de générer ou réparer du code Python, d’en prévoir l’exécution ou de déterminer la sortie de tests. La collecte continue de problèmes issus de LeetCode, AtCoder et CodeForces, associée à leurs dates de publication, renforce la rigueur de l’évaluation en permettant de sélectionner des exercices apparus après la date de coupure d’entraînement d’un modèle. La fiabilité comparative reste toutefois à interpréter avec prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que produits selon une mesure indépendante unique. La portée demeure centrée sur des énoncés en anglais et sur la programmation compétitive en Python. Dans la base, l’écart entre la médiane de 29 % et les 76 % de Gemini 2.5 Pro révèle une forte dispersion entre les neuf modèles évalués. Le meilleur résultat restant inférieur à un score parfait, cet ensemble ne présente pas de saturation complète.


Sources des scores : llm-stats.