LiveCodeBench v5
LiveCodeBench v5 est un benchmark public conçu en 2025 par l’équipe LiveCodeBench, issue de l’UC Berkeley, du MIT et de Cornell, avec Naman Jain et ses collaborateurs. Il propose une évaluation globale des grands modèles de langage spécialisés dans le code.
LiveCodeBench v5 est un benchmark public conçu en 2025 par l’équipe LiveCodeBench, issue de l’UC Berkeley, du MIT et de Cornell, avec Naman Jain et ses collaborateurs. Il propose une évaluation globale des grands modèles de langage spécialisés dans le code.
À partir de problèmes récents de programmation compétitive, il examine la génération et l’auto-réparation de code, son exécution ainsi que la prédiction de sorties de tests. La collecte continue et la datation des problèmes visent à évaluer les modèles sur des exercices postérieurs à leur période d’entraînement.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | LiveCodeBench (UC Berkeley, MIT, Cornell - Naman Jain et al.) |
| Capacités mesurées | Evaluation holistique et sans contamination du code : generation, auto-reparation, execution de code et prediction de sortie de tests |
| Modalité | Texte |
| Type de questions | Problemes de programmation competitive (generation de code, auto-reparation, prediction de sortie de tests, execution de code) |
| Métrique d'évaluation | pass@1 |
| Accès | Public |
| Langues | Anglais (enonces), code Python |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 2.5 Pro | 🔒 Propriétaire | 75,6 % | 20 mai 2025 | Auto-déclaré | |
| 2 | Gemini 2.5 Flash | 🔒 Propriétaire | 63,9 % | 20 mai 2025 | Auto-déclaré | |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,4 % | 22 septembre 2025 | Auto-déclaré |
| 4 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 60,5 % | 11 février 2026 | Auto-déclaré |
| 5 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 28,9 % | 5 février 2025 | Auto-déclaré | |
| 6 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 25,7 % | 26 juin 2025 | Auto-déclaré | |
| 7 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 25,7 % | 20 mai 2025 | Auto-déclaré | |
| 8 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 18,6 % | 26 juin 2025 | Auto-déclaré | |
| 9 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 18,6 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 28,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score pass@1 élevé traduit une capacité à produire dès la première tentative une réponse correcte aux tâches couvertes, qu’il s’agisse de générer ou réparer du code Python, d’en prévoir l’exécution ou de déterminer la sortie de tests. La collecte continue de problèmes issus de LeetCode, AtCoder et CodeForces, associée à leurs dates de publication, renforce la rigueur de l’évaluation en permettant de sélectionner des exercices apparus après la date de coupure d’entraînement d’un modèle. La fiabilité comparative reste toutefois à interpréter avec prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que produits selon une mesure indépendante unique. La portée demeure centrée sur des énoncés en anglais et sur la programmation compétitive en Python. Dans la base, l’écart entre la médiane de 29 % et les 76 % de Gemini 2.5 Pro révèle une forte dispersion entre les neuf modèles évalués. Le meilleur résultat restant inférieur à un score parfait, cet ensemble ne présente pas de saturation complète.
Sources des scores : llm-stats.