LiveCodeBench Pro
LiveCodeBench Pro est un benchmark public conçu en 2025 par l’équipe LiveCodeBench Pro, dans le cadre d’une collaboration académique comprenant notamment Sanjeev Arora et Pramod Viswanath. Il évalue les grands modèles de langage spécialisés dans le code à partir de problèmes issus de…
LiveCodeBench Pro est un benchmark public conçu en 2025 par l’équipe LiveCodeBench Pro, dans le cadre d’une collaboration académique comprenant notamment Sanjeev Arora et Pramod Viswanath. Il évalue les grands modèles de langage spécialisés dans le code à partir de problèmes issus de concours de programmation.
Le benchmark mesure le raisonnement algorithmique et la capacité à produire une solution correcte dès la première tentative. Les annotations de médaillés d’olympiades et l’analyse fine des échecs permettent d’aller au-delà du résultat brut, tandis que le classement Elo situe les modèles relativement à leurs concurrents.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Équipe LiveCodeBench Pro (collaboration académique, dont Sanjeev Arora et Pramod Viswanath) |
| Capacités mesurées | Raisonnement algorithmique en programmation compétitive, avec annotations par des médaillés d'olympiades et analyse fine des échecs |
| Modalité | Texte |
| Type de questions | résolution de problèmes de programmation compétitive |
| Métrique d'évaluation | classement Elo (MAP bayésien, échelle Codeforces) et pass@1 |
| Accès | Public |
| Langues | anglais (énoncés) + code |
| Taille du jeu | 584 problèmes de concours (mis à jour en continu) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 2 886 | 19 février 2026 | Auto-déclaré | |
| 2 | Gemini 3 Pro | 🔒 Propriétaire | 2 439 | 18 novembre 2025 | Auto-déclaré | |
| 3 | Muse Spark | Meta | 🔒 Propriétaire | 2 400 | 8 avril 2026 | Auto-déclaré |
| 4 | Gemini 3 Flash | 🔒 Propriétaire | 2 316 | 17 décembre 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Ce benchmark n'étant pas exprimé en pourcentage, la barre prend le score du premier comme référence (100 %). « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique une forte aptitude à résoudre des problèmes de programmation compétitive, à mobiliser un raisonnement algorithmique adapté et à générer du code correct dès le premier essai. Le classement Elo, calculé par estimation bayésienne MAP sur l’échelle Codeforces, complète le pass@1 en donnant une lecture relative des performances. Dans la base considérée, Gemini 3.1 Pro Preview se détache nettement, tandis que le score médian élevé suggère un niveau global déjà important parmi les quatre modèles évalués. Cette concentration peut toutefois réduire la capacité de différenciation à mesure que les meilleurs résultats approchent du plafond. La rigueur méthodologique repose sur des problèmes de concours réels, des annotations expertes et une analyse détaillée des échecs. L’interprétation exige néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment. L’origine publique des problèmes, issus de LeetCode, AtCoder et CodeForces, crée aussi un risque d’exposition préalable. La mise à jour continue du corpus contribue à limiter cette contamination. Enfin, le benchmark couvre spécifiquement la programmation compétitive et ne résume pas l’ensemble des capacités d’un modèle de code.
Sources des scores : llm-stats.