LiveCodeBench Pro

LiveCodeBench Pro est un benchmark public conçu en 2025 par l’équipe LiveCodeBench Pro, dans le cadre d’une collaboration académique comprenant notamment Sanjeev Arora et Pramod Viswanath. Il évalue les grands modèles de langage spécialisés dans le code à partir de problèmes issus de…

LiveCodeBench Pro est un benchmark public conçu en 2025 par l’équipe LiveCodeBench Pro, dans le cadre d’une collaboration académique comprenant notamment Sanjeev Arora et Pramod Viswanath. Il évalue les grands modèles de langage spécialisés dans le code à partir de problèmes issus de concours de programmation.

Le benchmark mesure le raisonnement algorithmique et la capacité à produire une solution correcte dès la première tentative. Les annotations de médaillés d’olympiades et l’analyse fine des échecs permettent d’aller au-delà du résultat brut, tandis que le classement Elo situe les modèles relativement à leurs concurrents.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkÉquipe LiveCodeBench Pro (collaboration académique, dont Sanjeev Arora et Pramod Viswanath)
Capacités mesuréesRaisonnement algorithmique en programmation compétitive, avec annotations par des médaillés d'olympiades et analyse fine des échecs
ModalitéTexte
Type de questionsrésolution de problèmes de programmation compétitive
Métrique d'évaluationclassement Elo (MAP bayésien, échelle Codeforces) et pass@1
AccèsPublic
Languesanglais (énoncés) + code
Taille du jeu584 problèmes de concours (mis à jour en continu)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.2 88619 février 2026Auto-déclaré
2Gemini 3 ProGoogle🔒 Propriétaire2 43918 novembre 2025Auto-déclaré
3Muse SparkMeta🔒 Propriétaire2 4008 avril 2026Auto-déclaré
4Gemini 3 FlashGoogle🔒 Propriétaire2 31617 décembre 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Ce benchmark n'étant pas exprimé en pourcentage, la barre prend le score du premier comme référence (100 %). « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique une forte aptitude à résoudre des problèmes de programmation compétitive, à mobiliser un raisonnement algorithmique adapté et à générer du code correct dès le premier essai. Le classement Elo, calculé par estimation bayésienne MAP sur l’échelle Codeforces, complète le pass@1 en donnant une lecture relative des performances. Dans la base considérée, Gemini 3.1 Pro Preview se détache nettement, tandis que le score médian élevé suggère un niveau global déjà important parmi les quatre modèles évalués. Cette concentration peut toutefois réduire la capacité de différenciation à mesure que les meilleurs résultats approchent du plafond. La rigueur méthodologique repose sur des problèmes de concours réels, des annotations expertes et une analyse détaillée des échecs. L’interprétation exige néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment. L’origine publique des problèmes, issus de LeetCode, AtCoder et CodeForces, crée aussi un risque d’exposition préalable. La mise à jour continue du corpus contribue à limiter cette contamination. Enfin, le benchmark couvre spécifiquement la programmation compétitive et ne résume pas l’ensemble des capacités d’un modèle de code.


Sources des scores : llm-stats.