LiveCodeBench
Créé par Naman Jain et al. en 2024, LiveCodeBench est un benchmark évolutif consacré aux grands modèles de langage spécialisés dans le code. Il collecte en continu des problèmes récents issus de concours de programmation afin de limiter la contamination par les données d’entraînement.
Créé par Naman Jain et al. en 2024, LiveCodeBench est un benchmark évolutif consacré aux grands modèles de langage spécialisés dans le code. Il collecte en continu des problèmes récents issus de concours de programmation afin de limiter la contamination par les données d’entraînement.
Son évaluation couvre la génération et la réparation de code, le raisonnement sur son exécution et la prédiction de sorties de tests. Les dates de publication des problèmes permettent de cibler des exercices apparus après la date de clôture de l’entraînement d’un modèle.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Naman Jain et al. |
| Capacités mesurées | code, généraliste, raisonnement |
| Modalité | Texte |
| Type de questions | génération de code, réparation de code, exécution de code et prédiction de sortie de tests |
| Métrique d'évaluation | pass@1 / accuracy selon la tâche |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | évolutif ; plusieurs centaines de problèmes de programmation compétitive |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (72)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 93,5 % | 23 avril 2026 | Auto-déclaré |
| 2 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 91,6 % | 23 avril 2026 | Auto-déclaré |
| 3 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 83,3 % | 1 décembre 2025 | Auto-déclaré |
| 4 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 83,3 % | 1 décembre 2025 | Auto-déclaré |
| 5 | MiniMax M2 | MiniMax | 🟢 Ouvert | 83,0 % | 27 octobre 2025 | Auto-déclaré |
| 6 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 82,8 % | 14 janvier 2026 | Auto-déclaré |
| 7 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 81,2 % | 11 mars 2026 | Auto-déclaré |
| 8 | Grok-3 Mini | xAI | 🔒 Propriétaire | 80,4 % | 17 février 2025 | Auto-déclaré |
| 9 | Grok 4 Fast | xAI | 🔒 Propriétaire | 80,0 % | 28 août 2025 | Auto-déclaré |
| 10 | Grok-3 | xAI | 🔒 Propriétaire | 79,4 % | 17 février 2025 | Auto-déclaré |
| 11 | Grok-4 Heavy | xAI | 🔒 Propriétaire | 79,4 % | — | Auto-déclaré |
| 12 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 79,4 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Grok-4 | xAI | 🔒 Propriétaire | 79,0 % | 9 juillet 2025 | Auto-déclaré |
| 14 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 78,0 % | 23 décembre 2025 | Auto-déclaré |
| 15 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 74,6 % | 2 décembre 2025 | Auto-déclaré |
| 16 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 74,1 % | 29 septembre 2025 | Auto-déclaré |
| 17 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 73,3 % | 28 mai 2025 | Auto-déclaré |
| 18 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 72,9 % | 28 juillet 2025 | Auto-déclaré |
| 19 | Nemotron Nano 9B v2 | NVIDIA | 🟢 Ouvert | 71,1 % | 18 août 2025 | Auto-déclaré |
| 20 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 71,0 % | 2 décembre 2025 | Auto-déclaré |
| 21 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 70,7 % | 28 juillet 2025 | Auto-déclaré |
| 22 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,7 % | 29 avril 2025 | Auto-déclaré |
| 23 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 69,0 % | 5 juin 2025 | Auto-déclaré | |
| 24 | Mercury 2 | Inception | 🔒 Propriétaire | 67,0 % | 24 février 2026 | Auto-déclaré |
| 25 | Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 🟢 Ouvert | 66,3 % | 7 avril 2025 | Auto-déclaré |
| 26 | Qwen3 32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,7 % | 29 avril 2025 | Auto-déclaré |
| 27 | Ministral 3 (14B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 64,6 % | 4 décembre 2025 | Auto-déclaré |
| 28 | Mistral Small 4 | Mistral AI | 🟢 Ouvert | 63,6 % | 16 mars 2026 | Auto-déclaré |
| 29 | QwQ-32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,4 % | 5 mars 2025 | Auto-déclaré |
| 30 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,6 % | 29 avril 2025 | Auto-déclaré |
| 31 | MiniMax M1 | MiniMax | 🟢 Ouvert | 62,3 % | 17 juin 2025 | Auto-déclaré |
| 32 | Ministral 3 (8B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 61,6 % | 4 décembre 2025 | Auto-déclaré |
| 33 | DeepSeek R1 Distill Llama 70B | DeepSeek | 🟢 Ouvert | 57,5 % | 20 janvier 2025 | Auto-déclaré |
| 34 | DeepSeek R1 Distill Qwen 32B | DeepSeek | 🟢 Ouvert | 57,2 % | 20 janvier 2025 | Auto-déclaré |
| 35 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 56,4 % | 10 janvier 2025 | Auto-déclaré |
| 36 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,5 % | 19 septembre 2024 | Auto-déclaré |
| 37 | Min istral 3 (3B Reasoning 2512) | Mistral AI | 🟢 Ouvert | 54,8 % | 4 décembre 2025 | Auto-déclaré |
| 38 | Phi 4 Reasoning | Microsoft | 🟢 Ouvert | 53,8 % | 30 avril 2025 | Auto-déclaré |
| 39 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 53,7 % | 5 septembre 2025 | Auto-déclaré |
| 40 | DeepSeek R1 Distill Qwen 14B | DeepSeek | 🟢 Ouvert | 53,1 % | 20 janvier 2025 | Auto-déclaré |
| 41 | Phi 4 Reasoning Plus | Microsoft | 🟢 Ouvert | 53,1 % | 30 avril 2025 | Auto-déclaré |
| 42 | Magistral Small 2506 | Mistral AI | 🟢 Ouvert | 51,3 % | 10 juin 2025 | Auto-déclaré |
| 43 | Magistral Medium | Mistral AI | 🟢 Ouvert | 50,3 % | 10 juin 2025 | Auto-déclaré |
| 44 | DeepSeek R1 Zero | DeepSeek | 🟢 Ouvert | 50,0 % | 20 janvier 2025 | Auto-déclaré |
| 45 | QwQ-32B-Preview | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,0 % | 28 novembre 2024 | Auto-déclaré |
| 46 | DeepSeek-V3 0324 | DeepSeek | 🟢 Ouvert | 49,2 % | 25 mars 2025 | Auto-déclaré |
| 47 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 48,0 % | 29 août 2025 | Auto-déclaré |
| 48 | Llama 4 Maverick | Meta | 🟢 Ouvert | 43,4 % | 5 avril 2025 | Auto-déclaré |
| 49 | DeepSeek R1 Distill Llama 8B | DeepSeek | 🟢 Ouvert | 39,6 % | 20 janvier 2025 | Auto-déclaré |
| 50 | DeepSeek R1 Distill Qwen 7B | DeepSeek | 🟢 Ouvert | 37,6 % | 20 janvier 2025 | Auto-déclaré |
| 51 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 37,6 % | 25 décembre 2024 | Auto-déclaré |
| 52 | Gemini 2.0 Flash | 🔒 Propriétaire | 35,1 % | 21 janvier 2025 | Auto-déclaré | |
| 53 | Mistral Large 3 (675B Base) | Mistral AI | 🟢 Ouvert | 34,4 % | 4 décembre 2025 | Auto-déclaré |
| 54 | Mistral Large 3 (675B Instruct 2512 Eagle) | Mistral AI | 🟢 Ouvert | 34,4 % | 4 décembre 2025 | Auto-déclaré |
| 55 | Mistral Large 3 (675B Instruct 2512 NVFP4) | Mistral AI | 🟢 Ouvert | 34,4 % | 4 décembre 2025 | Auto-déclaré |
| 56 | Mistral Large 3 (675B Instruct 2512) | Mistral AI | 🟢 Ouvert | 34,4 % | 4 décembre 2025 | Auto-déclaré |
| 57 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 33,7 % | 17 juin 2025 | Auto-déclaré | |
| 58 | Llama 4 Scout | Meta | 🟢 Ouvert | 32,8 % | 5 avril 2025 | Auto-déclaré |
| 59 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 31,4 % | 19 septembre 2024 | Auto-déclaré |
| 60 | Gemini Diffusion | 🔒 Propriétaire | 30,9 % | 20 mai 2025 | Auto-déclaré | |
| 61 | Gemma 3 27B | 🟢 Ouvert | 29,7 % | 12 mars 2025 | Auto-déclaré | |
| 62 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 28,7 % | 19 septembre 2024 | Auto-déclaré |
| 63 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 26,6 % | 23 juillet 2024 | Auto-déclaré |
| 64 | Gemma 3 12B | 🟢 Ouvert | 24,6 % | 12 mars 2025 | Auto-déclaré | |
| 65 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 18,2 % | 19 septembre 2024 | Auto-déclaré |
| 66 | DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 🟢 Ouvert | 16,9 % | 20 janvier 2025 | Auto-déclaré |
| 67 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 13,2 % | 26 juin 2025 | Auto-déclaré | |
| 68 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 13,2 % | 20 mai 2025 | Auto-déclaré | |
| 69 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 13,2 % | 26 juin 2025 | Auto-déclaré | |
| 70 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 13,2 % | 20 mai 2025 | Auto-déclaré | |
| 71 | Gemma 3 4B | 🟢 Ouvert | 12,6 % | 12 mars 2025 | Auto-déclaré | |
| 72 | Gemma 3 1B | 🟢 Ouvert | 1,9 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 72 modèles évalués, dont 52 de grands éditeurs. Score médian de l'ensemble : 55,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle résout correctement une forte proportion de problèmes récents, selon le pass@1 ou l’accuracy retenu pour chaque tâche. Il reflète donc à la fois la production de code correct, la capacité d’autocorrection et le raisonnement sur l’exécution. L’évaluation gagne en rigueur grâce au renouvellement des exercices et à leur datation, qui réduisent le risque qu’un modèle ait déjà rencontré les problèmes. La fiabilité comparative reste toutefois à nuancer, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant unique.
Parmi les 72 modèles évalués, une médiane à 55 % et un meilleur résultat de 94 % pour DeepSeek-V4-Pro-Max montrent un écart important entre le niveau central et la tête du classement. La proximité du meilleur score avec 100 % peut aussi signaler un risque de saturation au sommet. LiveCodeBench reste centré sur des problèmes anglophones de programmation compétitive issus de LeetCode, AtCoder et CodeForces. Son classement caractérise donc ces tâches précises, et non l’ensemble des usages possibles du code.
Sources des scores : llm-stats.