LiveCodeBench

Créé par Naman Jain et al. en 2024, LiveCodeBench est un benchmark évolutif consacré aux grands modèles de langage spécialisés dans le code. Il collecte en continu des problèmes récents issus de concours de programmation afin de limiter la contamination par les données d’entraînement.

Créé par Naman Jain et al. en 2024, LiveCodeBench est un benchmark évolutif consacré aux grands modèles de langage spécialisés dans le code. Il collecte en continu des problèmes récents issus de concours de programmation afin de limiter la contamination par les données d’entraînement.

Son évaluation couvre la génération et la réparation de code, le raisonnement sur son exécution et la prédiction de sorties de tests. Les dates de publication des problèmes permettent de cibler des exercices apparus après la date de clôture de l’entraînement d’un modèle.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkNaman Jain et al.
Capacités mesuréescode, généraliste, raisonnement
ModalitéTexte
Type de questionsgénération de code, réparation de code, exécution de code et prédiction de sortie de tests
Métrique d'évaluationpass@1 / accuracy selon la tâche
AccèsPublic
Languesanglais
Taille du jeuévolutif ; plusieurs centaines de problèmes de programmation compétitive
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (72)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert93,5 %23 avril 2026Auto-déclaré
2DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert91,6 %23 avril 2026Auto-déclaré
3DeepSeek-V3.2DeepSeek🟢 Ouvert83,3 %1 décembre 2025Auto-déclaré
4DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert83,3 %1 décembre 2025Auto-déclaré
5MiniMax M2MiniMax🟢 Ouvert83,0 %27 octobre 2025Auto-déclaré
6LongCat-Flash-Thinking-2601Meituan🟢 Ouvert82,8 %14 janvier 2026Auto-déclaré
7Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert81,2 %11 mars 2026Auto-déclaré
8Grok-3 MinixAI🔒 Propriétaire80,4 %17 février 2025Auto-déclaré
9Grok 4 FastxAI🔒 Propriétaire80,0 %28 août 2025Auto-déclaré
10Grok-3xAI🔒 Propriétaire79,4 %17 février 2025Auto-déclaré
11Grok-4 HeavyxAI🔒 Propriétaire79,4 %Auto-déclaré
12LongCat-Flash-ThinkingMeituan🟢 Ouvert79,4 %22 septembre 2025Auto-déclaré
13Grok-4xAI🔒 Propriétaire79,0 %9 juillet 2025Auto-déclaré
14MiniMax M2.1MiniMax🟢 Ouvert78,0 %23 décembre 2025Auto-déclaré
15Nova 2 ProAmazon🔒 Propriétaire74,6 %2 décembre 2025Auto-déclaré
16DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert74,1 %29 septembre 2025Auto-déclaré
17DeepSeek-R1-0528DeepSeek🟢 Ouvert73,3 %28 mai 2025Auto-déclaré
18GLM-4.5Zhipu AI🟢 Ouvert72,9 %28 juillet 2025Auto-déclaré
19Nemotron Nano 9B v2NVIDIA🟢 Ouvert71,1 %18 août 2025Auto-déclaré
20Nova 2 LiteAmazon🔒 Propriétaire71,0 %2 décembre 2025Auto-déclaré
21GLM-4.5-AirZhipu AI🟢 Ouvert70,7 %28 juillet 2025Auto-déclaré
22Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert70,7 %29 avril 2025Auto-déclaré
23Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire69,0 %5 juin 2025Auto-déclaré
24Mercury 2Inception🔒 Propriétaire67,0 %24 février 2026Auto-déclaré
25Llama 3.1 Nemotron Ultra 253B v1NVIDIA🟢 Ouvert66,3 %7 avril 2025Auto-déclaré
26Qwen3 32BAlibaba Cloud / Qwen Team🟢 Ouvert65,7 %29 avril 2025Auto-déclaré
27Ministral 3 (14B Reasoning 2512)Mistral AI🟢 Ouvert64,6 %4 décembre 2025Auto-déclaré
28Mistral Small 4Mistral AI🟢 Ouvert63,6 %16 mars 2026Auto-déclaré
29QwQ-32BAlibaba Cloud / Qwen Team🟢 Ouvert63,4 %5 mars 2025Auto-déclaré
30Qwen3 30B A3BAlibaba Cloud / Qwen Team🟢 Ouvert62,6 %29 avril 2025Auto-déclaré
31MiniMax M1MiniMax🟢 Ouvert62,3 %17 juin 2025Auto-déclaré
32Ministral 3 (8B Reasoning 2512)Mistral AI🟢 Ouvert61,6 %4 décembre 2025Auto-déclaré
33DeepSeek R1 Distill Llama 70BDeepSeek🟢 Ouvert57,5 %20 janvier 2025Auto-déclaré
34DeepSeek R1 Distill Qwen 32BDeepSeek🟢 Ouvert57,2 %20 janvier 2025Auto-déclaré
35DeepSeek-V3.1DeepSeek🟢 Ouvert56,4 %10 janvier 2025Auto-déclaré
36Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert55,5 %19 septembre 2024Auto-déclaré
37Min istral 3 (3B Reasoning 2512)Mistral AI🟢 Ouvert54,8 %4 décembre 2025Auto-déclaré
38Phi 4 ReasoningMicrosoft🟢 Ouvert53,8 %30 avril 2025Auto-déclaré
39Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert53,7 %5 septembre 2025Auto-déclaré
40DeepSeek R1 Distill Qwen 14BDeepSeek🟢 Ouvert53,1 %20 janvier 2025Auto-déclaré
41Phi 4 Reasoning PlusMicrosoft🟢 Ouvert53,1 %30 avril 2025Auto-déclaré
42Magistral Small 2506Mistral AI🟢 Ouvert51,3 %10 juin 2025Auto-déclaré
43Magistral MediumMistral AI🟢 Ouvert50,3 %10 juin 2025Auto-déclaré
44DeepSeek R1 ZeroDeepSeek🟢 Ouvert50,0 %20 janvier 2025Auto-déclaré
45QwQ-32B-PreviewAlibaba Cloud / Qwen Team🟢 Ouvert50,0 %28 novembre 2024Auto-déclaré
46DeepSeek-V3 0324DeepSeek🟢 Ouvert49,2 %25 mars 2025Auto-déclaré
47LongCat-Flash-ChatMeituan🟢 Ouvert48,0 %29 août 2025Auto-déclaré
48Llama 4 MaverickMeta🟢 Ouvert43,4 %5 avril 2025Auto-déclaré
49DeepSeek R1 Distill Llama 8BDeepSeek🟢 Ouvert39,6 %20 janvier 2025Auto-déclaré
50DeepSeek R1 Distill Qwen 7BDeepSeek🟢 Ouvert37,6 %20 janvier 2025Auto-déclaré
51DeepSeek-V3DeepSeek🟢 Ouvert37,6 %25 décembre 2024Auto-déclaré
52Gemini 2.0 FlashGoogle🔒 Propriétaire35,1 %21 janvier 2025Auto-déclaré
53Mistral Large 3 (675B Base)Mistral AI🟢 Ouvert34,4 %4 décembre 2025Auto-déclaré
54Mistral Large 3 (675B Instruct 2512 Eagle)Mistral AI🟢 Ouvert34,4 %4 décembre 2025Auto-déclaré
55Mistral Large 3 (675B Instruct 2512 NVFP4)Mistral AI🟢 Ouvert34,4 %4 décembre 2025Auto-déclaré
56Mistral Large 3 (675B Instruct 2512)Mistral AI🟢 Ouvert34,4 %4 décembre 2025Auto-déclaré
57Gemini 2.5 Flash-LiteGoogle🟢 Ouvert33,7 %17 juin 2025Auto-déclaré
58Llama 4 ScoutMeta🟢 Ouvert32,8 %5 avril 2025Auto-déclaré
59Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert31,4 %19 septembre 2024Auto-déclaré
60Gemini DiffusionGoogle🔒 Propriétaire30,9 %20 mai 2025Auto-déclaré
61Gemma 3 27BGoogle🟢 Ouvert29,7 %12 mars 2025Auto-déclaré
62Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert28,7 %19 septembre 2024Auto-déclaré
63Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert26,6 %23 juillet 2024Auto-déclaré
64Gemma 3 12BGoogle🟢 Ouvert24,6 %12 mars 2025Auto-déclaré
65Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert18,2 %19 septembre 2024Auto-déclaré
66DeepSeek R1 Distill Qwen 1.5BDeepSeek🟢 Ouvert16,9 %20 janvier 2025Auto-déclaré
67Gemma 3n E2B InstructedGoogle🔒 Propriétaire13,2 %26 juin 2025Auto-déclaré
68Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert13,2 %20 mai 2025Auto-déclaré
69Gemma 3n E4B InstructedGoogle🔒 Propriétaire13,2 %26 juin 2025Auto-déclaré
70Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert13,2 %20 mai 2025Auto-déclaré
71Gemma 3 4BGoogle🟢 Ouvert12,6 %12 mars 2025Auto-déclaré
72Gemma 3 1BGoogle🟢 Ouvert1,9 %12 mars 2025Auto-déclaré

Classement établi sur 72 modèles évalués, dont 52 de grands éditeurs. Score médian de l'ensemble : 55,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle résout correctement une forte proportion de problèmes récents, selon le pass@1 ou l’accuracy retenu pour chaque tâche. Il reflète donc à la fois la production de code correct, la capacité d’autocorrection et le raisonnement sur l’exécution. L’évaluation gagne en rigueur grâce au renouvellement des exercices et à leur datation, qui réduisent le risque qu’un modèle ait déjà rencontré les problèmes. La fiabilité comparative reste toutefois à nuancer, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant unique.

Parmi les 72 modèles évalués, une médiane à 55 % et un meilleur résultat de 94 % pour DeepSeek-V4-Pro-Max montrent un écart important entre le niveau central et la tête du classement. La proximité du meilleur score avec 100 % peut aussi signaler un risque de saturation au sommet. LiveCodeBench reste centré sur des problèmes anglophones de programmation compétitive issus de LeetCode, AtCoder et CodeForces. Son classement caractérise donc ces tâches précises, et non l’ensemble des usages possibles du code.


Sources des scores : llm-stats.