LiveCodeBench v6

LiveCodeBench v6 est un benchmark conçu en 2025 par l’équipe LiveCodeBench, réunissant notamment des chercheurs de l’UC Berkeley, du MIT et de Cornell. Il propose une évaluation holistique et sans contamination des grands modèles de langage appliqués au code.

LiveCodeBench v6 est un benchmark conçu en 2025 par l’équipe LiveCodeBench, réunissant notamment des chercheurs de l’UC Berkeley, du MIT et de Cornell. Il propose une évaluation holistique et sans contamination des grands modèles de langage appliqués au code.

À partir de problèmes issus de concours de programmation, il mesure la génération de code ainsi que l’auto-réparation, l’exécution et la prédiction de résultats de tests. La datation des problèmes permet d’évaluer les modèles sur des exercices publiés après leur période d’entraînement.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkÉquipe LiveCodeBench (UC Berkeley, MIT, Cornell et al. ; Naman Jain et al.)
Capacités mesuréesGénération de code et capacités connexes (auto-réparation, exécution, prédiction de sortie de tests), évaluation holistique et sans contamination.
ModalitéTexte
Type de questionsGénération de code (et auto-réparation, exécution de code, prédiction de sortie de tests)
Métrique d'évaluationpass@1 (et pass@5)
AccèsPublic
LicenceMIT
LanguesPython (problèmes de programmation compétitive)
Taille du jeu1 055 problèmes (publiés de mai 2023 à avril 2025)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (53)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire91,6 %19 mai 2026Auto-déclaré
2Kimi K2.6Moonshot AI🟢 Ouvert89,6 %20 avril 2026Auto-déclaré
3Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire89,6 %31 mai 2026Auto-déclaré
4Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert89,0 %4 juin 2026Auto-déclaré
5Seed 2.0 ProByteDance🔒 Propriétaire87,8 %14 février 2026Auto-déclaré
6MAI-Thinking-1Microsoft🔒 Propriétaire87,7 %2 juin 2026Auto-déclaré
7Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire87,1 %31 mars 2026Auto-déclaré
8Step-3.5-FlashStepFun🟢 Ouvert86,4 %2 février 2026Auto-déclaré
9Kimi K2.5Moonshot AI🟢 Ouvert85,0 %27 janvier 2026Auto-déclaré
10GLM-4.7Zhipu AI🟢 Ouvert84,9 %22 décembre 2025Auto-déclaré
11Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %21 avril 2026Auto-déclaré
12Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert83,6 %16 février 2026Auto-déclaré
13Kimi K2 0905Moonshot AI🔒 Propriétaire83,1 %5 septembre 2025Auto-déclaré
14GLM-4.6Zhipu AI🟢 Ouvert82,8 %30 septembre 2025Auto-déclaré
15GPT OSS 120BOpenAI🟢 Ouvert81,9 %5 août 2025Auto-déclaré
16Seed 2.0 LiteByteDance🔒 Propriétaire81,7 %14 février 2026Auto-déclaré
17K-EXAONE-236B-A23BLG AI Research🔒 Propriétaire80,7 %31 décembre 2025Auto-déclaré
18Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert80,7 %24 février 2026Auto-déclaré
19MiMo-V2-FlashXiaomi🟢 Ouvert80,6 %16 décembre 2025Auto-déclaré
20Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert80,4 %16 avril 2026Auto-déclaré
21Gemma 4 31BGoogle🟢 Ouvert80,0 %2 avril 2026Auto-déclaré
22Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert78,9 %24 février 2026Auto-déclaré
23Gemma 4 26B-A4BGoogle🟢 Ouvert77,1 %2 avril 2026Auto-déclaré
24Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert74,6 %24 février 2026Auto-déclaré
25Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert74,1 %25 juillet 2025Auto-déclaré
26Gemma 4 12BGoogle🟢 Ouvert72,0 %23 mai 2026Auto-déclaré
27Sarvam-105BSarvam AI🟢 Ouvert71,7 %6 mars 2026Auto-déclaré
28North Mini Code 1.0Cohere🟢 Ouvert70,3 %9 juin 2026Auto-déclaré
29Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert70,1 %22 septembre 2025Auto-déclaré
30Sarvam-30BSarvam AI🟢 Ouvert70,0 %6 mars 2026Auto-déclaré
31DiffusionGemma 26B-A4BGoogle🟢 Ouvert69,1 %10 juin 2026Auto-déclaré
32Qwen3 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire69,0 %15 décembre 2025Auto-déclaré
33Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert68,7 %10 septembre 2025Auto-déclaré
34Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert68,3 %15 décembre 2025Auto-déclaré
35Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert65,6 %22 septembre 2025Auto-déclaré
36Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert65,6 %2 mars 2026Auto-déclaré
37Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert64,2 %22 septembre 2025Auto-déclaré
38Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert58,6 %22 septembre 2025Auto-déclaré
39Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert56,6 %10 septembre 2025Auto-déclaré
40Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert55,8 %2 mars 2026Auto-déclaré
41Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert54,3 %22 septembre 2025Auto-déclaré
42Kimi K2 InstructMoonshot AI🟢 Ouvert53,7 %11 juillet 2025Auto-déclaré
43Gemma 4 E4BGoogle🟢 Ouvert52,0 %2 avril 2026Auto-déclaré
44MiniCPM-SALAOpenBMB🟢 Ouvert52,0 %11 février 2026Auto-déclaré
45Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert51,8 %22 juillet 2025Auto-déclaré
46Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert51,3 %22 septembre 2025Auto-déclaré
47Gemma 4 E2BGoogle🟢 Ouvert44,0 %2 avril 2026Auto-déclaré
48Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert43,8 %22 septembre 2025Auto-déclaré
49Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert42,6 %22 septembre 2025Auto-déclaré
50MiMo-V2.5-ProXiaomi🟢 Ouvert39,6 %27 avril 2026Auto-déclaré
51Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert39,3 %22 septembre 2025Auto-déclaré
52Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert37,9 %22 septembre 2025Auto-déclaré
53Kimi K2 BaseMoonshot AI🟢 Ouvert26,3 %11 juillet 2025Auto-déclaré

Classement établi sur 53 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 71,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé à LiveCodeBench v6 indique qu’un modèle résout fréquemment les problèmes dès la première tentative, selon la métrique pass@1, tandis que pass@5 mesure la réussite sur plusieurs essais. L’évaluation couvre plusieurs capacités connexes, ce qui offre une lecture plus large que la seule production initiale de code. Sa collecte continue et la présence de dates de publication renforcent la lutte contre la contamination en permettant de sélectionner des problèmes postérieurs à la date de fin d’entraînement d’un modèle.

La portée reste toutefois centrée sur des problèmes de programmation compétitive en Python, issus de LeetCode, AtCoder et CodeForces. Les résultats ne décrivent donc pas toutes les formes de développement logiciel. Avec une médiane de 72 % parmi 53 modèles et un meilleur score de 92 % pour Qwen3.7 Max, le classement montre un niveau global déjà élevé et un écart encore visible au sommet. Cette proximité avec le plafond peut réduire progressivement le pouvoir discriminant. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de l’application cohérente du protocole.


Sources des scores : llm-stats.