LiveCodeBench v6
LiveCodeBench v6 est un benchmark conçu en 2025 par l’équipe LiveCodeBench, réunissant notamment des chercheurs de l’UC Berkeley, du MIT et de Cornell. Il propose une évaluation holistique et sans contamination des grands modèles de langage appliqués au code.
LiveCodeBench v6 est un benchmark conçu en 2025 par l’équipe LiveCodeBench, réunissant notamment des chercheurs de l’UC Berkeley, du MIT et de Cornell. Il propose une évaluation holistique et sans contamination des grands modèles de langage appliqués au code.
À partir de problèmes issus de concours de programmation, il mesure la génération de code ainsi que l’auto-réparation, l’exécution et la prédiction de résultats de tests. La datation des problèmes permet d’évaluer les modèles sur des exercices publiés après leur période d’entraînement.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Équipe LiveCodeBench (UC Berkeley, MIT, Cornell et al. ; Naman Jain et al.) |
| Capacités mesurées | Génération de code et capacités connexes (auto-réparation, exécution, prédiction de sortie de tests), évaluation holistique et sans contamination. |
| Modalité | Texte |
| Type de questions | Génération de code (et auto-réparation, exécution de code, prédiction de sortie de tests) |
| Métrique d'évaluation | pass@1 (et pass@5) |
| Accès | Public |
| Licence | MIT |
| Langues | Python (problèmes de programmation compétitive) |
| Taille du jeu | 1 055 problèmes (publiés de mai 2023 à avril 2025) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (53)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 91,6 % | 19 mai 2026 | Auto-déclaré |
| 2 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 89,6 % | 20 avril 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 89,6 % | 31 mai 2026 | Auto-déclaré |
| 4 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 89,0 % | 4 juin 2026 | Auto-déclaré |
| 5 | Seed 2.0 Pro | ByteDance | 🔒 Propriétaire | 87,8 % | 14 février 2026 | Auto-déclaré |
| 6 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 87,7 % | 2 juin 2026 | Auto-déclaré |
| 7 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 87,1 % | 31 mars 2026 | Auto-déclaré |
| 8 | Step-3.5-Flash | StepFun | 🟢 Ouvert | 86,4 % | 2 février 2026 | Auto-déclaré |
| 9 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 85,0 % | 27 janvier 2026 | Auto-déclaré |
| 10 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 84,9 % | 22 décembre 2025 | Auto-déclaré |
| 11 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 21 avril 2026 | Auto-déclaré |
| 12 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,6 % | 16 février 2026 | Auto-déclaré |
| 13 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 83,1 % | 5 septembre 2025 | Auto-déclaré |
| 14 | GLM-4.6 | Zhipu AI | 🟢 Ouvert | 82,8 % | 30 septembre 2025 | Auto-déclaré |
| 15 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 81,9 % | 5 août 2025 | Auto-déclaré |
| 16 | Seed 2.0 Lite | ByteDance | 🔒 Propriétaire | 81,7 % | 14 février 2026 | Auto-déclaré |
| 17 | K-EXAONE-236B-A23B | LG AI Research | 🔒 Propriétaire | 80,7 % | 31 décembre 2025 | Auto-déclaré |
| 18 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,7 % | 24 février 2026 | Auto-déclaré |
| 19 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 80,6 % | 16 décembre 2025 | Auto-déclaré |
| 20 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,4 % | 16 avril 2026 | Auto-déclaré |
| 21 | Gemma 4 31B | 🟢 Ouvert | 80,0 % | 2 avril 2026 | Auto-déclaré | |
| 22 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,9 % | 24 février 2026 | Auto-déclaré |
| 23 | Gemma 4 26B-A4B | 🟢 Ouvert | 77,1 % | 2 avril 2026 | Auto-déclaré | |
| 24 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,6 % | 24 février 2026 | Auto-déclaré |
| 25 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,1 % | 25 juillet 2025 | Auto-déclaré |
| 26 | Gemma 4 12B | 🟢 Ouvert | 72,0 % | 23 mai 2026 | Auto-déclaré | |
| 27 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 71,7 % | 6 mars 2026 | Auto-déclaré |
| 28 | North Mini Code 1.0 | Cohere | 🟢 Ouvert | 70,3 % | 9 juin 2026 | Auto-déclaré |
| 29 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,1 % | 22 septembre 2025 | Auto-déclaré |
| 30 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 70,0 % | 6 mars 2026 | Auto-déclaré |
| 31 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 69,1 % | 10 juin 2026 | Auto-déclaré | |
| 32 | Qwen3 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 69,0 % | 15 décembre 2025 | Auto-déclaré |
| 33 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,7 % | 10 septembre 2025 | Auto-déclaré |
| 34 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 68,3 % | 15 décembre 2025 | Auto-déclaré |
| 35 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,6 % | 22 septembre 2025 | Auto-déclaré |
| 36 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,6 % | 2 mars 2026 | Auto-déclaré |
| 37 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,2 % | 22 septembre 2025 | Auto-déclaré |
| 38 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,6 % | 22 septembre 2025 | Auto-déclaré |
| 39 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,6 % | 10 septembre 2025 | Auto-déclaré |
| 40 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,8 % | 2 mars 2026 | Auto-déclaré |
| 41 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,3 % | 22 septembre 2025 | Auto-déclaré |
| 42 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 53,7 % | 11 juillet 2025 | Auto-déclaré |
| 43 | Gemma 4 E4B | 🟢 Ouvert | 52,0 % | 2 avril 2026 | Auto-déclaré | |
| 44 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 52,0 % | 11 février 2026 | Auto-déclaré |
| 45 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,8 % | 22 juillet 2025 | Auto-déclaré |
| 46 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,3 % | 22 septembre 2025 | Auto-déclaré |
| 47 | Gemma 4 E2B | 🟢 Ouvert | 44,0 % | 2 avril 2026 | Auto-déclaré | |
| 48 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,8 % | 22 septembre 2025 | Auto-déclaré |
| 49 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 42,6 % | 22 septembre 2025 | Auto-déclaré |
| 50 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 39,6 % | 27 avril 2026 | Auto-déclaré |
| 51 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 39,3 % | 22 septembre 2025 | Auto-déclaré |
| 52 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 37,9 % | 22 septembre 2025 | Auto-déclaré |
| 53 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 26,3 % | 11 juillet 2025 | Auto-déclaré |
Classement établi sur 53 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 71,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé à LiveCodeBench v6 indique qu’un modèle résout fréquemment les problèmes dès la première tentative, selon la métrique pass@1, tandis que pass@5 mesure la réussite sur plusieurs essais. L’évaluation couvre plusieurs capacités connexes, ce qui offre une lecture plus large que la seule production initiale de code. Sa collecte continue et la présence de dates de publication renforcent la lutte contre la contamination en permettant de sélectionner des problèmes postérieurs à la date de fin d’entraînement d’un modèle.
La portée reste toutefois centrée sur des problèmes de programmation compétitive en Python, issus de LeetCode, AtCoder et CodeForces. Les résultats ne décrivent donc pas toutes les formes de développement logiciel. Avec une médiane de 72 % parmi 53 modèles et un meilleur score de 92 % pour Qwen3.7 Max, le classement montre un niveau global déjà élevé et un écart encore visible au sommet. Cette proximité avec le plafond peut réduire progressivement le pouvoir discriminant. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de l’application cohérente du protocole.
Sources des scores : llm-stats.