MBPP
Créé par Google Research, avec J. Austin et ses coauteurs, MBPP est un benchmark consacré à la génération de code. Il rassemble des problèmes Python issus de contributions participatives, conçus pour être accessibles à des programmeurs débutants.
Créé par Google Research, avec J. Austin et ses coauteurs, MBPP est un benchmark consacré à la génération de code. Il rassemble des problèmes Python issus de contributions participatives, conçus pour être accessibles à des programmeurs débutants.
À partir d’un énoncé en langage naturel, un modèle doit produire un court programme correct, portant sur les fondamentaux de la programmation ou sur la bibliothèque standard. Des tests automatisés vérifient les solutions. MBPP sert ainsi à comparer la capacité des modèles à transformer une consigne en code Python fonctionnel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google Research (J. Austin et al.) |
| Capacités mesurées | généraliste, raisonnement |
| Modalité | Texte |
| Type de questions | génération de code Python |
| Métrique d'évaluation | pass@1 |
| Accès | Public |
| Licence | CC-BY-4.0 |
| Langues | anglais; Python |
| Taille du jeu | 974 problèmes |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (33)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 92,7 % | 6 mars 2026 | Auto-déclaré |
| 2 | Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 🟢 Ouvert | 91,3 % | 18 mars 2025 | Auto-déclaré |
| 3 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,2 % | 19 septembre 2024 | Auto-déclaré |
| 4 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 89,1 % | 11 février 2026 | Auto-déclaré |
| 5 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,2 % | 19 septembre 2024 | Auto-déclaré |
| 6 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 🟢 Ouvert | 84,6 % | 18 mars 2025 | Auto-déclaré |
| 7 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,0 % | 19 septembre 2024 | Auto-déclaré |
| 8 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,0 % | 28 février 2025 | Auto-déclaré |
| 9 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,5 % | 19 septembre 2024 | Auto-déclaré |
| 10 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,0 % | 19 septembre 2024 | Auto-déclaré |
| 11 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,4 % | 29 avril 2025 | Auto-déclaré |
| 12 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 80,8 % | 23 août 2024 | Auto-déclaré |
| 13 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,2 % | 23 juillet 2024 | Auto-déclaré |
| 14 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,2 % | 19 septembre 2024 | Auto-déclaré |
| 15 | Codestral-22B | Mistral AI | 🟢 Ouvert | 78,2 % | 29 mai 2024 | Auto-déclaré |
| 16 | Llama 4 Maverick | Meta | 🟢 Ouvert | 77,6 % | 5 avril 2025 | Auto-déclaré |
| 17 | Gemini Diffusion | 🔒 Propriétaire | 76,0 % | 20 mai 2025 | Auto-déclaré | |
| 18 | Mistral Small 3.1 24B Instruct | Mistral AI | 🟢 Ouvert | 74,7 % | 17 mars 2025 | Auto-déclaré |
| 19 | Gemma 3 27B | 🟢 Ouvert | 74,4 % | 12 mars 2025 | Auto-déclaré | |
| 20 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,2 % | 27 mars 2025 | Auto-déclaré |
| 21 | Gemma 3 12B | 🟢 Ouvert | 73,0 % | 12 mars 2025 | Auto-déclaré | |
| 22 | Mistral Small 3 24B Base | Mistral AI | 🟢 Ouvert | 69,6 % | 30 janvier 2025 | Auto-déclaré |
| 23 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 69,6 % | 23 août 2024 | Auto-déclaré |
| 24 | Llama 4 Scout | Meta | 🟢 Ouvert | 67,8 % | 5 avril 2025 | Auto-déclaré |
| 25 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,2 % | 23 juillet 2024 | Auto-déclaré |
| 26 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 63,6 % | 26 juin 2025 | Auto-déclaré | |
| 27 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 63,6 % | 20 mai 2025 | Auto-déclaré | |
| 28 | Gemma 3 4B | 🟢 Ouvert | 63,2 % | 12 mars 2025 | Auto-déclaré | |
| 29 | Gemma 2 27B | 🟢 Ouvert | 62,6 % | 27 juin 2024 | Auto-déclaré | |
| 30 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 56,6 % | 26 juin 2025 | Auto-déclaré | |
| 31 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 56,6 % | 20 mai 2025 | Auto-déclaré | |
| 32 | Gemma 2 9B | 🟢 Ouvert | 52,4 % | 27 juin 2024 | Auto-déclaré | |
| 33 | Gemma 3 1B | 🟢 Ouvert | 35,2 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 33 modèles évalués, dont 20 de grands éditeurs. Score médian de l'ensemble : 76,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score pass@1 élevé indique qu’un modèle produit fréquemment une solution validée dès sa première proposition. Cette mesure est exigeante sur le résultat concret, puisque chaque problème comporte trois cas de test automatisés. La comparabilité doit toutefois être nuancée : dans cette base, les scores sont majoritairement auto-déclarés par les éditeurs, même si leur calcul repose sur des tests exécutables.
Le niveau médian de 76 % parmi 33 modèles et le meilleur résultat de 93 %, obtenu par Sarvam-30B, signalent des performances déjà élevées sur ces exercices. Cet écart montre qu’une marge de différenciation subsiste, mais suggère aussi un risque de saturation à mesure que les modèles approchent du plafond. La disponibilité publique du jeu peut également favoriser une contamination des données d’entraînement et compliquer l’interprétation des progrès. Enfin, la portée reste ciblée : MBPP évalue de courts programmes Python, des notions fondamentales et la bibliothèque standard. Le classement renseigne donc sur cette aptitude précise, et non sur l’ensemble des compétences de développement logiciel.
Sources des scores : llm-stats.