MBPP

Créé par Google Research, avec J. Austin et ses coauteurs, MBPP est un benchmark consacré à la génération de code. Il rassemble des problèmes Python issus de contributions participatives, conçus pour être accessibles à des programmeurs débutants.

Créé par Google Research, avec J. Austin et ses coauteurs, MBPP est un benchmark consacré à la génération de code. Il rassemble des problèmes Python issus de contributions participatives, conçus pour être accessibles à des programmeurs débutants.

À partir d’un énoncé en langage naturel, un modèle doit produire un court programme correct, portant sur les fondamentaux de la programmation ou sur la bibliothèque standard. Des tests automatisés vérifient les solutions. MBPP sert ainsi à comparer la capacité des modèles à transformer une consigne en code Python fonctionnel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle Research (J. Austin et al.)
Capacités mesuréesgénéraliste, raisonnement
ModalitéTexte
Type de questionsgénération de code Python
Métrique d'évaluationpass@1
AccèsPublic
LicenceCC-BY-4.0
Languesanglais; Python
Taille du jeu974 problèmes
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (33)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Sarvam-30BSarvam AI🟢 Ouvert92,7 %6 mars 2026Auto-déclaré
2Llama-3.3 Nemotron Super 49B v1NVIDIA🟢 Ouvert91,3 %18 mars 2025Auto-déclaré
3Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert90,2 %19 septembre 2024Auto-déclaré
4MiniCPM-SALAOpenBMB🟢 Ouvert89,1 %11 février 2026Auto-déclaré
5Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,2 %19 septembre 2024Auto-déclaré
6Llama 3.1 Nemotron Nano 8B V1NVIDIA🟢 Ouvert84,6 %18 mars 2025Auto-déclaré
7Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,0 %19 septembre 2024Auto-déclaré
8Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,0 %28 février 2025Auto-déclaré
9Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,5 %19 septembre 2024Auto-déclaré
10Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,0 %19 septembre 2024Auto-déclaré
11Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert81,4 %29 avril 2025Auto-déclaré
12Phi-3.5-MoE-instructMicrosoft🟢 Ouvert80,8 %23 août 2024Auto-déclaré
13Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,2 %23 juillet 2024Auto-déclaré
14Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert79,2 %19 septembre 2024Auto-déclaré
15Codestral-22BMistral AI🟢 Ouvert78,2 %29 mai 2024Auto-déclaré
16Llama 4 MaverickMeta🟢 Ouvert77,6 %5 avril 2025Auto-déclaré
17Gemini DiffusionGoogle🔒 Propriétaire76,0 %20 mai 2025Auto-déclaré
18Mistral Small 3.1 24B InstructMistral AI🟢 Ouvert74,7 %17 mars 2025Auto-déclaré
19Gemma 3 27BGoogle🟢 Ouvert74,4 %12 mars 2025Auto-déclaré
20Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert73,2 %27 mars 2025Auto-déclaré
21Gemma 3 12BGoogle🟢 Ouvert73,0 %12 mars 2025Auto-déclaré
22Mistral Small 3 24B BaseMistral AI🟢 Ouvert69,6 %30 janvier 2025Auto-déclaré
23Phi-3.5-mini-instructMicrosoft🟢 Ouvert69,6 %23 août 2024Auto-déclaré
24Llama 4 ScoutMeta🟢 Ouvert67,8 %5 avril 2025Auto-déclaré
25Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,2 %23 juillet 2024Auto-déclaré
26Gemma 3n E4B InstructedGoogle🔒 Propriétaire63,6 %26 juin 2025Auto-déclaré
27Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert63,6 %20 mai 2025Auto-déclaré
28Gemma 3 4BGoogle🟢 Ouvert63,2 %12 mars 2025Auto-déclaré
29Gemma 2 27BGoogle🟢 Ouvert62,6 %27 juin 2024Auto-déclaré
30Gemma 3n E2B InstructedGoogle🔒 Propriétaire56,6 %26 juin 2025Auto-déclaré
31Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert56,6 %20 mai 2025Auto-déclaré
32Gemma 2 9BGoogle🟢 Ouvert52,4 %27 juin 2024Auto-déclaré
33Gemma 3 1BGoogle🟢 Ouvert35,2 %12 mars 2025Auto-déclaré

Classement établi sur 33 modèles évalués, dont 20 de grands éditeurs. Score médian de l'ensemble : 76,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score pass@1 élevé indique qu’un modèle produit fréquemment une solution validée dès sa première proposition. Cette mesure est exigeante sur le résultat concret, puisque chaque problème comporte trois cas de test automatisés. La comparabilité doit toutefois être nuancée : dans cette base, les scores sont majoritairement auto-déclarés par les éditeurs, même si leur calcul repose sur des tests exécutables.

Le niveau médian de 76 % parmi 33 modèles et le meilleur résultat de 93 %, obtenu par Sarvam-30B, signalent des performances déjà élevées sur ces exercices. Cet écart montre qu’une marge de différenciation subsiste, mais suggère aussi un risque de saturation à mesure que les modèles approchent du plafond. La disponibilité publique du jeu peut également favoriser une contamination des données d’entraînement et compliquer l’interprétation des progrès. Enfin, la portée reste ciblée : MBPP évalue de courts programmes Python, des notions fondamentales et la bibliothèque standard. Le classement renseigne donc sur cette aptitude précise, et non sur l’ensemble des compétences de développement logiciel.


Sources des scores : llm-stats.