MultiPL-E

MultiPL-E est un système conçu par F. Cassano et ses coauteurs pour étendre des benchmarks de génération de code à de nombreux langages de programmation. Il traduit des tâches fondées sur des tests unitaires afin de comparer les modèles au-delà du seul Python.

MultiPL-E est un système conçu par F. Cassano et ses coauteurs pour étendre des benchmarks de génération de code à de nombreux langages de programmation. Il traduit des tâches fondées sur des tests unitaires afin de comparer les modèles au-delà du seul Python.

Le benchmark mesure la capacité à produire un code correct à partir de spécifications textuelles en anglais et de tests. Son caractère multilingue permet d’évaluer les modèles face à différents paradigmes et particularités des langages, avec un protocole commun issu de HumanEval et MBPP.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkF. Cassano et al.
Capacités mesuréesgénéraliste, langage
ModalitéTexte
Type de questionsgénération de code
Métrique d'évaluationpass@1
AccèsPublic
LicenceMIT
Languesanglais pour les énoncés ; multilingue en langages de programmation
Taille du jeu164 tâches HumanEval et environ 974 tâches MBPP, traduites dans 18 langages de programmation supplémentaires
Année de publication2022
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert87,9 %22 juillet 2025Auto-déclaré
2Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert87,8 %10 septembre 2025Auto-déclaré
3Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert86,1 %22 septembre 2025Auto-déclaré
4Kimi K2 InstructMoonshot AI🟢 Ouvert85,7 %11 juillet 2025Auto-déclaré
5Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert85,7 %5 septembre 2025Auto-déclaré
6Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert75,4 %19 septembre 2024Auto-déclaré
7Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert75,1 %19 septembre 2024Auto-déclaré
8Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert72,8 %19 septembre 2024Auto-déclaré
9Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,4 %19 septembre 2024Auto-déclaré
10Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert69,2 %23 juillet 2024Auto-déclaré
11Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert65,9 %29 avril 2025Auto-déclaré
12Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert65,8 %27 mars 2025Auto-déclaré
13Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert59,1 %23 juillet 2024Auto-déclaré

Classement établi sur 13 modèles évalués. Score médian de l'ensemble : 75,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score pass@1 élevé indique qu’un modèle génère fréquemment, dès sa réponse évaluée, un programme satisfaisant les tests unitaires. Dans cette base de 13 modèles, Qwen3-235B-A22B-Instruct-2507 atteint 88 %, contre une médiane de 75 %. Cet écart montre une avance du meilleur modèle, mais aussi un niveau global déjà élevé, susceptible de réduire progressivement le pouvoir discriminant du benchmark à mesure que les résultats se rapprochent du plafond. La comparaison doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans une évaluation indépendante et uniforme. La portée de MultiPL-E est ciblée : elle concerne la génération de code à partir de spécifications et de tests, sur des traductions de HumanEval et MBPP, et non l’ensemble des aptitudes de programmation. Son accès public et son ancrage dans des jeux connus imposent également de considérer le risque de contamination lors de l’interprétation des performances. Le classement révèle donc surtout l’efficacité relative des modèles sur ce protocole multilingue précis.


Sources des scores : llm-stats.