MultiPL-E
MultiPL-E est un système conçu par F. Cassano et ses coauteurs pour étendre des benchmarks de génération de code à de nombreux langages de programmation. Il traduit des tâches fondées sur des tests unitaires afin de comparer les modèles au-delà du seul Python.
MultiPL-E est un système conçu par F. Cassano et ses coauteurs pour étendre des benchmarks de génération de code à de nombreux langages de programmation. Il traduit des tâches fondées sur des tests unitaires afin de comparer les modèles au-delà du seul Python.
Le benchmark mesure la capacité à produire un code correct à partir de spécifications textuelles en anglais et de tests. Son caractère multilingue permet d’évaluer les modèles face à différents paradigmes et particularités des langages, avec un protocole commun issu de HumanEval et MBPP.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | F. Cassano et al. |
| Capacités mesurées | généraliste, langage |
| Modalité | Texte |
| Type de questions | génération de code |
| Métrique d'évaluation | pass@1 |
| Accès | Public |
| Licence | MIT |
| Langues | anglais pour les énoncés ; multilingue en langages de programmation |
| Taille du jeu | 164 tâches HumanEval et environ 974 tâches MBPP, traduites dans 18 langages de programmation supplémentaires |
| Année de publication | 2022 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,9 % | 22 juillet 2025 | Auto-déclaré |
| 2 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,8 % | 10 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,1 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 85,7 % | 11 juillet 2025 | Auto-déclaré |
| 5 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 85,7 % | 5 septembre 2025 | Auto-déclaré |
| 6 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,4 % | 19 septembre 2024 | Auto-déclaré |
| 7 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,1 % | 19 septembre 2024 | Auto-déclaré |
| 8 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,8 % | 19 septembre 2024 | Auto-déclaré |
| 9 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,4 % | 19 septembre 2024 | Auto-déclaré |
| 10 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,2 % | 23 juillet 2024 | Auto-déclaré |
| 11 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,9 % | 29 avril 2025 | Auto-déclaré |
| 12 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,8 % | 27 mars 2025 | Auto-déclaré |
| 13 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,1 % | 23 juillet 2024 | Auto-déclaré |
Classement établi sur 13 modèles évalués. Score médian de l'ensemble : 75,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score pass@1 élevé indique qu’un modèle génère fréquemment, dès sa réponse évaluée, un programme satisfaisant les tests unitaires. Dans cette base de 13 modèles, Qwen3-235B-A22B-Instruct-2507 atteint 88 %, contre une médiane de 75 %. Cet écart montre une avance du meilleur modèle, mais aussi un niveau global déjà élevé, susceptible de réduire progressivement le pouvoir discriminant du benchmark à mesure que les résultats se rapprochent du plafond. La comparaison doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans une évaluation indépendante et uniforme. La portée de MultiPL-E est ciblée : elle concerne la génération de code à partir de spécifications et de tests, sur des traductions de HumanEval et MBPP, et non l’ensemble des aptitudes de programmation. Son accès public et son ancrage dans des jeux connus imposent également de considérer le risque de contamination lors de l’interprétation des performances. Le classement révèle donc surtout l’efficacité relative des modèles sur ce protocole multilingue précis.
Sources des scores : llm-stats.