HumanEval+
HumanEval+ est un benchmark créé en 2023 par Jiawei Liu, Chunqiu Steven Xia, Yuyao Wang, Lingming Zhang et d’autres contributeurs d’EvalPlus. Il constitue une version renforcée de HumanEval, destinée à vérifier plus rigoureusement la correction fonctionnelle du code produit par les…
HumanEval+ est un benchmark créé en 2023 par Jiawei Liu, Chunqiu Steven Xia, Yuyao Wang, Lingming Zhang et d’autres contributeurs d’EvalPlus. Il constitue une version renforcée de HumanEval, destinée à vérifier plus rigoureusement la correction fonctionnelle du code produit par les modèles.
Le benchmark évalue la génération de code Python à partir de consignes en anglais. Sa suite de tests unitaires fortement augmentée permet de détecter des solutions erronées qui pouvaient réussir les tests originaux, et d’établir une comparaison plus exigeante des capacités de synthèse de code.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Jiawei Liu, Chunqiu Steven Xia, Yuyao Wang, Lingming Zhang et al. (EvalPlus) |
| Capacités mesurées | raisonnement |
| Modalité | Texte |
| Type de questions | génération de code Python |
| Métrique d'évaluation | pass@1 |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais; code Python |
| Taille du jeu | 164 problèmes de programmation, avec une suite de tests augmentée d’environ 80× par rapport à HumanEval |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Phi 4 Reasoning | Microsoft | 🟢 Ouvert | 92,9 % | 30 avril 2025 | Auto-déclaré |
| 2 | Phi 4 Reasoning Plus | Microsoft | 🟢 Ouvert | 92,3 % | 30 avril 2025 | Auto-déclaré |
| 3 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 86,1 % | 16 avril 2025 | Auto-déclaré |
| 4 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 86,1 % | 16 avril 2025 | Auto-déclaré |
| 5 | Phi 4 | Microsoft | 🟢 Ouvert | 82,8 % | 12 décembre 2024 | Auto-déclaré |
| 6 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 78,3 % | 2 mai 2025 | Auto-déclaré |
| 7 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 75,6 % | 27 avril 2026 | Auto-déclaré |
| 8 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,4 % | 19 septembre 2024 | Auto-déclaré |
| 9 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,2 % | 19 septembre 2024 | Auto-déclaré |
| 10 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 25,0 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 80,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score pass@1 élevé signifie qu’un modèle produit fréquemment une solution Python fonctionnellement correcte dès sa première proposition, selon la suite de tests de HumanEval+. L’augmentation considérable du nombre de tests renforce la rigueur de la vérification et réduit la probabilité qu’un code incorrect soit accepté faute de cas de contrôle. La comparaison exige néanmoins de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.
Le score médian de 81 % et le résultat de 93 % obtenu par Phi 4 Reasoning suggèrent un niveau global élevé parmi les dix modèles évalués. Cette concentration vers le haut peut réduire le pouvoir discriminant du benchmark à mesure que les performances approchent du plafond. Son accès public invite aussi à considérer un possible risque de contamination lors de l’interprétation des résultats. Enfin, sa portée reste ciblée sur la correction fonctionnelle de programmes Python répondant aux problèmes proposés, et non sur l’ensemble des capacités de programmation ou de raisonnement d’un modèle.
Sources des scores : llm-stats.