HumanEval+

HumanEval+ est un benchmark créé en 2023 par Jiawei Liu, Chunqiu Steven Xia, Yuyao Wang, Lingming Zhang et d’autres contributeurs d’EvalPlus. Il constitue une version renforcée de HumanEval, destinée à vérifier plus rigoureusement la correction fonctionnelle du code produit par les…

HumanEval+ est un benchmark créé en 2023 par Jiawei Liu, Chunqiu Steven Xia, Yuyao Wang, Lingming Zhang et d’autres contributeurs d’EvalPlus. Il constitue une version renforcée de HumanEval, destinée à vérifier plus rigoureusement la correction fonctionnelle du code produit par les modèles.

Le benchmark évalue la génération de code Python à partir de consignes en anglais. Sa suite de tests unitaires fortement augmentée permet de détecter des solutions erronées qui pouvaient réussir les tests originaux, et d’établir une comparaison plus exigeante des capacités de synthèse de code.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkJiawei Liu, Chunqiu Steven Xia, Yuyao Wang, Lingming Zhang et al. (EvalPlus)
Capacités mesuréesraisonnement
ModalitéTexte
Type de questionsgénération de code Python
Métrique d'évaluationpass@1
AccèsPublic
LicenceApache-2.0
Languesanglais; code Python
Taille du jeu164 problèmes de programmation, avec une suite de tests augmentée d’environ 80× par rapport à HumanEval
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Phi 4 ReasoningMicrosoft🟢 Ouvert92,9 %30 avril 2025Auto-déclaré
2Phi 4 Reasoning PlusMicrosoft🟢 Ouvert92,3 %30 avril 2025Auto-déclaré
3Granite 3.3 8B BaseIBM🟢 Ouvert86,1 %16 avril 2025Auto-déclaré
4Granite 3.3 8B InstructIBM🟢 Ouvert86,1 %16 avril 2025Auto-déclaré
5Phi 4Microsoft🟢 Ouvert82,8 %12 décembre 2024Auto-déclaré
6IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert78,3 %2 mai 2025Auto-déclaré
7MiMo-V2.5-ProXiaomi🟢 Ouvert75,6 %27 avril 2026Auto-déclaré
8Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert52,4 %19 septembre 2024Auto-déclaré
9Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert51,2 %19 septembre 2024Auto-déclaré
10ERNIE 4.5Baidu🔒 Propriétaire25,0 %25 juin 2025Auto-déclaré

Classement établi sur 10 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 80,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score pass@1 élevé signifie qu’un modèle produit fréquemment une solution Python fonctionnellement correcte dès sa première proposition, selon la suite de tests de HumanEval+. L’augmentation considérable du nombre de tests renforce la rigueur de la vérification et réduit la probabilité qu’un code incorrect soit accepté faute de cas de contrôle. La comparaison exige néanmoins de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.

Le score médian de 81 % et le résultat de 93 % obtenu par Phi 4 Reasoning suggèrent un niveau global élevé parmi les dix modèles évalués. Cette concentration vers le haut peut réduire le pouvoir discriminant du benchmark à mesure que les performances approchent du plafond. Son accès public invite aussi à considérer un possible risque de contamination lors de l’interprétation des résultats. Enfin, sa portée reste ciblée sur la correction fonctionnelle de programmes Python répondant aux problèmes proposés, et non sur l’ensemble des capacités de programmation ou de raisonnement d’un modèle.


Sources des scores : llm-stats.