HumanEval

Créé par OpenAI en 2021, HumanEval est un benchmark de génération de code qui évalue la capacité d’un modèle à transformer une spécification rédigée en langage naturel en un programme Python fonctionnel.

Créé par OpenAI en 2021, HumanEval est un benchmark de génération de code qui évalue la capacité d’un modèle à transformer une spécification rédigée en langage naturel en un programme Python fonctionnel.

À partir de docstrings en anglais, il sollicite la compréhension des consignes, le raisonnement algorithmique, la manipulation de chaînes et de listes, ainsi que des mathématiques simples. Il sert à comparer la correction fonctionnelle du code produit, plutôt que sa seule plausibilité syntaxique.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréescode, raisonnement
ModalitéTexte
Type de questionsgénération de code à partir de docstrings
Métrique d'évaluationpass@1
AccèsPublic
LicenceMIT
Languesanglais, Python
Taille du jeu164 problèmes de programmation
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (65)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiniCPM-SALAOpenBMB🟢 Ouvert95,1 %11 février 2026Auto-déclaré
2Kimi K2 0905Moonshot AI🔒 Propriétaire94,5 %5 septembre 2025Auto-déclaré
3Claude 3.5 SonnetAnthropic🔒 Propriétaire93,7 %22 octobre 2024Auto-déclaré
4GPT-5OpenAI🔒 Propriétaire93,4 %7 août 2025Auto-déclaré
5Kimi K2 InstructMoonshot AI🟢 Ouvert93,3 %11 juillet 2025Auto-déclaré
6Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert92,7 %19 septembre 2024Auto-déclaré
7o1-miniOpenAI🔒 Propriétaire92,4 %12 septembre 2024Auto-déclaré
8Sarvam-30BSarvam AI🟢 Ouvert92,1 %6 mars 2026Auto-déclaré
9Mistral Large 2Mistral AI🟢 Ouvert92,0 %24 juillet 2024Auto-déclaré
10Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert91,5 %28 février 2025Auto-déclaré
11GPT-4oOpenAI🔒 Propriétaire90,2 %27 mars 2025Auto-déclaré
12Granite 3.3 8B BaseIBM🟢 Ouvert89,7 %16 avril 2025Auto-déclaré
13Granite 3.3 8B InstructIBM🟢 Ouvert89,7 %16 avril 2025Auto-déclaré
14Gemini DiffusionGoogle🔒 Propriétaire89,6 %20 mai 2025Auto-déclaré
15DeepSeek-V2.5DeepSeek🟢 Ouvert89,0 %8 mai 2024Auto-déclaré
16Llama 3.1 405B InstructMeta🟢 Ouvert89,0 %23 juillet 2024Auto-déclaré
17Nova ProAmazon🔒 Propriétaire89,0 %20 novembre 2024Auto-déclaré
18LongCat-Flash-ChatMeituan🟢 Ouvert88,4 %29 août 2025Auto-déclaré
19Mistral Small 3.1 24B InstructMistral AI🟢 Ouvert88,4 %17 mars 2025Auto-déclaré
20Grok-2xAI🔒 Propriétaire88,4 %13 août 2024Auto-déclaré
21Llama 3.3 70B InstructMeta🟢 Ouvert88,4 %6 décembre 2024Auto-déclaré
22Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,4 %19 septembre 2024Auto-déclaré
23Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,4 %19 septembre 2024Auto-déclaré
24Claude 3.5 HaikuAnthropic🔒 Propriétaire88,1 %4 novembre 2024Auto-déclaré
25o1OpenAI🔒 Propriétaire88,1 %17 décembre 2024Auto-déclaré
26GPT-4.5OpenAI🔒 Propriétaire88,0 %5 mars 2026Auto-déclaré
27Gemma 3 27BGoogle🟢 Ouvert87,8 %12 mars 2025Auto-déclaré
28GPT-4o miniOpenAI🔒 Propriétaire87,2 %18 juillet 2024Auto-déclaré
29GPT-4 TurboOpenAI🔒 Propriétaire87,1 %9 avril 2024Auto-déclaré
30Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert86,6 %19 septembre 2024Auto-déclaré
31Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert86,0 %23 juillet 2024Auto-déclaré
32Grok-2 minixAI🔒 Propriétaire85,7 %13 août 2024Auto-déclaré
33Gemma 3 12BGoogle🟢 Ouvert85,4 %12 mars 2025Auto-déclaré
34Nova LiteAmazon🔒 Propriétaire85,4 %20 novembre 2024Auto-déclaré
35Claude 3 OpusAnthropic🔒 Propriétaire84,9 %29 février 2024Auto-déclaré
36Mistral Small 3 24B InstructMistral AI🟢 Ouvert84,8 %30 janvier 2025Auto-déclaré
37Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,8 %19 septembre 2024Auto-déclaré
38Gemini 1.5 ProGoogle🔒 Propriétaire84,1 %1 mai 2024Auto-déclaré
39Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,5 %19 septembre 2024Auto-déclaré
40Phi 4Microsoft🟢 Ouvert82,6 %12 décembre 2024Auto-déclaré
41IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert82,4 %2 mai 2025Auto-déclaré
42Codestral-22BMistral AI🟢 Ouvert81,1 %29 mai 2024Auto-déclaré
43Nova MicroAmazon🔒 Propriétaire81,1 %20 novembre 2024Auto-déclaré
44Llama 3.1 70B InstructMeta🟢 Ouvert80,5 %23 juillet 2024Auto-déclaré
45Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert79,9 %23 juillet 2024Auto-déclaré
46Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert78,7 %27 mars 2025Auto-déclaré
47Claude 3 HaikuAnthropic🔒 Propriétaire75,9 %13 mars 2024Auto-déclaré
48Gemma 3n E4B InstructedGoogle🔒 Propriétaire75,0 %26 juin 2025Auto-déclaré
49Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert75,0 %20 mai 2025Auto-déclaré
50Gemini 1.5 FlashGoogle🔒 Propriétaire74,3 %1 mai 2024Auto-déclaré
51Grok-1.5xAI🔒 Propriétaire74,1 %28 mars 2024Auto-déclaré
52Claude 3 SonnetAnthropic🔒 Propriétaire73,0 %29 février 2024Auto-déclaré
53Llama 3.1 8B InstructMeta🟢 Ouvert72,6 %23 juillet 2024Auto-déclaré
54Pixtral-12BMistral AI🟢 Ouvert72,0 %17 septembre 2024Auto-déclaré
55Gemma 3 4BGoogle🟢 Ouvert71,3 %12 mars 2025Auto-déclaré
56Phi-3.5-MoE-instructMicrosoft🟢 Ouvert70,7 %23 août 2024Auto-déclaré
57GPT-3.5 TurboOpenAI🔒 Propriétaire68,0 %21 mars 2023n.d.
58GPT-4OpenAI🔒 Propriétaire67,0 %28 août 2023Auto-déclaré
59Gemma 3n E2B InstructedGoogle🔒 Propriétaire66,5 %26 juin 2025Auto-déclaré
60Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert66,5 %20 mai 2025Auto-déclaré
61Phi-3.5-mini-instructMicrosoft🟢 Ouvert62,8 %23 août 2024Auto-déclaré
62Gemma 2 27BGoogle🟢 Ouvert51,8 %27 juin 2024Auto-déclaré
63Gemma 3 1BGoogle🟢 Ouvert41,5 %12 mars 2025Auto-déclaré
64Gemma 2 9BGoogle🟢 Ouvert40,2 %27 juin 2024Auto-déclaré
65Ministral 8B InstructMistral AI🟢 Ouvert34,8 %16 octobre 2024Auto-déclaré

Classement établi sur 65 modèles évalués, dont 47 de grands éditeurs. Score médian de l'ensemble : 85,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score pass@1 élevé signifie qu’un modèle résout correctement une grande part des problèmes dès sa première proposition. Dans la base, la médiane de 85 % et le meilleur résultat de 95 %, obtenu par MiniCPM-SALA (OpenBMB), signalent des performances déjà très concentrées vers le haut. Cette proximité favorise un effet de saturation et réduit le pouvoir discriminant du benchmark entre les modèles les plus performants.

La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une évaluation centralisée. Le caractère public du jeu crée aussi un risque de contamination, les problèmes pouvant avoir été rencontrés pendant l’entraînement. Enfin, HumanEval couvre une portée ciblée : synthèse de fonctions Python depuis des docstrings en anglais, avec des tâches algorithmiques et mathématiques simples. Le classement renseigne donc surtout sur cette forme précise de génération de code, et non sur l’ensemble des capacités de programmation.


Sources des scores : llm-stats.