HumanEval
Créé par OpenAI en 2021, HumanEval est un benchmark de génération de code qui évalue la capacité d’un modèle à transformer une spécification rédigée en langage naturel en un programme Python fonctionnel.
Créé par OpenAI en 2021, HumanEval est un benchmark de génération de code qui évalue la capacité d’un modèle à transformer une spécification rédigée en langage naturel en un programme Python fonctionnel.
À partir de docstrings en anglais, il sollicite la compréhension des consignes, le raisonnement algorithmique, la manipulation de chaînes et de listes, ainsi que des mathématiques simples. Il sert à comparer la correction fonctionnelle du code produit, plutôt que sa seule plausibilité syntaxique.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | code, raisonnement |
| Modalité | Texte |
| Type de questions | génération de code à partir de docstrings |
| Métrique d'évaluation | pass@1 |
| Accès | Public |
| Licence | MIT |
| Langues | anglais, Python |
| Taille du jeu | 164 problèmes de programmation |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (65)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 95,1 % | 11 février 2026 | Auto-déclaré |
| 2 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 94,5 % | 5 septembre 2025 | Auto-déclaré |
| 3 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 93,7 % | 22 octobre 2024 | Auto-déclaré |
| 4 | GPT-5 | OpenAI | 🔒 Propriétaire | 93,4 % | 7 août 2025 | Auto-déclaré |
| 5 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 93,3 % | 11 juillet 2025 | Auto-déclaré |
| 6 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,7 % | 19 septembre 2024 | Auto-déclaré |
| 7 | o1-mini | OpenAI | 🔒 Propriétaire | 92,4 % | 12 septembre 2024 | Auto-déclaré |
| 8 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 92,1 % | 6 mars 2026 | Auto-déclaré |
| 9 | Mistral Large 2 | Mistral AI | 🟢 Ouvert | 92,0 % | 24 juillet 2024 | Auto-déclaré |
| 10 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,5 % | 28 février 2025 | Auto-déclaré |
| 11 | GPT-4o | OpenAI | 🔒 Propriétaire | 90,2 % | 27 mars 2025 | Auto-déclaré |
| 12 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 89,7 % | 16 avril 2025 | Auto-déclaré |
| 13 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 89,7 % | 16 avril 2025 | Auto-déclaré |
| 14 | Gemini Diffusion | 🔒 Propriétaire | 89,6 % | 20 mai 2025 | Auto-déclaré | |
| 15 | DeepSeek-V2.5 | DeepSeek | 🟢 Ouvert | 89,0 % | 8 mai 2024 | Auto-déclaré |
| 16 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 89,0 % | 23 juillet 2024 | Auto-déclaré |
| 17 | Nova Pro | Amazon | 🔒 Propriétaire | 89,0 % | 20 novembre 2024 | Auto-déclaré |
| 18 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 88,4 % | 29 août 2025 | Auto-déclaré |
| 19 | Mistral Small 3.1 24B Instruct | Mistral AI | 🟢 Ouvert | 88,4 % | 17 mars 2025 | Auto-déclaré |
| 20 | Grok-2 | xAI | 🔒 Propriétaire | 88,4 % | 13 août 2024 | Auto-déclaré |
| 21 | Llama 3.3 70B Instruct | Meta | 🟢 Ouvert | 88,4 % | 6 décembre 2024 | Auto-déclaré |
| 22 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,4 % | 19 septembre 2024 | Auto-déclaré |
| 23 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,4 % | 19 septembre 2024 | Auto-déclaré |
| 24 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 88,1 % | 4 novembre 2024 | Auto-déclaré |
| 25 | o1 | OpenAI | 🔒 Propriétaire | 88,1 % | 17 décembre 2024 | Auto-déclaré |
| 26 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 88,0 % | 5 mars 2026 | Auto-déclaré |
| 27 | Gemma 3 27B | 🟢 Ouvert | 87,8 % | 12 mars 2025 | Auto-déclaré | |
| 28 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 87,2 % | 18 juillet 2024 | Auto-déclaré |
| 29 | GPT-4 Turbo | OpenAI | 🔒 Propriétaire | 87,1 % | 9 avril 2024 | Auto-déclaré |
| 30 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,6 % | 19 septembre 2024 | Auto-déclaré |
| 31 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,0 % | 23 juillet 2024 | Auto-déclaré |
| 32 | Grok-2 mini | xAI | 🔒 Propriétaire | 85,7 % | 13 août 2024 | Auto-déclaré |
| 33 | Gemma 3 12B | 🟢 Ouvert | 85,4 % | 12 mars 2025 | Auto-déclaré | |
| 34 | Nova Lite | Amazon | 🔒 Propriétaire | 85,4 % | 20 novembre 2024 | Auto-déclaré |
| 35 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 84,9 % | 29 février 2024 | Auto-déclaré |
| 36 | Mistral Small 3 24B Instruct | Mistral AI | 🟢 Ouvert | 84,8 % | 30 janvier 2025 | Auto-déclaré |
| 37 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,8 % | 19 septembre 2024 | Auto-déclaré |
| 38 | Gemini 1.5 Pro | 🔒 Propriétaire | 84,1 % | 1 mai 2024 | Auto-déclaré | |
| 39 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,5 % | 19 septembre 2024 | Auto-déclaré |
| 40 | Phi 4 | Microsoft | 🟢 Ouvert | 82,6 % | 12 décembre 2024 | Auto-déclaré |
| 41 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 82,4 % | 2 mai 2025 | Auto-déclaré |
| 42 | Codestral-22B | Mistral AI | 🟢 Ouvert | 81,1 % | 29 mai 2024 | Auto-déclaré |
| 43 | Nova Micro | Amazon | 🔒 Propriétaire | 81,1 % | 20 novembre 2024 | Auto-déclaré |
| 44 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 80,5 % | 23 juillet 2024 | Auto-déclaré |
| 45 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,9 % | 23 juillet 2024 | Auto-déclaré |
| 46 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,7 % | 27 mars 2025 | Auto-déclaré |
| 47 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 75,9 % | 13 mars 2024 | Auto-déclaré |
| 48 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 75,0 % | 26 juin 2025 | Auto-déclaré | |
| 49 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 75,0 % | 20 mai 2025 | Auto-déclaré | |
| 50 | Gemini 1.5 Flash | 🔒 Propriétaire | 74,3 % | 1 mai 2024 | Auto-déclaré | |
| 51 | Grok-1.5 | xAI | 🔒 Propriétaire | 74,1 % | 28 mars 2024 | Auto-déclaré |
| 52 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 73,0 % | 29 février 2024 | Auto-déclaré |
| 53 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 72,6 % | 23 juillet 2024 | Auto-déclaré |
| 54 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 72,0 % | 17 septembre 2024 | Auto-déclaré |
| 55 | Gemma 3 4B | 🟢 Ouvert | 71,3 % | 12 mars 2025 | Auto-déclaré | |
| 56 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 70,7 % | 23 août 2024 | Auto-déclaré |
| 57 | GPT-3.5 Turbo | OpenAI | 🔒 Propriétaire | 68,0 % | 21 mars 2023 | n.d. |
| 58 | GPT-4 | OpenAI | 🔒 Propriétaire | 67,0 % | 28 août 2023 | Auto-déclaré |
| 59 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 66,5 % | 26 juin 2025 | Auto-déclaré | |
| 60 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 66,5 % | 20 mai 2025 | Auto-déclaré | |
| 61 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 62,8 % | 23 août 2024 | Auto-déclaré |
| 62 | Gemma 2 27B | 🟢 Ouvert | 51,8 % | 27 juin 2024 | Auto-déclaré | |
| 63 | Gemma 3 1B | 🟢 Ouvert | 41,5 % | 12 mars 2025 | Auto-déclaré | |
| 64 | Gemma 2 9B | 🟢 Ouvert | 40,2 % | 27 juin 2024 | Auto-déclaré | |
| 65 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 34,8 % | 16 octobre 2024 | Auto-déclaré |
Classement établi sur 65 modèles évalués, dont 47 de grands éditeurs. Score médian de l'ensemble : 85,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score pass@1 élevé signifie qu’un modèle résout correctement une grande part des problèmes dès sa première proposition. Dans la base, la médiane de 85 % et le meilleur résultat de 95 %, obtenu par MiniCPM-SALA (OpenBMB), signalent des performances déjà très concentrées vers le haut. Cette proximité favorise un effet de saturation et réduit le pouvoir discriminant du benchmark entre les modèles les plus performants.
La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une évaluation centralisée. Le caractère public du jeu crée aussi un risque de contamination, les problèmes pouvant avoir été rencontrés pendant l’entraînement. Enfin, HumanEval couvre une portée ciblée : synthèse de fonctions Python depuis des docstrings en anglais, avec des tâches algorithmiques et mathématiques simples. Le classement renseigne donc surtout sur cette forme précise de génération de code, et non sur l’ensemble des capacités de programmation.
Sources des scores : llm-stats.