Natural2Code
Natural2Code est un benchmark créé par Google DeepMind pour évaluer la génération de code Python à partir d’énoncés en anglais. Les problèmes suivent le format HumanEval et appellent une réponse sous forme de code.
Natural2Code est un benchmark créé par Google DeepMind pour évaluer la génération de code Python à partir d’énoncés en anglais. Les problèmes suivent le format HumanEval et appellent une réponse sous forme de code.
Son jeu interne held-out a été conçu pour limiter les risques de fuite depuis les données du web. Il sert à mesurer la capacité des modèles à produire, dès leur première tentative, une solution correcte à des tâches de programmation variées et proches de requêtes naturelles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google DeepMind |
| Capacités mesurées | Generation de code Python sur un jeu held-out interne concu pour eviter la fuite de donnees web |
| Modalité | Texte |
| Type de questions | Generation de code Python (format HumanEval, reponse de code) |
| Métrique d'évaluation | pass@1 |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | Anglais (enonces), code Python |
| Taille du jeu | 402 problèmes |
| Année de publication | 2023 |
| Ressources | Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 2.0 Flash | 🔒 Propriétaire | 92,9 % | 21 janvier 2025 | Auto-déclaré | |
| 2 | Gemini 1.5 Pro | 🔒 Propriétaire | 85,4 % | 1 mai 2024 | Auto-déclaré | |
| 3 | Gemma 3 27B | 🟢 Ouvert | 84,5 % | 12 mars 2025 | Auto-déclaré | |
| 4 | Gemma 3 12B | 🟢 Ouvert | 80,7 % | 12 mars 2025 | Auto-déclaré | |
| 5 | Gemini 1.5 Flash | 🔒 Propriétaire | 79,8 % | 1 mai 2024 | Auto-déclaré | |
| 6 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 75,5 % | 15 mars 2024 | Auto-déclaré | |
| 7 | Gemma 3 4B | 🟢 Ouvert | 70,3 % | 12 mars 2025 | Auto-déclaré | |
| 8 | Gemma 3 1B | 🟢 Ouvert | 56,0 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 80,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score pass@1 élevé indique qu’un modèle résout fréquemment les problèmes dès la première réponse, sans sélection parmi plusieurs essais. Le jeu de test privé et la conception held-out renforcent la maîtrise de l’évaluation et visent à réduire la contamination par des contenus web. La confidentialité des réponses limite également leur exposition directe.
L’interprétation demande toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un protocole indépendant. La médiane de 80 % et le meilleur résultat de 93 % suggèrent une concentration dans une zone déjà élevée, susceptible de réduire le pouvoir discriminant entre les modèles les plus performants. La portée reste centrée sur la génération de code Python au format HumanEval et ne résume donc pas l’ensemble des aptitudes de programmation.
Le classement place Gemini 2.0 Flash en tête. Cependant, les huit modèles classés sont édités par Google, également à l’origine du benchmark. Ce périmètre révèle surtout des écarts au sein de l’offre Google et ne constitue pas une comparaison indépendante avec les modèles d’autres éditeurs.
Sources des scores : llm-stats.