Natural2Code

Natural2Code est un benchmark créé par Google DeepMind pour évaluer la génération de code Python à partir d’énoncés en anglais. Les problèmes suivent le format HumanEval et appellent une réponse sous forme de code.

Natural2Code est un benchmark créé par Google DeepMind pour évaluer la génération de code Python à partir d’énoncés en anglais. Les problèmes suivent le format HumanEval et appellent une réponse sous forme de code.

Son jeu interne held-out a été conçu pour limiter les risques de fuite depuis les données du web. Il sert à mesurer la capacité des modèles à produire, dès leur première tentative, une solution correcte à des tâches de programmation variées et proches de requêtes naturelles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle DeepMind
Capacités mesuréesGeneration de code Python sur un jeu held-out interne concu pour eviter la fuite de donnees web
ModalitéTexte
Type de questionsGeneration de code Python (format HumanEval, reponse de code)
Métrique d'évaluationpass@1
AccèsJeu de test privé (réponses non divulguées)
LanguesAnglais (enonces), code Python
Taille du jeu402 problèmes
Année de publication2023
RessourcesArticle scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 2.0 FlashGoogle🔒 Propriétaire92,9 %21 janvier 2025Auto-déclaré
2Gemini 1.5 ProGoogle🔒 Propriétaire85,4 %1 mai 2024Auto-déclaré
3Gemma 3 27BGoogle🟢 Ouvert84,5 %12 mars 2025Auto-déclaré
4Gemma 3 12BGoogle🟢 Ouvert80,7 %12 mars 2025Auto-déclaré
5Gemini 1.5 FlashGoogle🔒 Propriétaire79,8 %1 mai 2024Auto-déclaré
6Gemini 1.5 Flash 8BGoogle🔒 Propriétaire75,5 %15 mars 2024Auto-déclaré
7Gemma 3 4BGoogle🟢 Ouvert70,3 %12 mars 2025Auto-déclaré
8Gemma 3 1BGoogle🟢 Ouvert56,0 %12 mars 2025Auto-déclaré

Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 80,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score pass@1 élevé indique qu’un modèle résout fréquemment les problèmes dès la première réponse, sans sélection parmi plusieurs essais. Le jeu de test privé et la conception held-out renforcent la maîtrise de l’évaluation et visent à réduire la contamination par des contenus web. La confidentialité des réponses limite également leur exposition directe.

L’interprétation demande toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un protocole indépendant. La médiane de 80 % et le meilleur résultat de 93 % suggèrent une concentration dans une zone déjà élevée, susceptible de réduire le pouvoir discriminant entre les modèles les plus performants. La portée reste centrée sur la génération de code Python au format HumanEval et ne résume donc pas l’ensemble des aptitudes de programmation.

Le classement place Gemini 2.0 Flash en tête. Cependant, les huit modèles classés sont édités par Google, également à l’origine du benchmark. Ce périmètre révèle surtout des écarts au sein de l’offre Google et ne constitue pas une comparaison indépendante avec les modèles d’autres éditeurs.


Sources des scores : llm-stats.