NL2Repo
Publié en 2025, NL2Repo est un benchmark public consacré au codage à long horizon. Il demande aux modèles de produire une bibliothèque Python complète à partir d’une spécification rédigée en langage naturel, plutôt que de résoudre un exercice isolé ou de générer un simple fragment de code.
Publié en 2025, NL2Repo est un benchmark public consacré au codage à long horizon. Il demande aux modèles de produire une bibliothèque Python complète à partir d’une spécification rédigée en langage naturel, plutôt que de résoudre un exercice isolé ou de générer un simple fragment de code.
L’évaluation porte sur la conception architecturale, la gestion des dépendances, l’implémentation dans plusieurs fichiers et le packaging autonome d’un dépôt. NL2Repo sert ainsi à mesurer la capacité des modèles à conduire un projet logiciel cohérent à l’échelle d’un dépôt entier.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Capacités mesurées | Codage long-horizon : conception architecturale, gestion des dépendances, implémentation multi-fichiers et packaging d'un dépôt complet de façon autonome |
| Modalité | Texte |
| Type de questions | génération de dépôt complet (bibliothèque Python) à partir d'une spécification en langage naturel |
| Métrique d'évaluation | taux de réussite des tests (test pass rate) |
| Accès | Public |
| Langues | anglais (génère des bibliothèques Python) |
| Taille du jeu | 104 tâches (documents d'entrée ≈19k tokens en moyenne) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 48,9 % | 16 juin 2026 | Auto-déclaré |
| 2 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 47,2 % | 19 mai 2026 | Auto-déclaré |
| 3 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 47,0 % | 24 juin 2026 | Auto-déclaré |
| 4 | Hy3 | Tencent | 🟢 Ouvert | 45,6 % | 6 juillet 2026 | Auto-déclaré |
| 5 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 43,7 % | 24 juin 2026 | Auto-déclaré |
| 6 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 42,7 % | 7 avril 2026 | Auto-déclaré |
| 7 | MiniMax M3 | MiniMax | 🟢 Ouvert | 42,1 % | 1 juin 2026 | Auto-déclaré |
| 8 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 41,1 % | 31 mai 2026 | Auto-déclaré |
| 9 | MiniMax M2.7 | MiniMax | 🟢 Ouvert | 39,8 % | 18 mars 2026 | Auto-déclaré |
| 10 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 37,9 % | 31 mars 2026 | Auto-déclaré |
| 11 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 36,2 % | 21 avril 2026 | Auto-déclaré |
| 12 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 29,4 % | 16 avril 2026 | Auto-déclaré |
Classement établi sur 12 modèles évalués. Score médian de l'ensemble : 42,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’une plus grande proportion des tests associés aux dépôts générés est réussie. Il reflète donc la capacité à transformer une spécification en bibliothèque Python fonctionnelle, avec une architecture, des dépendances et des fichiers correctement articulés. Cette métrique mesure un résultat exécutable, mais la fiabilité comparative doit être nuancée puisque les scores disponibles sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans un cadre de mesure entièrement homogène.
Le meilleur résultat, obtenu par GLM-5.2 à 49 %, reste inférieur à la moitié des tests réussis, ce qui ne suggère pas une saturation du benchmark. Face à une médiane de 42 % sur les 11 modèles évalués, l’écart avec la tête du classement demeure limité et montre que les performances restent regroupées. La portée de NL2Repo est ciblée : spécifications en anglais, génération de bibliothèques Python et tâches de dépôt complet. Son caractère public impose aussi de considérer le risque de contamination lors de l’interprétation des résultats.
Sources des scores : llm-stats.