NL2Repo

Publié en 2025, NL2Repo est un benchmark public consacré au codage à long horizon. Il demande aux modèles de produire une bibliothèque Python complète à partir d’une spécification rédigée en langage naturel, plutôt que de résoudre un exercice isolé ou de générer un simple fragment de code.

Publié en 2025, NL2Repo est un benchmark public consacré au codage à long horizon. Il demande aux modèles de produire une bibliothèque Python complète à partir d’une spécification rédigée en langage naturel, plutôt que de résoudre un exercice isolé ou de générer un simple fragment de code.

L’évaluation porte sur la conception architecturale, la gestion des dépendances, l’implémentation dans plusieurs fichiers et le packaging autonome d’un dépôt. NL2Repo sert ainsi à mesurer la capacité des modèles à conduire un projet logiciel cohérent à l’échelle d’un dépôt entier.

Carte d'identité

CaractéristiqueValeur
Capacités mesuréesCodage long-horizon : conception architecturale, gestion des dépendances, implémentation multi-fichiers et packaging d'un dépôt complet de façon autonome
ModalitéTexte
Type de questionsgénération de dépôt complet (bibliothèque Python) à partir d'une spécification en langage naturel
Métrique d'évaluationtaux de réussite des tests (test pass rate)
AccèsPublic
Languesanglais (génère des bibliothèques Python)
Taille du jeu104 tâches (documents d'entrée ≈19k tokens en moyenne)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (12)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GLM-5.2Zhipu AI🟢 Ouvert48,9 %16 juin 2026Auto-déclaré
2Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire47,2 %19 mai 2026Auto-déclaré
3Seed 2.1 ProByteDance🔒 Propriétaire47,0 %24 juin 2026Auto-déclaré
4Hy3Tencent🟢 Ouvert45,6 %6 juillet 2026Auto-déclaré
5Seed 2.1 TurboByteDance🔒 Propriétaire43,7 %24 juin 2026Auto-déclaré
6GLM-5.1Zhipu AI🟢 Ouvert42,7 %7 avril 2026Auto-déclaré
7MiniMax M3MiniMax🟢 Ouvert42,1 %1 juin 2026Auto-déclaré
8Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire41,1 %31 mai 2026Auto-déclaré
9MiniMax M2.7MiniMax🟢 Ouvert39,8 %18 mars 2026Auto-déclaré
10Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire37,9 %31 mars 2026Auto-déclaré
11Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert36,2 %21 avril 2026Auto-déclaré
12Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert29,4 %16 avril 2026Auto-déclaré

Classement établi sur 12 modèles évalués. Score médian de l'ensemble : 42,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’une plus grande proportion des tests associés aux dépôts générés est réussie. Il reflète donc la capacité à transformer une spécification en bibliothèque Python fonctionnelle, avec une architecture, des dépendances et des fichiers correctement articulés. Cette métrique mesure un résultat exécutable, mais la fiabilité comparative doit être nuancée puisque les scores disponibles sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans un cadre de mesure entièrement homogène.

Le meilleur résultat, obtenu par GLM-5.2 à 49 %, reste inférieur à la moitié des tests réussis, ce qui ne suggère pas une saturation du benchmark. Face à une médiane de 42 % sur les 11 modèles évalués, l’écart avec la tête du classement demeure limité et montre que les performances restent regroupées. La portée de NL2Repo est ciblée : spécifications en anglais, génération de bibliothèques Python et tâches de dépôt complet. Son caractère public impose aussi de considérer le risque de contamination lors de l’interprétation des résultats.


Sources des scores : llm-stats.