Aider

Aider est un benchmark d’édition de code créé en 2023 par Aider-AI, sous l’impulsion de Paul Gauthier. Fondé sur des exercices issus du dépôt Python d’Exercism, il évalue la transformation de consignes de programmation en anglais en code Python exécutable.

Aider est un benchmark d’édition de code créé en 2023 par Aider-AI, sous l’impulsion de Paul Gauthier. Fondé sur des exercices issus du dépôt Python d’Exercism, il évalue la transformation de consignes de programmation en anglais en code Python exécutable.

L’évaluation couvre un processus de bout en bout : produire ou modifier du code existant, formater les changements pour leur enregistrement automatique, puis vérifier leur conformité grâce aux tests unitaires. Aider sert ainsi à comparer les capacités pratiques des modèles sur des tâches de développement structurées.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAider-AI (Paul Gauthier)
Capacités mesuréesCapacité à traduire une demande de codage en langage naturel en code Python exécutable et à l'intégrer dans du code existant
ModalitéTexte
Type de questionsédition/génération de code
Métrique d'évaluationtaux de réussite (% d'exercices dont tous les tests unitaires passent)
AccèsPublic
LicenceApache-2.0
LanguesPython (consignes en anglais)
Taille du jeu133 exercices (dépôt Python d'Exercism)
Année de publication2023
RessourcesSite / dépôt officiel

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1DeepSeek-V2.5DeepSeek72,2 %8 mai 2024Auto-déclaré
2Qwen3 235B A22BQwen61,8 %25 juillet 2025Auto-déclaré
3Qwen2.5-Coder 7B InstructQwen55,6 %19 septembre 2024Auto-déclaré
4Qwen3 32BQwen50,2 %29 avril 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 58,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle parvient fréquemment à interpréter une demande, à l’intégrer correctement dans une base de code et à faire passer l’ensemble des tests unitaires. Cette métrique impose un critère fonctionnel strict : un exercice n’est réussi que si tous ses tests passent. Elle mesure donc un résultat exécutable plutôt qu’une simple ressemblance avec une réponse attendue. La fiabilité comparative doit toutefois être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs.

La portée du benchmark reste centrée sur 133 exercices Python accompagnés de consignes en anglais. Son caractère public et son origine dans Exercism créent aussi un risque de contamination par exposition aux exercices. Avec un meilleur score de 72 %, Aider ne paraît pas saturé dans cet ensemble de résultats. Le classement, limité à quatre modèles, place DeepSeek-V2.5 en tête et le situe nettement au-dessus de la médiane de 59 %. Il met ainsi en évidence un avantage sur cette évaluation précise, sans étendre cette conclusion au-delà de l’édition de code Python mesurée par Aider.


Sources des scores : llm-stats.