Aider
Aider est un benchmark d’édition de code créé en 2023 par Aider-AI, sous l’impulsion de Paul Gauthier. Fondé sur des exercices issus du dépôt Python d’Exercism, il évalue la transformation de consignes de programmation en anglais en code Python exécutable.
Aider est un benchmark d’édition de code créé en 2023 par Aider-AI, sous l’impulsion de Paul Gauthier. Fondé sur des exercices issus du dépôt Python d’Exercism, il évalue la transformation de consignes de programmation en anglais en code Python exécutable.
L’évaluation couvre un processus de bout en bout : produire ou modifier du code existant, formater les changements pour leur enregistrement automatique, puis vérifier leur conformité grâce aux tests unitaires. Aider sert ainsi à comparer les capacités pratiques des modèles sur des tâches de développement structurées.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Aider-AI (Paul Gauthier) |
| Capacités mesurées | Capacité à traduire une demande de codage en langage naturel en code Python exécutable et à l'intégrer dans du code existant |
| Modalité | Texte |
| Type de questions | édition/génération de code |
| Métrique d'évaluation | taux de réussite (% d'exercices dont tous les tests unitaires passent) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | Python (consignes en anglais) |
| Taille du jeu | 133 exercices (dépôt Python d'Exercism) |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel |
Classement des modèles (4)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | DeepSeek-V2.5 | DeepSeek | 72,2 % | 8 mai 2024 | Auto-déclaré |
| 2 | Qwen3 235B A22B | Qwen | 61,8 % | 25 juillet 2025 | Auto-déclaré |
| 3 | Qwen2.5-Coder 7B Instruct | Qwen | 55,6 % | 19 septembre 2024 | Auto-déclaré |
| 4 | Qwen3 32B | Qwen | 50,2 % | 29 avril 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 58,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle parvient fréquemment à interpréter une demande, à l’intégrer correctement dans une base de code et à faire passer l’ensemble des tests unitaires. Cette métrique impose un critère fonctionnel strict : un exercice n’est réussi que si tous ses tests passent. Elle mesure donc un résultat exécutable plutôt qu’une simple ressemblance avec une réponse attendue. La fiabilité comparative doit toutefois être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs.
La portée du benchmark reste centrée sur 133 exercices Python accompagnés de consignes en anglais. Son caractère public et son origine dans Exercism créent aussi un risque de contamination par exposition aux exercices. Avec un meilleur score de 72 %, Aider ne paraît pas saturé dans cet ensemble de résultats. Le classement, limité à quatre modèles, place DeepSeek-V2.5 en tête et le situe nettement au-dessus de la médiane de 59 %. Il met ainsi en évidence un avantage sur cette évaluation précise, sans étendre cette conclusion au-delà de l’édition de code Python mesurée par Aider.
Sources des scores : llm-stats.