Aider-Polyglot
Aider-Polyglot est un benchmark de programmation créé en 2024 par Aider, sous l’impulsion de Paul Gauthier. Il évalue des modèles d’IA sur des exercices difficiles issus d’Exercism, couvrant plusieurs langages de programmation.
Aider-Polyglot est un benchmark de programmation créé en 2024 par Aider, sous l’impulsion de Paul Gauthier. Il évalue des modèles d’IA sur des exercices difficiles issus d’Exercism, couvrant plusieurs langages de programmation.
Son protocole mesure à la fois la génération initiale de code et l’édition de fichiers après un échec. Chaque modèle peut effectuer un second essai à partir des erreurs remontées par les tests unitaires. Aider-Polyglot fournit ainsi une évaluation de bout en bout de la résolution de problèmes et de la correction de code.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Aider (Paul Gauthier) |
| Capacités mesurées | génération de code, édition de fichiers, correction d'erreurs sur retour de tests, multi-langages |
| Modalité | Texte |
| Type de questions | exercices de programmation (Exercism) avec édition de fichiers; 2 essais avec retour des erreurs de tests unitaires |
| Métrique d'évaluation | taux de réussite (% d'exercices résolus, tests passants) |
| Accès | Public |
| Langues | C++, Go, Java, JavaScript, Python, Rust |
| Taille du jeu | 225 exercices Exercism (les plus difficiles, résolus par ≤3 modèles), 6 langages |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Classement des modèles (22)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 🔒 Propriétaire | 88,0 % | 7 août 2025 | Auto-déclaré |
| 2 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 82,2 % | 5 juin 2025 | Auto-déclaré | |
| 3 | o3 | OpenAI | 🔒 Propriétaire | 81,3 % | 16 avril 2025 | Auto-déclaré |
| 4 | Gemini 2.5 Pro | 🔒 Propriétaire | 76,5 % | 20 mai 2025 | Auto-déclaré | |
| 5 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 74,5 % | 29 septembre 2025 | Auto-déclaré |
| 6 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 71,6 % | 28 mai 2025 | Auto-déclaré |
| 7 | o4-mini | OpenAI | 🔒 Propriétaire | 68,9 % | 16 avril 2025 | Auto-déclaré |
| 8 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 68,4 % | 10 janvier 2025 | Auto-déclaré |
| 9 | o3-mini | OpenAI | 🔒 Propriétaire | 66,7 % | 30 janvier 2025 | Auto-déclaré |
| 10 | Gemini 2.5 Flash | 🔒 Propriétaire | 61,9 % | 20 mai 2025 | Auto-déclaré | |
| 11 | Qwen3-Coder 480B A35B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,8 % | 31 janvier 2025 | Auto-déclaré |
| 12 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 60,0 % | 11 juillet 2025 | Auto-déclaré |
| 13 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 60,0 % | 5 septembre 2025 | Auto-déclaré |
| 14 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,3 % | 22 juillet 2025 | Auto-déclaré |
| 15 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 51,6 % | 14 avril 2025 | Auto-déclaré |
| 16 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,8 % | 10 septembre 2025 | Auto-déclaré |
| 17 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 49,6 % | 25 décembre 2024 | Auto-déclaré |
| 18 | Magistral Medium | Mistral AI | 🟢 Ouvert | 47,1 % | 10 juin 2025 | Auto-déclaré |
| 19 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 34,7 % | 14 avril 2025 | Auto-déclaré |
| 20 | GPT-4o | OpenAI | 🔒 Propriétaire | 30,7 % | 27 mars 2025 | Auto-déclaré |
| 21 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 26,7 % | 17 juin 2025 | Auto-déclaré | |
| 22 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 9,8 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 22 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 60,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle résout une grande part des exercices avec des tests passants, soit dès sa première proposition, soit après correction à partir du retour des tests. Le protocole est plus exigeant qu’une génération de code isolée, car il vérifie le résultat par des tests unitaires et évalue aussi la capacité d’édition. La comparaison doit néanmoins rester prudente, puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans une campagne de mesure unique. Le caractère public du benchmark et l’origine Exercism de ses exercices créent également un risque de contamination. Sa portée reste centrée sur 225 exercices particulièrement difficiles et sur six langages, sans représenter toutes les formes de développement logiciel. Avec une médiane de 61 % parmi les 22 modèles évalués et un meilleur résultat de 88 % pour GPT-5, le classement met en évidence des écarts importants de maîtrise, tout en conservant une marge avant une éventuelle saturation complète du jeu.
Sources des scores : llm-stats.