Aider-Polyglot Edit
Aider-Polyglot Edit est un benchmark de programmation multilingue créé en 2024 par Aider-AI, sous l’impulsion de Paul Gauthier. Il repose sur une sélection de problèmes difficiles issus d’Exercism et évalue la capacité des modèles à modifier correctement du code dans six langages.
Aider-Polyglot Edit est un benchmark de programmation multilingue créé en 2024 par Aider-AI, sous l’impulsion de Paul Gauthier. Il repose sur une sélection de problèmes difficiles issus d’Exercism et évalue la capacité des modèles à modifier correctement du code dans six langages.
L’évaluation porte autant sur la résolution des exercices que sur le respect du format d’édition attendu. Chaque modèle dispose de deux tentatives et reçoit le retour des tests unitaires, ce qui permet aussi d’observer sa capacité à identifier puis corriger ses erreurs.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Aider-AI (Paul Gauthier) |
| Capacités mesurées | Capacite a editer des fichiers, corriger ses erreurs et resoudre des problemes de programmation multi-langages |
| Modalité | Texte |
| Type de questions | Edition de code / resolution d'exercices de programmation (2 tentatives, retour des tests unitaires) |
| Métrique d'évaluation | Taux de reussite (% de problemes resolus) |
| Accès | Public |
| Licence | Exercices issus d'Exercism (licences open source des pistes Exercism) |
| Langues | anglais pour les consignes ; code en C++, Go, Java, JavaScript, Python et Rust |
| Taille du jeu | 225 problemes (les plus difficiles d'Exercism) sur 6 langages |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 79,7 % | 25 décembre 2024 | Auto-déclaré |
| 2 | Gemini 2.5 Pro | 🔒 Propriétaire | 72,7 % | 20 mai 2025 | Auto-déclaré | |
| 3 | o3-mini | OpenAI | 🔒 Propriétaire | 60,4 % | 30 janvier 2025 | Auto-déclaré |
| 4 | o4-mini | OpenAI | 🔒 Propriétaire | 58,2 % | 16 avril 2025 | Auto-déclaré |
| 5 | Gemini 2.5 Flash | 🔒 Propriétaire | 56,7 % | 20 mai 2025 | Auto-déclaré | |
| 6 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 52,9 % | 14 avril 2025 | Auto-déclaré |
| 7 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 44,9 % | 5 mars 2026 | Auto-déclaré |
| 8 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 31,6 % | 14 avril 2025 | Auto-déclaré |
| 9 | GPT-4o | OpenAI | 🔒 Propriétaire | 18,2 % | 27 mars 2025 | Auto-déclaré |
| 10 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 6,2 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 54,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle résout fréquemment des problèmes difficiles en produisant des modifications de code correctement formatées, puis sait exploiter le retour des tests unitaires lors d’une seconde tentative. Le classement place DeepSeek-V3 nettement au-dessus de la médiane des dix modèles recensés. Son score de 80 % dépasse également la plage de 5 à 50 % initialement visée pour les meilleurs modèles, ce qui suggère que l’échelle peut déjà devenir moins discriminante à mesure que les performances progressent.
La lecture des écarts exige toutefois de la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole de mesure entièrement centralisé. Le caractère public du benchmark et l’origine open source des exercices créent aussi un risque d’exposition préalable des modèles aux contenus. Enfin, sa portée reste ciblée sur l’édition de code et la résolution de problèmes Exercism en C++, Go, Java, JavaScript, Python et Rust. Il renseigne donc sur ces compétences précises, et non sur l’ensemble des aptitudes de programmation d’un modèle.
Sources des scores : llm-stats.