Aider-Polyglot Edit

Aider-Polyglot Edit est un benchmark de programmation multilingue créé en 2024 par Aider-AI, sous l’impulsion de Paul Gauthier. Il repose sur une sélection de problèmes difficiles issus d’Exercism et évalue la capacité des modèles à modifier correctement du code dans six langages.

Aider-Polyglot Edit est un benchmark de programmation multilingue créé en 2024 par Aider-AI, sous l’impulsion de Paul Gauthier. Il repose sur une sélection de problèmes difficiles issus d’Exercism et évalue la capacité des modèles à modifier correctement du code dans six langages.

L’évaluation porte autant sur la résolution des exercices que sur le respect du format d’édition attendu. Chaque modèle dispose de deux tentatives et reçoit le retour des tests unitaires, ce qui permet aussi d’observer sa capacité à identifier puis corriger ses erreurs.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAider-AI (Paul Gauthier)
Capacités mesuréesCapacite a editer des fichiers, corriger ses erreurs et resoudre des problemes de programmation multi-langages
ModalitéTexte
Type de questionsEdition de code / resolution d'exercices de programmation (2 tentatives, retour des tests unitaires)
Métrique d'évaluationTaux de reussite (% de problemes resolus)
AccèsPublic
LicenceExercices issus d'Exercism (licences open source des pistes Exercism)
Languesanglais pour les consignes ; code en C++, Go, Java, JavaScript, Python et Rust
Taille du jeu225 problemes (les plus difficiles d'Exercism) sur 6 langages
Année de publication2024
RessourcesSite / dépôt officiel

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek-V3DeepSeek🟢 Ouvert79,7 %25 décembre 2024Auto-déclaré
2Gemini 2.5 ProGoogle🔒 Propriétaire72,7 %20 mai 2025Auto-déclaré
3o3-miniOpenAI🔒 Propriétaire60,4 %30 janvier 2025Auto-déclaré
4o4-miniOpenAI🔒 Propriétaire58,2 %16 avril 2025Auto-déclaré
5Gemini 2.5 FlashGoogle🔒 Propriétaire56,7 %20 mai 2025Auto-déclaré
6GPT-4.1OpenAI🔒 Propriétaire52,9 %14 avril 2025Auto-déclaré
7GPT-4.5OpenAI🔒 Propriétaire44,9 %5 mars 2026Auto-déclaré
8GPT-4.1 miniOpenAI🔒 Propriétaire31,6 %14 avril 2025Auto-déclaré
9GPT-4oOpenAI🔒 Propriétaire18,2 %27 mars 2025Auto-déclaré
10GPT-4.1 nanoOpenAI🔒 Propriétaire6,2 %14 avril 2025Auto-déclaré

Classement établi sur 10 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 54,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle résout fréquemment des problèmes difficiles en produisant des modifications de code correctement formatées, puis sait exploiter le retour des tests unitaires lors d’une seconde tentative. Le classement place DeepSeek-V3 nettement au-dessus de la médiane des dix modèles recensés. Son score de 80 % dépasse également la plage de 5 à 50 % initialement visée pour les meilleurs modèles, ce qui suggère que l’échelle peut déjà devenir moins discriminante à mesure que les performances progressent.

La lecture des écarts exige toutefois de la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole de mesure entièrement centralisé. Le caractère public du benchmark et l’origine open source des exercices créent aussi un risque d’exposition préalable des modèles aux contenus. Enfin, sa portée reste ciblée sur l’édition de code et la résolution de problèmes Exercism en C++, Go, Java, JavaScript, Python et Rust. Il renseigne donc sur ces compétences précises, et non sur l’ensemble des aptitudes de programmation d’un modèle.


Sources des scores : llm-stats.