Aider-Polyglot

Aider-Polyglot est un benchmark de programmation créé en 2024 par Aider, sous l’impulsion de Paul Gauthier. Il évalue des modèles d’IA sur des exercices difficiles issus d’Exercism, couvrant plusieurs langages de programmation.

Aider-Polyglot est un benchmark de programmation créé en 2024 par Aider, sous l’impulsion de Paul Gauthier. Il évalue des modèles d’IA sur des exercices difficiles issus d’Exercism, couvrant plusieurs langages de programmation.

Son protocole mesure à la fois la génération initiale de code et l’édition de fichiers après un échec. Chaque modèle peut effectuer un second essai à partir des erreurs remontées par les tests unitaires. Aider-Polyglot fournit ainsi une évaluation de bout en bout de la résolution de problèmes et de la correction de code.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAider (Paul Gauthier)
Capacités mesuréesgénération de code, édition de fichiers, correction d'erreurs sur retour de tests, multi-langages
ModalitéTexte
Type de questionsexercices de programmation (Exercism) avec édition de fichiers; 2 essais avec retour des erreurs de tests unitaires
Métrique d'évaluationtaux de réussite (% d'exercices résolus, tests passants)
AccèsPublic
LanguesC++, Go, Java, JavaScript, Python, Rust
Taille du jeu225 exercices Exercism (les plus difficiles, résolus par ≤3 modèles), 6 langages
Année de publication2024
RessourcesSite / dépôt officiel

Classement des modèles (22)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5OpenAI🔒 Propriétaire88,0 %7 août 2025Auto-déclaré
2Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire82,2 %5 juin 2025Auto-déclaré
3o3OpenAI🔒 Propriétaire81,3 %16 avril 2025Auto-déclaré
4Gemini 2.5 ProGoogle🔒 Propriétaire76,5 %20 mai 2025Auto-déclaré
5DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert74,5 %29 septembre 2025Auto-déclaré
6DeepSeek-R1-0528DeepSeek🟢 Ouvert71,6 %28 mai 2025Auto-déclaré
7o4-miniOpenAI🔒 Propriétaire68,9 %16 avril 2025Auto-déclaré
8DeepSeek-V3.1DeepSeek🟢 Ouvert68,4 %10 janvier 2025Auto-déclaré
9o3-miniOpenAI🔒 Propriétaire66,7 %30 janvier 2025Auto-déclaré
10Gemini 2.5 FlashGoogle🔒 Propriétaire61,9 %20 mai 2025Auto-déclaré
11Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team🟢 Ouvert61,8 %31 janvier 2025Auto-déclaré
12Kimi K2 InstructMoonshot AI🟢 Ouvert60,0 %11 juillet 2025Auto-déclaré
13Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert60,0 %5 septembre 2025Auto-déclaré
14Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert57,3 %22 juillet 2025Auto-déclaré
15GPT-4.1OpenAI🔒 Propriétaire51,6 %14 avril 2025Auto-déclaré
16Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert49,8 %10 septembre 2025Auto-déclaré
17DeepSeek-V3DeepSeek🟢 Ouvert49,6 %25 décembre 2024Auto-déclaré
18Magistral MediumMistral AI🟢 Ouvert47,1 %10 juin 2025Auto-déclaré
19GPT-4.1 miniOpenAI🔒 Propriétaire34,7 %14 avril 2025Auto-déclaré
20GPT-4oOpenAI🔒 Propriétaire30,7 %27 mars 2025Auto-déclaré
21Gemini 2.5 Flash-LiteGoogle🟢 Ouvert26,7 %17 juin 2025Auto-déclaré
22GPT-4.1 nanoOpenAI🔒 Propriétaire9,8 %14 avril 2025Auto-déclaré

Classement établi sur 22 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 60,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle résout une grande part des exercices avec des tests passants, soit dès sa première proposition, soit après correction à partir du retour des tests. Le protocole est plus exigeant qu’une génération de code isolée, car il vérifie le résultat par des tests unitaires et évalue aussi la capacité d’édition. La comparaison doit néanmoins rester prudente, puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans une campagne de mesure unique. Le caractère public du benchmark et l’origine Exercism de ses exercices créent également un risque de contamination. Sa portée reste centrée sur 225 exercices particulièrement difficiles et sur six langages, sans représenter toutes les formes de développement logiciel. Avec une médiane de 61 % parmi les 22 modèles évalués et un meilleur résultat de 88 % pour GPT-5, le classement met en évidence des écarts importants de maîtrise, tout en conservant une marge avant une éventuelle saturation complète du jeu.


Sources des scores : llm-stats.