SkillsBench

SkillsBench est un benchmark public créé par SkillsBench en 2026 pour évaluer les compétences pratiques d’ingénierie logicielle des agents de codage. Il repose sur des tâches de programmation autonomes, associées à des vérificateurs déterministes.

SkillsBench est un benchmark public créé par SkillsBench en 2026 pour évaluer les compétences pratiques d’ingénierie logicielle des agents de codage. Il repose sur des tâches de programmation autonomes, associées à des vérificateurs déterministes.

Son objectif est de mesurer la capacité des modèles à résoudre différents scénarios de développement logiciel, tout en comparant l’apport de « Skills » sélectionnées à celui de compétences générées automatiquement. Il fournit ainsi un indicateur centré sur l’exécution effective de tâches, plutôt que sur la seule production de réponses théoriques.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSkillsBench (skillsbench.ai)
Capacités mesuréesCompetences pratiques d'ingenierie logicielle des agents de codage ; mesure de l'apport des 'Skills' curees vs auto-generees sur des domaines varies.
ModalitéTexte
Type de questionsTaches de programmation auto-contenues avec verificateurs deterministes
Métrique d'évaluationTaux de reussite (pass rate)
AccèsPublic
LanguesAnglais (code)
Taille du jeu86 taches (84 evaluees) couvrant 11 domaines
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire59,2 %19 mai 2026Auto-déclaré
2Hy3Tencent🟢 Ouvert55,3 %6 juillet 2026Auto-déclaré
3Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire54,9 %31 mai 2026Auto-déclaré
4Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert48,2 %21 avril 2026Auto-déclaré
5Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire45,7 %31 mars 2026Auto-déclaré
6Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert28,7 %16 avril 2026Auto-déclaré

Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 51,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé dans SkillsBench indique qu’un agent réussit une part importante des tâches de programmation selon leurs vérificateurs déterministes. Ce dispositif renforce la rigueur du verdict pour chaque tâche, car la réussite dépend d’un contrôle reproductible. La fiabilité globale des comparaisons doit néanmoins être nuancée, les scores de la base étant majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.

Le meilleur résultat, obtenu par Qwen3.7 Max, reste sensiblement inférieur à un taux de réussite total. Le benchmark ne paraît donc pas saturé dans cet ensemble de cinq modèles. Le classement montre également que le modèle de tête dépasse la médiane, mais l’échantillon restreint invite à interpréter cette hiérarchie dans le seul cadre de SkillsBench. La portée demeure celle de tâches auto-contenues, en anglais pour le code, réparties entre onze domaines. Enfin, l’accès public peut créer un risque de contamination si les tâches sont intégrées aux données ou aux procédures d’optimisation, ce qui pourrait favoriser certains résultats sans refléter une généralisation équivalente à des problèmes nouveaux.


Sources des scores : llm-stats.