SkillsBench
SkillsBench est un benchmark public créé par SkillsBench en 2026 pour évaluer les compétences pratiques d’ingénierie logicielle des agents de codage. Il repose sur des tâches de programmation autonomes, associées à des vérificateurs déterministes.
SkillsBench est un benchmark public créé par SkillsBench en 2026 pour évaluer les compétences pratiques d’ingénierie logicielle des agents de codage. Il repose sur des tâches de programmation autonomes, associées à des vérificateurs déterministes.
Son objectif est de mesurer la capacité des modèles à résoudre différents scénarios de développement logiciel, tout en comparant l’apport de « Skills » sélectionnées à celui de compétences générées automatiquement. Il fournit ainsi un indicateur centré sur l’exécution effective de tâches, plutôt que sur la seule production de réponses théoriques.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | SkillsBench (skillsbench.ai) |
| Capacités mesurées | Competences pratiques d'ingenierie logicielle des agents de codage ; mesure de l'apport des 'Skills' curees vs auto-generees sur des domaines varies. |
| Modalité | Texte |
| Type de questions | Taches de programmation auto-contenues avec verificateurs deterministes |
| Métrique d'évaluation | Taux de reussite (pass rate) |
| Accès | Public |
| Langues | Anglais (code) |
| Taille du jeu | 86 taches (84 evaluees) couvrant 11 domaines |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 59,2 % | 19 mai 2026 | Auto-déclaré |
| 2 | Hy3 | Tencent | 🟢 Ouvert | 55,3 % | 6 juillet 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 54,9 % | 31 mai 2026 | Auto-déclaré |
| 4 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 48,2 % | 21 avril 2026 | Auto-déclaré |
| 5 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 45,7 % | 31 mars 2026 | Auto-déclaré |
| 6 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 28,7 % | 16 avril 2026 | Auto-déclaré |
Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 51,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé dans SkillsBench indique qu’un agent réussit une part importante des tâches de programmation selon leurs vérificateurs déterministes. Ce dispositif renforce la rigueur du verdict pour chaque tâche, car la réussite dépend d’un contrôle reproductible. La fiabilité globale des comparaisons doit néanmoins être nuancée, les scores de la base étant majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.
Le meilleur résultat, obtenu par Qwen3.7 Max, reste sensiblement inférieur à un taux de réussite total. Le benchmark ne paraît donc pas saturé dans cet ensemble de cinq modèles. Le classement montre également que le modèle de tête dépasse la médiane, mais l’échantillon restreint invite à interpréter cette hiérarchie dans le seul cadre de SkillsBench. La portée demeure celle de tâches auto-contenues, en anglais pour le code, réparties entre onze domaines. Enfin, l’accès public peut créer un risque de contamination si les tâches sont intégrées aux données ou aux procédures d’optimisation, ce qui pourrait favoriser certains résultats sans refléter une généralisation équivalente à des problèmes nouveaux.
Sources des scores : llm-stats.