Multi-SWE-Bench

Multi-SWE-Bench est un benchmark publié en 2025 par l’équipe Seed de ByteDance, associée à Doubao. Il évalue la capacité des grands modèles de langage à résoudre des problèmes logiciels réels dans plusieurs écosystèmes de programmation, en dépassant le périmètre principalement centré sur…

Multi-SWE-Bench est un benchmark publié en 2025 par l’équipe Seed de ByteDance, associée à Doubao. Il évalue la capacité des grands modèles de langage à résoudre des problèmes logiciels réels dans plusieurs écosystèmes de programmation, en dépassant le périmètre principalement centré sur Python de SWE-bench.

Chaque tâche consiste à produire un patch à partir d’une issue GitHub, puis à en vérifier la validité grâce aux tests du dépôt. Multi-SWE-Bench sert ainsi à comparer les modèles sur une activité concrète de maintenance logicielle multilingue.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkByteDance (equipe Seed / Doubao)
Capacités mesuréesEvalue la capacite des LLM a resoudre des problemes logiciels reels dans des ecosystemes de programmation varies, au-dela du seul Python de SWE-bench.
ModalitéTexte
Type de questionsResolution d'issues logicielles (generation de patch a partir d'un bug GitHub, verifie par tests)
Métrique d'évaluationTaux de resolution (% d'instances resolues, pass@1) verifie via les tests unitaires du depot
AccèsPublic
Langues7 langages de programmation : Java, TypeScript, JavaScript, Go, Rust, C, C++
Taille du jeu1 632 instances (annotees a partir de 2 456 candidats par 68 experts)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiniMax M2.7MiniMax🟢 Ouvert52,7 %18 mars 2026Auto-déclaré
2MiniMax M2.5MiniMax🟢 Ouvert51,3 %12 février 2026Auto-déclaré
3MiniMax M2.1MiniMax🟢 Ouvert49,4 %23 décembre 2025Auto-déclaré
4Kimi K2 0905Moonshot AI🔒 Propriétaire41,9 %5 septembre 2025Auto-déclaré
5MiniMax M2MiniMax🟢 Ouvert36,2 %27 octobre 2025Auto-déclaré
6Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team🟢 Ouvert25,8 %31 janvier 2025Auto-déclaré

Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 45,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle résout correctement une part importante des issues dès sa première proposition, selon la validation par les tests unitaires du dépôt. Cette vérification automatisée apporte un critère mesurable, plus robuste qu’une appréciation subjective de la qualité du code. La constitution du jeu renforce aussi sa rigueur, avec 1 632 instances issues de 2 456 candidats et annotées par 68 experts. La comparabilité doit néanmoins être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs.

Le classement montre des performances encore regroupées dans une plage relativement étroite : MiniMax M2.7 atteint 53 %, contre une médiane de 46 % parmi les six modèles évalués. Cet écart ne traduit pas une saturation manifeste au sommet, tandis qu’une part importante des problèmes reste non résolue. La portée du benchmark demeure ciblée sur la résolution d’issues vérifiable par tests dans sept langages. Il mesure donc une compétence de maintenance logicielle concrète et diversifiée, plutôt qu’une aptitude générale à toutes les formes de développement.


Sources des scores : llm-stats.