Multi-SWE-Bench
Multi-SWE-Bench est un benchmark publié en 2025 par l’équipe Seed de ByteDance, associée à Doubao. Il évalue la capacité des grands modèles de langage à résoudre des problèmes logiciels réels dans plusieurs écosystèmes de programmation, en dépassant le périmètre principalement centré sur…
Multi-SWE-Bench est un benchmark publié en 2025 par l’équipe Seed de ByteDance, associée à Doubao. Il évalue la capacité des grands modèles de langage à résoudre des problèmes logiciels réels dans plusieurs écosystèmes de programmation, en dépassant le périmètre principalement centré sur Python de SWE-bench.
Chaque tâche consiste à produire un patch à partir d’une issue GitHub, puis à en vérifier la validité grâce aux tests du dépôt. Multi-SWE-Bench sert ainsi à comparer les modèles sur une activité concrète de maintenance logicielle multilingue.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | ByteDance (equipe Seed / Doubao) |
| Capacités mesurées | Evalue la capacite des LLM a resoudre des problemes logiciels reels dans des ecosystemes de programmation varies, au-dela du seul Python de SWE-bench. |
| Modalité | Texte |
| Type de questions | Resolution d'issues logicielles (generation de patch a partir d'un bug GitHub, verifie par tests) |
| Métrique d'évaluation | Taux de resolution (% d'instances resolues, pass@1) verifie via les tests unitaires du depot |
| Accès | Public |
| Langues | 7 langages de programmation : Java, TypeScript, JavaScript, Go, Rust, C, C++ |
| Taille du jeu | 1 632 instances (annotees a partir de 2 456 candidats par 68 experts) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiniMax M2.7 | MiniMax | 🟢 Ouvert | 52,7 % | 18 mars 2026 | Auto-déclaré |
| 2 | MiniMax M2.5 | MiniMax | 🟢 Ouvert | 51,3 % | 12 février 2026 | Auto-déclaré |
| 3 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 49,4 % | 23 décembre 2025 | Auto-déclaré |
| 4 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 41,9 % | 5 septembre 2025 | Auto-déclaré |
| 5 | MiniMax M2 | MiniMax | 🟢 Ouvert | 36,2 % | 27 octobre 2025 | Auto-déclaré |
| 6 | Qwen3-Coder 480B A35B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 25,8 % | 31 janvier 2025 | Auto-déclaré |
Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 45,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle résout correctement une part importante des issues dès sa première proposition, selon la validation par les tests unitaires du dépôt. Cette vérification automatisée apporte un critère mesurable, plus robuste qu’une appréciation subjective de la qualité du code. La constitution du jeu renforce aussi sa rigueur, avec 1 632 instances issues de 2 456 candidats et annotées par 68 experts. La comparabilité doit néanmoins être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs.
Le classement montre des performances encore regroupées dans une plage relativement étroite : MiniMax M2.7 atteint 53 %, contre une médiane de 46 % parmi les six modèles évalués. Cet écart ne traduit pas une saturation manifeste au sommet, tandis qu’une part importante des problèmes reste non résolue. La portée du benchmark demeure ciblée sur la résolution d’issues vérifiable par tests dans sept langages. Il mesure donc une compétence de maintenance logicielle concrète et diversifiée, plutôt qu’une aptitude générale à toutes les formes de développement.
Sources des scores : llm-stats.