SWE-bench Multilingual
SWE-bench Multilingual est un benchmark de génie logiciel créé par ByteDance Seed. Il évalue la capacité des modèles d’IA à comprendre une issue GitHub, à raisonner sur un dépôt de code et à produire un patch corrigeant le bug décrit.
SWE-bench Multilingual est un benchmark de génie logiciel créé par ByteDance Seed. Il évalue la capacité des modèles d’IA à comprendre une issue GitHub, à raisonner sur un dépôt de code et à produire un patch corrigeant le bug décrit.
Conçu pour couvrir plusieurs écosystèmes au-delà de Python, il mesure conjointement la génération et l’édition de code, le raisonnement et la résolution de bugs dans sept langages. Il sert ainsi à comparer les modèles sur des tâches proches de la maintenance logicielle à l’échelle d’un dépôt.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | ByteDance Seed |
| Capacités mesurées | génération et édition de code, raisonnement, résolution de bugs multi-langages à l'échelle d'un dépôt |
| Modalité | Texte |
| Type de questions | résolution d'issues GitHub (génération de patch corrigeant un bug à partir d'une issue) |
| Métrique d'évaluation | taux de résolution (% d'instances résolues, tests unitaires passants) |
| Accès | Public |
| Licence | CC BY 4.0 |
| Langues | Java, TypeScript, JavaScript, Go, Rust, C, C++ |
| Taille du jeu | 1632 instances (annotées depuis 2456 candidats par 68 experts), 7 langages |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (34)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 87,3 % | — | Auto-déclaré |
| 2 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 84,4 % | 28 mai 2026 | Auto-déclaré |
| 3 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 78,3 % | 30 juin 2026 | Auto-déclaré |
| 4 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 78,3 % | 19 mai 2026 | Auto-déclaré |
| 5 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 77,8 % | 5 février 2026 | Auto-déclaré |
| 6 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 76,7 % | 20 avril 2026 | Auto-déclaré |
| 7 | MiniMax M2.7 | MiniMax | 🟢 Ouvert | 76,5 % | 18 mars 2026 | Auto-déclaré |
| 8 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 76,2 % | 23 avril 2026 | Auto-déclaré |
| 9 | Hy3 | Tencent | 🟢 Ouvert | 75,8 % | 6 juillet 2026 | Auto-déclaré |
| 10 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 75,8 % | 31 mai 2026 | Auto-déclaré |
| 11 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 73,8 % | 31 mars 2026 | Auto-déclaré |
| 12 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 73,3 % | 23 avril 2026 | Auto-déclaré |
| 13 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 73,0 % | 27 janvier 2026 | Auto-déclaré |
| 14 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 72,5 % | 23 décembre 2025 | Auto-déclaré |
| 15 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 71,7 % | 16 décembre 2025 | Auto-déclaré |
| 16 | MiMo-V2-Pro | Xiaomi | 🔒 Propriétaire | 71,7 % | 18 mars 2026 | Auto-déclaré |
| 17 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,3 % | 21 avril 2026 | Auto-déclaré |
| 18 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 70,2 % | 1 décembre 2025 | Auto-déclaré |
| 19 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 70,2 % | 1 décembre 2025 | Auto-déclaré |
| 20 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,3 % | 16 février 2026 | Auto-déclaré |
| 21 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 67,7 % | 4 juin 2026 | Auto-déclaré |
| 22 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,2 % | 16 avril 2026 | Auto-déclaré |
| 23 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 66,7 % | 22 décembre 2025 | Auto-déclaré |
| 24 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 65,5 % | 2 juin 2026 | Auto-déclaré |
| 25 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 61,1 % | 5 septembre 2025 | Auto-déclaré |
| 26 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 57,9 % | 29 septembre 2025 | Auto-déclaré |
| 27 | MiniMax M2 | MiniMax | 🟢 Ouvert | 56,5 % | 27 octobre 2025 | Auto-déclaré |
| 28 | Qwen3-Coder 480B A35B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,7 % | 31 janvier 2025 | Auto-déclaré |
| 29 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 54,5 % | 10 janvier 2025 | Auto-déclaré |
| 30 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 47,3 % | 11 juillet 2025 | Auto-déclaré |
| 31 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 47,3 % | 5 septembre 2025 | Auto-déclaré |
| 32 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 45,8 % | 11 mars 2026 | Auto-déclaré |
| 33 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 38,1 % | 5 février 2026 | Auto-déclaré |
| 34 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 30,5 % | 28 mai 2025 | Auto-déclaré |
Classement établi sur 34 modèles évalués, dont 14 de grands éditeurs. Score médian de l'ensemble : 70,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé signifie qu’un modèle résout une forte proportion des issues proposées en générant des correctifs qui passent les tests unitaires. Cette métrique fournit un critère mesurable, mais la fiabilité du classement doit être nuancée puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs. Avec une médiane de 70 % parmi 33 modèles et un meilleur résultat de 87 % pour Claude Mythos Preview, le classement montre un niveau global déjà élevé tout en laissant une marge avant la résolution complète. Cette proximité relative avec le plafond peut toutefois réduire progressivement le pouvoir discriminant du benchmark si les performances continuent de monter. Son accès public appelle également à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, sa portée reste centrée sur la correction d’issues GitHub dans les sept langages couverts. Il évalue donc précisément la maintenance logicielle multi-langages à l’échelle d’un dépôt, plutôt que l’ensemble des aptitudes possibles en programmation.
Sources des scores : llm-stats.