SWE-bench Multilingual

SWE-bench Multilingual est un benchmark de génie logiciel créé par ByteDance Seed. Il évalue la capacité des modèles d’IA à comprendre une issue GitHub, à raisonner sur un dépôt de code et à produire un patch corrigeant le bug décrit.

SWE-bench Multilingual est un benchmark de génie logiciel créé par ByteDance Seed. Il évalue la capacité des modèles d’IA à comprendre une issue GitHub, à raisonner sur un dépôt de code et à produire un patch corrigeant le bug décrit.

Conçu pour couvrir plusieurs écosystèmes au-delà de Python, il mesure conjointement la génération et l’édition de code, le raisonnement et la résolution de bugs dans sept langages. Il sert ainsi à comparer les modèles sur des tâches proches de la maintenance logicielle à l’échelle d’un dépôt.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkByteDance Seed
Capacités mesuréesgénération et édition de code, raisonnement, résolution de bugs multi-langages à l'échelle d'un dépôt
ModalitéTexte
Type de questionsrésolution d'issues GitHub (génération de patch corrigeant un bug à partir d'une issue)
Métrique d'évaluationtaux de résolution (% d'instances résolues, tests unitaires passants)
AccèsPublic
LicenceCC BY 4.0
LanguesJava, TypeScript, JavaScript, Go, Rust, C, C++
Taille du jeu1632 instances (annotées depuis 2456 candidats par 68 experts), 7 langages
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (34)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Mythos PreviewAnthropic🔒 Propriétaire87,3 %Auto-déclaré
2Claude Opus 4.8Anthropic🔒 Propriétaire84,4 %28 mai 2026Auto-déclaré
3Claude Sonnet 5Anthropic🔒 Propriétaire78,3 %30 juin 2026Auto-déclaré
4Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire78,3 %19 mai 2026Auto-déclaré
5Claude Opus 4.6Anthropic🔒 Propriétaire77,8 %5 février 2026Auto-déclaré
6Kimi K2.6Moonshot AI🟢 Ouvert76,7 %20 avril 2026Auto-déclaré
7MiniMax M2.7MiniMax🟢 Ouvert76,5 %18 mars 2026Auto-déclaré
8DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert76,2 %23 avril 2026Auto-déclaré
9Hy3Tencent🟢 Ouvert75,8 %6 juillet 2026Auto-déclaré
10Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire75,8 %31 mai 2026Auto-déclaré
11Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire73,8 %31 mars 2026Auto-déclaré
12DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert73,3 %23 avril 2026Auto-déclaré
13Kimi K2.5Moonshot AI🟢 Ouvert73,0 %27 janvier 2026Auto-déclaré
14MiniMax M2.1MiniMax🟢 Ouvert72,5 %23 décembre 2025Auto-déclaré
15MiMo-V2-FlashXiaomi🟢 Ouvert71,7 %16 décembre 2025Auto-déclaré
16MiMo-V2-ProXiaomi🔒 Propriétaire71,7 %18 mars 2026Auto-déclaré
17Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert71,3 %21 avril 2026Auto-déclaré
18DeepSeek-V3.2DeepSeek🟢 Ouvert70,2 %1 décembre 2025Auto-déclaré
19DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert70,2 %1 décembre 2025Auto-déclaré
20Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert69,3 %16 février 2026Auto-déclaré
21Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert67,7 %4 juin 2026Auto-déclaré
22Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert67,2 %16 avril 2026Auto-déclaré
23GLM-4.7Zhipu AI🟢 Ouvert66,7 %22 décembre 2025Auto-déclaré
24MAI-Code-1-FlashMicrosoft🔒 Propriétaire65,5 %2 juin 2026Auto-déclaré
25Kimi K2 0905Moonshot AI🔒 Propriétaire61,1 %5 septembre 2025Auto-déclaré
26DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert57,9 %29 septembre 2025Auto-déclaré
27MiniMax M2MiniMax🟢 Ouvert56,5 %27 octobre 2025Auto-déclaré
28Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team🟢 Ouvert54,7 %31 janvier 2025Auto-déclaré
29DeepSeek-V3.1DeepSeek🟢 Ouvert54,5 %10 janvier 2025Auto-déclaré
30Kimi K2 InstructMoonshot AI🟢 Ouvert47,3 %11 juillet 2025Auto-déclaré
31Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert47,3 %5 septembre 2025Auto-déclaré
32Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert45,8 %11 mars 2026Auto-déclaré
33LongCat-Flash-LiteMeituan🟢 Ouvert38,1 %5 février 2026Auto-déclaré
34DeepSeek-R1-0528DeepSeek🟢 Ouvert30,5 %28 mai 2025Auto-déclaré

Classement établi sur 34 modèles évalués, dont 14 de grands éditeurs. Score médian de l'ensemble : 70,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé signifie qu’un modèle résout une forte proportion des issues proposées en générant des correctifs qui passent les tests unitaires. Cette métrique fournit un critère mesurable, mais la fiabilité du classement doit être nuancée puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs. Avec une médiane de 70 % parmi 33 modèles et un meilleur résultat de 87 % pour Claude Mythos Preview, le classement montre un niveau global déjà élevé tout en laissant une marge avant la résolution complète. Cette proximité relative avec le plafond peut toutefois réduire progressivement le pouvoir discriminant du benchmark si les performances continuent de monter. Son accès public appelle également à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, sa portée reste centrée sur la correction d’issues GitHub dans les sept langages couverts. Il évalue donc précisément la maintenance logicielle multi-langages à l’échelle d’un dépôt, plutôt que l’ensemble des aptitudes possibles en programmation.


Sources des scores : llm-stats.