SWE-Bench Verified

SWE-Bench Verified est un benchmark créé en 2024 par OpenAI et l’équipe SWE-bench de Princeton NLP. Il réunit un sous-ensemble vérifié de problèmes d’ingénierie logicielle issus de véritables issues GitHub et validés par des annotateurs humains.

SWE-Bench Verified est un benchmark créé en 2024 par OpenAI et l’équipe SWE-bench de Princeton NLP. Il réunit un sous-ensemble vérifié de problèmes d’ingénierie logicielle issus de véritables issues GitHub et validés par des annotateurs humains.

Il mesure la capacité d’un modèle à comprendre une demande, à naviguer dans une base de code Python et à générer un correctif faisant passer les tests. Il sert ainsi à évaluer la résolution autonome de tâches de programmation proches de situations réelles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI et l'équipe SWE-bench / Princeton NLP
Capacités mesuréescode, développement front-end, raisonnement
ModalitéTexte
Type de questionsgénération de code / correctifs logiciels à partir d'issues GitHub
Métrique d'évaluationtaux de résolution des issues (tests réussis, équivalent pass@1)
AccèsPublic
LicenceMIT
Languesanglais; code Python
Taille du jeu500 problèmes
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (102)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Fable 5Anthropic🔒 Propriétaire95,0 %9 juin 2026Auto-déclaré
2Claude Mythos PreviewAnthropic🔒 Propriétaire93,9 %Auto-déclaré
3Claude Opus 4.8Anthropic🔒 Propriétaire88,6 %28 mai 2026Auto-déclaré
4Claude Opus 4.7Anthropic🔒 Propriétaire87,6 %16 avril 2026Auto-déclaré
5Claude Sonnet 5Anthropic🔒 Propriétaire85,2 %30 juin 2026Auto-déclaré
6Claude Opus 4.5Anthropic🔒 Propriétaire80,9 %24 novembre 2025Auto-déclaré
7Claude Opus 4.6Anthropic🔒 Propriétaire80,8 %5 février 2026Auto-déclaré
8DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert80,6 %23 avril 2026Auto-déclaré
9Gemini 3.1 Pro PreviewGoogle▫ n.d.80,6 %19 février 2026Auto-déclaré
10MiniMax M3MiniMax🟢 Ouvert80,5 %1 juin 2026Auto-déclaré
11Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire80,4 %19 mai 2026Auto-déclaré
12Kimi K2.6Moonshot AI🟢 Ouvert80,2 %20 avril 2026Auto-déclaré
13MiniMax M2.5MiniMax🟢 Ouvert80,2 %12 février 2026Auto-déclaré
14GPT-5.2OpenAI🔒 Propriétaire80,0 %11 décembre 2025Auto-déclaré
15Claude Sonnet 4.6Anthropic🔒 Propriétaire79,6 %17 février 2026Auto-déclaré
16DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert79,0 %23 avril 2026Auto-déclaré
17MiMo-V2.5-ProXiaomi🟢 Ouvert78,9 %27 avril 2026Auto-déclaré
18Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire78,8 %31 mars 2026Auto-déclaré
19Gemini 3 FlashGoogle🔒 Propriétaire78,0 %17 décembre 2025Auto-déclaré
20Hy3Tencent🟢 Ouvert78,0 %6 juillet 2026Auto-déclaré
21MiMo-V2-ProXiaomi🔒 Propriétaire78,0 %18 mars 2026Auto-déclaré
22GLM-5Zhipu AI🟢 Ouvert77,8 %11 février 2026Auto-déclaré
23Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire77,7 %31 mai 2026Auto-déclaré
24Mistral Medium 3.5Mistral AI🟢 Ouvert77,6 %29 avril 2026Auto-déclaré
25Muse SparkMeta🔒 Propriétaire77,4 %8 avril 2026Auto-déclaré
26Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert77,2 %21 avril 2026Auto-déclaré
27Kimi K2.5Moonshot AI🟢 Ouvert76,8 %27 janvier 2026Auto-déclaré
28Seed 2.0 ProByteDance🔒 Propriétaire76,5 %14 février 2026Auto-déclaré
29Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert76,4 %16 février 2026Auto-déclaré
30GPT-5.1OpenAI🔒 Propriétaire76,3 %13 novembre 2025Auto-déclaré
31GPT-5.1 InstantOpenAI🔒 Propriétaire76,3 %12 novembre 2025Auto-déclaré
32Gemini 3 ProGoogle🔒 Propriétaire76,2 %18 novembre 2025Auto-déclaré
33GPT-5OpenAI🔒 Propriétaire74,9 %7 août 2025Auto-déclaré
34MiMo-V2-OmniXiaomi🔒 Propriétaire74,8 %18 mars 2026Auto-déclaré
35Claude Opus 4.1Anthropic🔒 Propriétaire74,5 %5 août 2025Auto-déclaré
36GPT-5 CodexOpenAI🔒 Propriétaire74,5 %15 septembre 2025Auto-déclaré
37Step-3.5-FlashStepFun🟢 Ouvert74,4 %2 février 2026Auto-déclaré
38GLM-4.7Zhipu AI🟢 Ouvert73,8 %22 décembre 2025Auto-déclaré
39GPT-5.1 CodexOpenAI🔒 Propriétaire73,7 %19 novembre 2025Auto-déclaré
40MAI-Thinking-1Microsoft🔒 Propriétaire73,5 %2 juin 2026Auto-déclaré
41Seed 2.0 LiteByteDance🔒 Propriétaire73,5 %14 février 2026Auto-déclaré
42MiMo-V2-FlashXiaomi🟢 Ouvert73,4 %16 décembre 2025Auto-déclaré
43Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert73,4 %16 avril 2026Auto-déclaré
44Claude Haiku 4.5Anthropic🔒 Propriétaire73,3 %15 octobre 2025Auto-déclaré
45DeepSeek-V3.2DeepSeek🟢 Ouvert73,1 %1 décembre 2025Auto-déclaré
46DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert73,1 %1 décembre 2025Auto-déclaré
47DeepSeek-V3.2-SpecialeDeepSeek🟢 Ouvert73,1 %1 décembre 2025Auto-déclaré
48Claude Sonnet 4Anthropic🔒 Propriétaire72,7 %22 mai 2025Auto-déclaré
49Claude Opus 4Anthropic🔒 Propriétaire72,5 %22 mai 2025Auto-déclaré
50Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert72,4 %24 février 2026Auto-déclaré
51Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert72,0 %24 février 2026Auto-déclaré
52MAI-Code-1-FlashMicrosoft🔒 Propriétaire71,6 %2 juin 2026Auto-déclaré
53Kimi K2 0905Moonshot AI🔒 Propriétaire71,3 %5 septembre 2025Auto-déclaré
54Grok Code Fast 1xAI🔒 Propriétaire70,8 %28 août 2025Auto-déclaré
55Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert70,7 %4 juin 2026Auto-déclaré
56Claude 3.7 SonnetAnthropic🔒 Propriétaire70,3 %24 février 2025Auto-déclaré
57LongCat-Flash-Thinking-2601Meituan🟢 Ouvert70,0 %14 janvier 2026Auto-déclaré
58Nova 2 ProAmazon🔒 Propriétaire70,0 %2 décembre 2025Auto-déclaré
59Qwen3 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire69,6 %15 décembre 2025Auto-déclaré
60Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team🟢 Ouvert69,6 %31 janvier 2025Auto-déclaré
61MiniMax M2MiniMax🟢 Ouvert69,4 %27 octobre 2025Auto-déclaré
62Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert69,2 %24 février 2026Auto-déclaré
63o3OpenAI🔒 Propriétaire69,1 %16 avril 2025Auto-déclaré
64o4-miniOpenAI🔒 Propriétaire68,1 %16 avril 2025Auto-déclaré
65GLM-4.6Zhipu AI🟢 Ouvert68,0 %30 septembre 2025Auto-déclaré
66DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert67,8 %29 septembre 2025Auto-déclaré
67North Mini Code 1.0Cohere🟢 Ouvert67,6 %9 juin 2026Auto-déclaré
68Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire67,2 %5 juin 2025Auto-déclaré
69MiniMax M2.1MiniMax🟢 Ouvert67,0 %23 décembre 2025Auto-déclaré
70DeepSeek-V3.1DeepSeek🟢 Ouvert66,0 %10 janvier 2025Auto-déclaré
71Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert65,8 %5 septembre 2025Auto-déclaré
72Nova 2 LiteAmazon🔒 Propriétaire64,5 %2 décembre 2025Auto-déclaré
73GLM-4.5Zhipu AI🟢 Ouvert64,2 %28 juillet 2025Auto-déclaré
74Gemini 2.5 ProGoogle🔒 Propriétaire63,2 %20 mai 2025Auto-déclaré
75Devstral MediumMistral AI🔒 Propriétaire61,6 %10 juillet 2025Auto-déclaré
76Gemini 2.5 FlashGoogle🔒 Propriétaire60,4 %20 mai 2025Auto-déclaré
77LongCat-Flash-ChatMeituan🟢 Ouvert60,4 %29 août 2025Auto-déclaré
78LongCat-Flash-ThinkingMeituan🟢 Ouvert59,4 %22 septembre 2025Auto-déclaré
79GLM-4.7-FlashZhipu AI🟢 Ouvert59,2 %19 janvier 2026Auto-déclaré
80GLM-4.5-AirZhipu AI🟢 Ouvert57,6 %28 juillet 2025Auto-déclaré
81MiniMax M1MiniMax🟢 Ouvert55,6 %17 juin 2025Auto-déclaré
82GPT-4.1OpenAI🔒 Propriétaire54,6 %14 avril 2025Auto-déclaré
83LongCat-Flash-LiteMeituan🟢 Ouvert54,4 %5 février 2026Auto-déclaré
84Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert53,7 %11 mars 2026Auto-déclaré
85Devstral Small 1.1Mistral AI🟢 Ouvert53,6 %11 juillet 2025Auto-déclaré
86o3-miniOpenAI🔒 Propriétaire49,3 %30 janvier 2025Auto-déclaré
87Claude 3.5 SonnetAnthropic🔒 Propriétaire49,0 %22 octobre 2024Auto-déclaré
88Sarvam-105BSarvam AI🟢 Ouvert45,0 %6 mars 2026Auto-déclaré
89DeepSeek-R1-0528DeepSeek🟢 Ouvert44,6 %28 mai 2025Auto-déclaré
90DeepSeek-V3DeepSeek🟢 Ouvert42,0 %25 décembre 2024Auto-déclaré
91o1-previewOpenAI🔒 Propriétaire41,3 %12 septembre 2024Auto-déclaré
92o1OpenAI🔒 Propriétaire41,0 %17 décembre 2024Auto-déclaré
93Claude 3.5 HaikuAnthropic🔒 Propriétaire40,6 %4 novembre 2024Auto-déclaré
94Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert38,8 %15 décembre 2025Auto-déclaré
95GPT-4.5OpenAI🔒 Propriétaire38,0 %5 mars 2026Auto-déclaré
96Sarvam-30BSarvam AI🟢 Ouvert34,0 %6 mars 2026Auto-déclaré
97GPT-4oOpenAI🔒 Propriétaire33,2 %27 mars 2025Auto-déclaré
98Gemini 2.5 Flash-LiteGoogle🟢 Ouvert31,6 %17 juin 2025Auto-déclaré
99GPT-4.1 miniOpenAI🔒 Propriétaire23,6 %14 avril 2025Auto-déclaré
100Gemini DiffusionGoogle🔒 Propriétaire22,9 %20 mai 2025Auto-déclaré
101DeepSeek-V2.5DeepSeek🟢 Ouvert16,8 %8 mai 2024Auto-déclaré
102GPT-4o miniOpenAI🔒 Propriétaire8,7 %18 juillet 2024Auto-déclaré

Classement établi sur 102 modèles évalués, dont 61 de grands éditeurs. Score médian de l'ensemble : 71,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle résout une forte proportion des issues en produisant, dès sa réponse évaluée, des patchs conformes aux tests. Cette mesure vérifie un résultat fonctionnel plutôt que la seule plausibilité du code. La validation humaine des problèmes renforce la rigueur du jeu, mais les scores recensés sont majoritairement auto-déclarés par les éditeurs, ce qui invite à distinguer la solidité du benchmark de celle du processus de publication des résultats.

Avec une médiane de 72 % parmi 101 modèles et un meilleur score de 95 % pour Claude Fable 5, le classement montre des performances globalement élevées et une tête proche du maximum. Cette proximité peut réduire progressivement le pouvoir discriminant du benchmark et signaler un risque de saturation. Son accès public et son origine dans des issues GitHub imposent aussi de considérer le risque de contamination lors de l’interprétation. Enfin, sa portée reste centrée sur des correctifs de bases Python associés à des issues réelles, et non sur l’ensemble des compétences de développement logiciel.


Sources des scores : llm-stats.