SWE-Bench Pro

SWE-Bench Pro est un benchmark créé en 2025 par Xiang Deng et ses coauteurs chez Scale AI. Version avancée de SWE-Bench, il évalue des modèles de langage confrontés à des problèmes réels de génie logiciel, formulés en anglais et accompagnés de code.

SWE-Bench Pro est un benchmark créé en 2025 par Xiang Deng et ses coauteurs chez Scale AI. Version avancée de SWE-Bench, il évalue des modèles de langage confrontés à des problèmes réels de génie logiciel, formulés en anglais et accompagnés de code.

Les tâches demandent un raisonnement prolongé et une résolution en plusieurs étapes, avec des modifications substantielles réparties entre plusieurs fichiers. Le benchmark sert ainsi à mesurer la capacité d’agents IA à produire, dès leur première tentative, des correctifs capables de résoudre des issues issues de dépôts logiciels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkXiang Deng et al. (Scale AI)
Capacités mesuréesMesure la capacité des agents IA à résoudre des tâches de génie logiciel à long horizon, nécessitant des modifications substantielles réparties sur plusieurs fichiers.
ModalitéTexte
Type de questionstâches agentiques de génie logiciel (résolution d'issues réelles, patches multi-fichiers)
Métrique d'évaluationPass@1 (% de tâches résolues)
AccèsJeu de test privé (réponses non divulguées)
LicenceCC BY 4.0 (papier) ; code/dataset public sur GitHub et HF
Languesanglais, avec code
Taille du jeu1 865 tâches (41 dépôts)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (41)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Fable 5Anthropic🔒 Propriétaire80,0 %9 juin 2026Auto-déclaré
2Claude Mythos PreviewAnthropic🔒 Propriétaire77,8 %Auto-déclaré
3Claude Opus 4.8Anthropic🔒 Propriétaire69,2 %28 mai 2026Auto-déclaré
4Grok 4.5xAI🔒 Propriétaire64,7 %16 juillet 2026Auto-déclaré
5GPT-5.6 SolOpenAI🔒 Propriétaire64,6 %9 juillet 2026Auto-déclaré
6Claude Opus 4.7Anthropic🔒 Propriétaire64,3 %16 avril 2026Auto-déclaré
7GPT-5.6 TerraOpenAI🔒 Propriétaire63,4 %9 juillet 2026Auto-déclaré
8Claude Sonnet 5Anthropic🔒 Propriétaire63,2 %30 juin 2026Auto-déclaré
9GPT-5.6 LunaOpenAI🔒 Propriétaire62,7 %9 juillet 2026Auto-déclaré
10GLM-5.2Zhipu AI🟢 Ouvert62,1 %16 juin 2026Auto-déclaré
11Muse Spark 1.1Meta🔒 Propriétaire61,5 %9 juillet 2026Auto-déclaré
12Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire60,6 %19 mai 2026Auto-déclaré
13MiniMax M3MiniMax🟢 Ouvert59,0 %1 juin 2026Auto-déclaré
14GPT-5.5OpenAI🔒 Propriétaire58,6 %23 avril 2026Auto-déclaré
15Kimi K2.6Moonshot AI🟢 Ouvert58,6 %20 avril 2026Auto-déclaré
16GLM-5.1Zhipu AI🟢 Ouvert58,4 %7 avril 2026Auto-déclaré
17Hy3Tencent🟢 Ouvert57,9 %6 juillet 2026Auto-déclaré
18GPT-4.5OpenAI🔒 Propriétaire57,7 %5 mars 2026Auto-déclaré
19Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire57,6 %31 mai 2026Auto-déclaré
20Seed 2.1 ProByteDance🔒 Propriétaire57,5 %24 juin 2026Auto-déclaré
21MiMo-V2.5-ProXiaomi🟢 Ouvert57,2 %27 avril 2026Auto-déclaré
22Seed 2.1 TurboByteDance🔒 Propriétaire57,0 %24 juin 2026Auto-déclaré
23GPT-5.3 CodexOpenAI🔒 Propriétaire56,8 %5 février 2026Auto-déclaré
24Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire56,6 %31 mars 2026Auto-déclaré
25GPT-5.2 CodexOpenAI🔒 Propriétaire56,4 %14 janvier 2026Auto-déclaré
26MiniMax M2.7MiniMax🟢 Ouvert56,2 %18 mars 2026Auto-déclaré
27MiMo-V2.5Xiaomi🟢 Ouvert56,1 %22 avril 2026Auto-déclaré
28DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert55,4 %23 avril 2026Auto-déclaré
29MiniMax M2.5MiniMax🟢 Ouvert55,4 %12 février 2026Auto-déclaré
30Gemini 3.5 FlashGoogle🔒 Propriétaire55,1 %19 mai 2026Auto-déclaré
31GPT-5.4 miniOpenAI🔒 Propriétaire54,4 %17 mars 2026Auto-déclaré
32Gemini 3.1 Pro PreviewGoogle▫ n.d.54,2 %19 février 2026Auto-déclaré
33Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert53,5 %21 avril 2026Auto-déclaré
34MAI-Thinking-1Microsoft🔒 Propriétaire52,8 %2 juin 2026Auto-déclaré
35DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert52,6 %23 avril 2026Auto-déclaré
36GPT-5.4 nanoOpenAI🔒 Propriétaire52,4 %17 mars 2026Auto-déclaré
37Muse SparkMeta🔒 Propriétaire52,4 %8 avril 2026Auto-déclaré
38MAI-Code-1-FlashMicrosoft🔒 Propriétaire51,2 %2 juin 2026Auto-déclaré
39Kimi K2.5Moonshot AI🟢 Ouvert50,7 %27 janvier 2026Auto-déclaré
40Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert49,5 %16 avril 2026Auto-déclaré
41North Mini Code 1.0Cohere🟢 Ouvert40,2 %9 juin 2026Auto-déclaré

Classement établi sur 41 modèles évalués, dont 23 de grands éditeurs. Score médian de l'ensemble : 57,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score Pass@1 élevé signifie qu’un agent résout une forte proportion de tâches dès sa première tentative. Il traduit donc une meilleure aptitude à mener des interventions logicielles complexes et à long horizon, notamment lorsque le correctif doit rester cohérent dans plusieurs fichiers. Avec une médiane de 57 % parmi les 35 modèles de la base et un meilleur résultat de 80 % pour Claude Fable 5, le classement révèle un écart notable entre la performance centrale de l’ensemble et son sommet. Il ne paraît pas entièrement saturé, puisque même le premier modèle ne résout pas toutes les tâches.

La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure uniforme. Le jeu de test privé, dont les réponses ne sont pas divulguées, réduit l’exposition directe des solutions et contribue à limiter la contamination. La portée reste ciblée sur le génie logiciel agentique, en anglais avec du code, à travers 1 865 tâches provenant de 41 dépôts. Les résultats caractérisent donc ce domaine précis, et non les capacités générales des modèles.


Sources des scores : llm-stats.