SWE-Bench Pro
SWE-Bench Pro est un benchmark créé en 2025 par Xiang Deng et ses coauteurs chez Scale AI. Version avancée de SWE-Bench, il évalue des modèles de langage confrontés à des problèmes réels de génie logiciel, formulés en anglais et accompagnés de code.
SWE-Bench Pro est un benchmark créé en 2025 par Xiang Deng et ses coauteurs chez Scale AI. Version avancée de SWE-Bench, il évalue des modèles de langage confrontés à des problèmes réels de génie logiciel, formulés en anglais et accompagnés de code.
Les tâches demandent un raisonnement prolongé et une résolution en plusieurs étapes, avec des modifications substantielles réparties entre plusieurs fichiers. Le benchmark sert ainsi à mesurer la capacité d’agents IA à produire, dès leur première tentative, des correctifs capables de résoudre des issues issues de dépôts logiciels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Xiang Deng et al. (Scale AI) |
| Capacités mesurées | Mesure la capacité des agents IA à résoudre des tâches de génie logiciel à long horizon, nécessitant des modifications substantielles réparties sur plusieurs fichiers. |
| Modalité | Texte |
| Type de questions | tâches agentiques de génie logiciel (résolution d'issues réelles, patches multi-fichiers) |
| Métrique d'évaluation | Pass@1 (% de tâches résolues) |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | CC BY 4.0 (papier) ; code/dataset public sur GitHub et HF |
| Langues | anglais, avec code |
| Taille du jeu | 1 865 tâches (41 dépôts) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (41)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 80,0 % | 9 juin 2026 | Auto-déclaré |
| 2 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 77,8 % | — | Auto-déclaré |
| 3 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 69,2 % | 28 mai 2026 | Auto-déclaré |
| 4 | Grok 4.5 | xAI | 🔒 Propriétaire | 64,7 % | 16 juillet 2026 | Auto-déclaré |
| 5 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 64,6 % | 9 juillet 2026 | Auto-déclaré |
| 6 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 64,3 % | 16 avril 2026 | Auto-déclaré |
| 7 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 63,4 % | 9 juillet 2026 | Auto-déclaré |
| 8 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 63,2 % | 30 juin 2026 | Auto-déclaré |
| 9 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 62,7 % | 9 juillet 2026 | Auto-déclaré |
| 10 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 62,1 % | 16 juin 2026 | Auto-déclaré |
| 11 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 61,5 % | 9 juillet 2026 | Auto-déclaré |
| 12 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 60,6 % | 19 mai 2026 | Auto-déclaré |
| 13 | MiniMax M3 | MiniMax | 🟢 Ouvert | 59,0 % | 1 juin 2026 | Auto-déclaré |
| 14 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 58,6 % | 23 avril 2026 | Auto-déclaré |
| 15 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 58,6 % | 20 avril 2026 | Auto-déclaré |
| 16 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 58,4 % | 7 avril 2026 | Auto-déclaré |
| 17 | Hy3 | Tencent | 🟢 Ouvert | 57,9 % | 6 juillet 2026 | Auto-déclaré |
| 18 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 57,7 % | 5 mars 2026 | Auto-déclaré |
| 19 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 57,6 % | 31 mai 2026 | Auto-déclaré |
| 20 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 57,5 % | 24 juin 2026 | Auto-déclaré |
| 21 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 57,2 % | 27 avril 2026 | Auto-déclaré |
| 22 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 57,0 % | 24 juin 2026 | Auto-déclaré |
| 23 | GPT-5.3 Codex | OpenAI | 🔒 Propriétaire | 56,8 % | 5 février 2026 | Auto-déclaré |
| 24 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 56,6 % | 31 mars 2026 | Auto-déclaré |
| 25 | GPT-5.2 Codex | OpenAI | 🔒 Propriétaire | 56,4 % | 14 janvier 2026 | Auto-déclaré |
| 26 | MiniMax M2.7 | MiniMax | 🟢 Ouvert | 56,2 % | 18 mars 2026 | Auto-déclaré |
| 27 | MiMo-V2.5 | Xiaomi | 🟢 Ouvert | 56,1 % | 22 avril 2026 | Auto-déclaré |
| 28 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 55,4 % | 23 avril 2026 | Auto-déclaré |
| 29 | MiniMax M2.5 | MiniMax | 🟢 Ouvert | 55,4 % | 12 février 2026 | Auto-déclaré |
| 30 | Gemini 3.5 Flash | 🔒 Propriétaire | 55,1 % | 19 mai 2026 | Auto-déclaré | |
| 31 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 54,4 % | 17 mars 2026 | Auto-déclaré |
| 32 | Gemini 3.1 Pro Preview | ▫ n.d. | 54,2 % | 19 février 2026 | Auto-déclaré | |
| 33 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 53,5 % | 21 avril 2026 | Auto-déclaré |
| 34 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 52,8 % | 2 juin 2026 | Auto-déclaré |
| 35 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 52,6 % | 23 avril 2026 | Auto-déclaré |
| 36 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 52,4 % | 17 mars 2026 | Auto-déclaré |
| 37 | Muse Spark | Meta | 🔒 Propriétaire | 52,4 % | 8 avril 2026 | Auto-déclaré |
| 38 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 51,2 % | 2 juin 2026 | Auto-déclaré |
| 39 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 50,7 % | 27 janvier 2026 | Auto-déclaré |
| 40 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,5 % | 16 avril 2026 | Auto-déclaré |
| 41 | North Mini Code 1.0 | Cohere | 🟢 Ouvert | 40,2 % | 9 juin 2026 | Auto-déclaré |
Classement établi sur 41 modèles évalués, dont 23 de grands éditeurs. Score médian de l'ensemble : 57,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score Pass@1 élevé signifie qu’un agent résout une forte proportion de tâches dès sa première tentative. Il traduit donc une meilleure aptitude à mener des interventions logicielles complexes et à long horizon, notamment lorsque le correctif doit rester cohérent dans plusieurs fichiers. Avec une médiane de 57 % parmi les 35 modèles de la base et un meilleur résultat de 80 % pour Claude Fable 5, le classement révèle un écart notable entre la performance centrale de l’ensemble et son sommet. Il ne paraît pas entièrement saturé, puisque même le premier modèle ne résout pas toutes les tâches.
La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure uniforme. Le jeu de test privé, dont les réponses ne sont pas divulguées, réduit l’exposition directe des solutions et contribue à limiter la contamination. La portée reste ciblée sur le génie logiciel agentique, en anglais avec du code, à travers 1 865 tâches provenant de 41 dépôts. Les résultats caractérisent donc ce domaine précis, et non les capacités générales des modèles.
Sources des scores : llm-stats.