SWE-Bench Verified
SWE-Bench Verified est un benchmark créé en 2024 par OpenAI et l’équipe SWE-bench de Princeton NLP. Il réunit un sous-ensemble vérifié de problèmes d’ingénierie logicielle issus de véritables issues GitHub et validés par des annotateurs humains.
SWE-Bench Verified est un benchmark créé en 2024 par OpenAI et l’équipe SWE-bench de Princeton NLP. Il réunit un sous-ensemble vérifié de problèmes d’ingénierie logicielle issus de véritables issues GitHub et validés par des annotateurs humains.
Il mesure la capacité d’un modèle à comprendre une demande, à naviguer dans une base de code Python et à générer un correctif faisant passer les tests. Il sert ainsi à évaluer la résolution autonome de tâches de programmation proches de situations réelles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI et l'équipe SWE-bench / Princeton NLP |
| Capacités mesurées | code, développement front-end, raisonnement |
| Modalité | Texte |
| Type de questions | génération de code / correctifs logiciels à partir d'issues GitHub |
| Métrique d'évaluation | taux de résolution des issues (tests réussis, équivalent pass@1) |
| Accès | Public |
| Licence | MIT |
| Langues | anglais; code Python |
| Taille du jeu | 500 problèmes |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (102)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 95,0 % | 9 juin 2026 | Auto-déclaré |
| 2 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 93,9 % | — | Auto-déclaré |
| 3 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 88,6 % | 28 mai 2026 | Auto-déclaré |
| 4 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 87,6 % | 16 avril 2026 | Auto-déclaré |
| 5 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 85,2 % | 30 juin 2026 | Auto-déclaré |
| 6 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 80,9 % | 24 novembre 2025 | Auto-déclaré |
| 7 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 80,8 % | 5 février 2026 | Auto-déclaré |
| 8 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 80,6 % | 23 avril 2026 | Auto-déclaré |
| 9 | Gemini 3.1 Pro Preview | ▫ n.d. | 80,6 % | 19 février 2026 | Auto-déclaré | |
| 10 | MiniMax M3 | MiniMax | 🟢 Ouvert | 80,5 % | 1 juin 2026 | Auto-déclaré |
| 11 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 80,4 % | 19 mai 2026 | Auto-déclaré |
| 12 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 80,2 % | 20 avril 2026 | Auto-déclaré |
| 13 | MiniMax M2.5 | MiniMax | 🟢 Ouvert | 80,2 % | 12 février 2026 | Auto-déclaré |
| 14 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 80,0 % | 11 décembre 2025 | Auto-déclaré |
| 15 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 79,6 % | 17 février 2026 | Auto-déclaré |
| 16 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 79,0 % | 23 avril 2026 | Auto-déclaré |
| 17 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 78,9 % | 27 avril 2026 | Auto-déclaré |
| 18 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 78,8 % | 31 mars 2026 | Auto-déclaré |
| 19 | Gemini 3 Flash | 🔒 Propriétaire | 78,0 % | 17 décembre 2025 | Auto-déclaré | |
| 20 | Hy3 | Tencent | 🟢 Ouvert | 78,0 % | 6 juillet 2026 | Auto-déclaré |
| 21 | MiMo-V2-Pro | Xiaomi | 🔒 Propriétaire | 78,0 % | 18 mars 2026 | Auto-déclaré |
| 22 | GLM-5 | Zhipu AI | 🟢 Ouvert | 77,8 % | 11 février 2026 | Auto-déclaré |
| 23 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 77,7 % | 31 mai 2026 | Auto-déclaré |
| 24 | Mistral Medium 3.5 | Mistral AI | 🟢 Ouvert | 77,6 % | 29 avril 2026 | Auto-déclaré |
| 25 | Muse Spark | Meta | 🔒 Propriétaire | 77,4 % | 8 avril 2026 | Auto-déclaré |
| 26 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,2 % | 21 avril 2026 | Auto-déclaré |
| 27 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 76,8 % | 27 janvier 2026 | Auto-déclaré |
| 28 | Seed 2.0 Pro | ByteDance | 🔒 Propriétaire | 76,5 % | 14 février 2026 | Auto-déclaré |
| 29 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,4 % | 16 février 2026 | Auto-déclaré |
| 30 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 76,3 % | 13 novembre 2025 | Auto-déclaré |
| 31 | GPT-5.1 Instant | OpenAI | 🔒 Propriétaire | 76,3 % | 12 novembre 2025 | Auto-déclaré |
| 32 | Gemini 3 Pro | 🔒 Propriétaire | 76,2 % | 18 novembre 2025 | Auto-déclaré | |
| 33 | GPT-5 | OpenAI | 🔒 Propriétaire | 74,9 % | 7 août 2025 | Auto-déclaré |
| 34 | MiMo-V2-Omni | Xiaomi | 🔒 Propriétaire | 74,8 % | 18 mars 2026 | Auto-déclaré |
| 35 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 74,5 % | 5 août 2025 | Auto-déclaré |
| 36 | GPT-5 Codex | OpenAI | 🔒 Propriétaire | 74,5 % | 15 septembre 2025 | Auto-déclaré |
| 37 | Step-3.5-Flash | StepFun | 🟢 Ouvert | 74,4 % | 2 février 2026 | Auto-déclaré |
| 38 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 73,8 % | 22 décembre 2025 | Auto-déclaré |
| 39 | GPT-5.1 Codex | OpenAI | 🔒 Propriétaire | 73,7 % | 19 novembre 2025 | Auto-déclaré |
| 40 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 73,5 % | 2 juin 2026 | Auto-déclaré |
| 41 | Seed 2.0 Lite | ByteDance | 🔒 Propriétaire | 73,5 % | 14 février 2026 | Auto-déclaré |
| 42 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 73,4 % | 16 décembre 2025 | Auto-déclaré |
| 43 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,4 % | 16 avril 2026 | Auto-déclaré |
| 44 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 73,3 % | 15 octobre 2025 | Auto-déclaré |
| 45 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 73,1 % | 1 décembre 2025 | Auto-déclaré |
| 46 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 73,1 % | 1 décembre 2025 | Auto-déclaré |
| 47 | DeepSeek-V3.2-Speciale | DeepSeek | 🟢 Ouvert | 73,1 % | 1 décembre 2025 | Auto-déclaré |
| 48 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 72,7 % | 22 mai 2025 | Auto-déclaré |
| 49 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 72,5 % | 22 mai 2025 | Auto-déclaré |
| 50 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,4 % | 24 février 2026 | Auto-déclaré |
| 51 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,0 % | 24 février 2026 | Auto-déclaré |
| 52 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 71,6 % | 2 juin 2026 | Auto-déclaré |
| 53 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 71,3 % | 5 septembre 2025 | Auto-déclaré |
| 54 | Grok Code Fast 1 | xAI | 🔒 Propriétaire | 70,8 % | 28 août 2025 | Auto-déclaré |
| 55 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 70,7 % | 4 juin 2026 | Auto-déclaré |
| 56 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 70,3 % | 24 février 2025 | Auto-déclaré |
| 57 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 70,0 % | 14 janvier 2026 | Auto-déclaré |
| 58 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 70,0 % | 2 décembre 2025 | Auto-déclaré |
| 59 | Qwen3 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 69,6 % | 15 décembre 2025 | Auto-déclaré |
| 60 | Qwen3-Coder 480B A35B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,6 % | 31 janvier 2025 | Auto-déclaré |
| 61 | MiniMax M2 | MiniMax | 🟢 Ouvert | 69,4 % | 27 octobre 2025 | Auto-déclaré |
| 62 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,2 % | 24 février 2026 | Auto-déclaré |
| 63 | o3 | OpenAI | 🔒 Propriétaire | 69,1 % | 16 avril 2025 | Auto-déclaré |
| 64 | o4-mini | OpenAI | 🔒 Propriétaire | 68,1 % | 16 avril 2025 | Auto-déclaré |
| 65 | GLM-4.6 | Zhipu AI | 🟢 Ouvert | 68,0 % | 30 septembre 2025 | Auto-déclaré |
| 66 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 67,8 % | 29 septembre 2025 | Auto-déclaré |
| 67 | North Mini Code 1.0 | Cohere | 🟢 Ouvert | 67,6 % | 9 juin 2026 | Auto-déclaré |
| 68 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 67,2 % | 5 juin 2025 | Auto-déclaré | |
| 69 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 67,0 % | 23 décembre 2025 | Auto-déclaré |
| 70 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 66,0 % | 10 janvier 2025 | Auto-déclaré |
| 71 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 65,8 % | 5 septembre 2025 | Auto-déclaré |
| 72 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 64,5 % | 2 décembre 2025 | Auto-déclaré |
| 73 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 64,2 % | 28 juillet 2025 | Auto-déclaré |
| 74 | Gemini 2.5 Pro | 🔒 Propriétaire | 63,2 % | 20 mai 2025 | Auto-déclaré | |
| 75 | Devstral Medium | Mistral AI | 🔒 Propriétaire | 61,6 % | 10 juillet 2025 | Auto-déclaré |
| 76 | Gemini 2.5 Flash | 🔒 Propriétaire | 60,4 % | 20 mai 2025 | Auto-déclaré | |
| 77 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 60,4 % | 29 août 2025 | Auto-déclaré |
| 78 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 59,4 % | 22 septembre 2025 | Auto-déclaré |
| 79 | GLM-4.7-Flash | Zhipu AI | 🟢 Ouvert | 59,2 % | 19 janvier 2026 | Auto-déclaré |
| 80 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 57,6 % | 28 juillet 2025 | Auto-déclaré |
| 81 | MiniMax M1 | MiniMax | 🟢 Ouvert | 55,6 % | 17 juin 2025 | Auto-déclaré |
| 82 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 54,6 % | 14 avril 2025 | Auto-déclaré |
| 83 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 54,4 % | 5 février 2026 | Auto-déclaré |
| 84 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 53,7 % | 11 mars 2026 | Auto-déclaré |
| 85 | Devstral Small 1.1 | Mistral AI | 🟢 Ouvert | 53,6 % | 11 juillet 2025 | Auto-déclaré |
| 86 | o3-mini | OpenAI | 🔒 Propriétaire | 49,3 % | 30 janvier 2025 | Auto-déclaré |
| 87 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 49,0 % | 22 octobre 2024 | Auto-déclaré |
| 88 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 45,0 % | 6 mars 2026 | Auto-déclaré |
| 89 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 44,6 % | 28 mai 2025 | Auto-déclaré |
| 90 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 42,0 % | 25 décembre 2024 | Auto-déclaré |
| 91 | o1-preview | OpenAI | 🔒 Propriétaire | 41,3 % | 12 septembre 2024 | Auto-déclaré |
| 92 | o1 | OpenAI | 🔒 Propriétaire | 41,0 % | 17 décembre 2024 | Auto-déclaré |
| 93 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 40,6 % | 4 novembre 2024 | Auto-déclaré |
| 94 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 38,8 % | 15 décembre 2025 | Auto-déclaré |
| 95 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 38,0 % | 5 mars 2026 | Auto-déclaré |
| 96 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 34,0 % | 6 mars 2026 | Auto-déclaré |
| 97 | GPT-4o | OpenAI | 🔒 Propriétaire | 33,2 % | 27 mars 2025 | Auto-déclaré |
| 98 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 31,6 % | 17 juin 2025 | Auto-déclaré | |
| 99 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 23,6 % | 14 avril 2025 | Auto-déclaré |
| 100 | Gemini Diffusion | 🔒 Propriétaire | 22,9 % | 20 mai 2025 | Auto-déclaré | |
| 101 | DeepSeek-V2.5 | DeepSeek | 🟢 Ouvert | 16,8 % | 8 mai 2024 | Auto-déclaré |
| 102 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 8,7 % | 18 juillet 2024 | Auto-déclaré |
Classement établi sur 102 modèles évalués, dont 61 de grands éditeurs. Score médian de l'ensemble : 71,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle résout une forte proportion des issues en produisant, dès sa réponse évaluée, des patchs conformes aux tests. Cette mesure vérifie un résultat fonctionnel plutôt que la seule plausibilité du code. La validation humaine des problèmes renforce la rigueur du jeu, mais les scores recensés sont majoritairement auto-déclarés par les éditeurs, ce qui invite à distinguer la solidité du benchmark de celle du processus de publication des résultats.
Avec une médiane de 72 % parmi 101 modèles et un meilleur score de 95 % pour Claude Fable 5, le classement montre des performances globalement élevées et une tête proche du maximum. Cette proximité peut réduire progressivement le pouvoir discriminant du benchmark et signaler un risque de saturation. Son accès public et son origine dans des issues GitHub imposent aussi de considérer le risque de contamination lors de l’interprétation. Enfin, sa portée reste centrée sur des correctifs de bases Python associés à des issues réelles, et non sur l’ensemble des compétences de développement logiciel.
Sources des scores : llm-stats.