SWE-Bench verified
Epoch: SWE-Bench verified est un benchmark créé par OpenAI et SWE-bench/Princeton NLP à partir d’un sous-ensemble de SWE-bench validé par des humains. Il repose sur des tâches réelles de maintenance logicielle issues de dépôts GitHub.
Epoch: SWE-Bench verified est un benchmark créé par OpenAI et SWE-bench/Princeton NLP à partir d’un sous-ensemble de SWE-bench validé par des humains. Il repose sur des tâches réelles de maintenance logicielle issues de dépôts GitHub.
Chaque instance demande à un modèle ou à un agent de comprendre une issue, de modifier un dépôt Python et de générer un correctif conforme aux tests. Le benchmark sert ainsi à évaluer des capacités agentiques appliquées au code, au-delà de la simple génération de réponses ou d’extraits isolés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI et SWE-bench/Princeton NLP |
| Capacités mesurées | Mesure la capacité d’un modèle ou agent à comprendre une issue logicielle réelle, modifier un dépôt de code et produire un correctif qui passe les tests. |
| Modalité | Texte |
| Type de questions | tâches agentiques de correction de bugs et génération de patch à partir d'issues GitHub |
| Métrique d'évaluation | taux de résolution des instances, vérifié par tests unitaires |
| Accès | Public |
| Licence | MIT |
| Langues | anglais pour les descriptions, principalement Python pour le code |
| Taille du jeu | 500 instances |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 77,6 % | 24 avril 2026 | ✅ Mesuré |
| 2 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 76,7 % | 24 novembre 2025 | ✅ Mesuré |
| 3 | Qwen 3.6 Max | Qwen | ▫ n.d. | 76,7 % | 20 avril 2026 | ✅ Mesuré |
| 4 | Gemini 3.1 Pro Preview | ▫ n.d. | 75,6 % | 19 février 2026 | ✅ Mesuré | |
| 5 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 73,8 % | 11 décembre 2025 | ✅ Mesuré |
| 6 | GPT-5 | OpenAI | 🔒 Propriétaire | 73,6 % | 7 août 2025 | ✅ Mesuré |
| 7 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 73,3 % | 5 août 2025 | ✅ Mesuré |
| 8 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 71,3 % | 29 septembre 2025 | ✅ Mesuré |
| 9 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 70,7 % | 22 mai 2025 | ✅ Mesuré |
| 10 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 68,0 % | 13 novembre 2025 | ✅ Mesuré |
| 11 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 64,7 % | 7 août 2025 | ✅ Mesuré |
| 12 | o3 | OpenAI | 🔒 Propriétaire | 62,3 % | 16 avril 2025 | ✅ Mesuré |
| 13 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 61,0 % | 24 février 2025 | ✅ Mesuré |
| 14 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 48,5 % | 14 avril 2025 | ✅ Mesuré |
| 15 | GPT-4o | OpenAI | 🔒 Propriétaire | 31,0 % | 27 mars 2025 | ✅ Mesuré |
Classement établi sur 15 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 71,3 %.
Notre analyse
Un score élevé indique qu’un modèle résout une forte proportion d’issues en produisant des patchs qui passent les tests unitaires. Cette métrique mesure donc un résultat opérationnel, et pas seulement la plausibilité du code généré. La validation humaine du sous-ensemble et la vérification par tests renforcent la rigueur de l’évaluation. Les scores de la base étant au moins partiellement mesurés par un tiers, ils ne reposent pas uniquement sur des déclarations des éditeurs.
La portée reste toutefois circonscrite à 500 instances, avec des descriptions en anglais et du code principalement en Python. L’accès public appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Avec une médiane de 74 % parmi 32 modèles et un meilleur score de 83 % pour Claude Opus 4.7, le classement révèle des performances déjà élevées et un écart limité entre le centre de la distribution et la tête. Cette concentration peut réduire le pouvoir discriminant du benchmark à mesure que les modèles progressent, sans signifier que les tâches réelles de maintenance logicielle sont entièrement maîtrisées.
Sources des scores : epoch.