SWE-Bench verified

Epoch: SWE-Bench verified est un benchmark créé par OpenAI et SWE-bench/Princeton NLP à partir d’un sous-ensemble de SWE-bench validé par des humains. Il repose sur des tâches réelles de maintenance logicielle issues de dépôts GitHub.

Epoch: SWE-Bench verified est un benchmark créé par OpenAI et SWE-bench/Princeton NLP à partir d’un sous-ensemble de SWE-bench validé par des humains. Il repose sur des tâches réelles de maintenance logicielle issues de dépôts GitHub.

Chaque instance demande à un modèle ou à un agent de comprendre une issue, de modifier un dépôt Python et de générer un correctif conforme aux tests. Le benchmark sert ainsi à évaluer des capacités agentiques appliquées au code, au-delà de la simple génération de réponses ou d’extraits isolés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI et SWE-bench/Princeton NLP
Capacités mesuréesMesure la capacité d’un modèle ou agent à comprendre une issue logicielle réelle, modifier un dépôt de code et produire un correctif qui passe les tests.
ModalitéTexte
Type de questionstâches agentiques de correction de bugs et génération de patch à partir d'issues GitHub
Métrique d'évaluationtaux de résolution des instances, vérifié par tests unitaires
AccèsPublic
LicenceMIT
Languesanglais pour les descriptions, principalement Python pour le code
Taille du jeu500 instances
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (15)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek V4 ProDeepSeek▫ n.d.77,6 %24 avril 2026✅ Mesuré
2Claude Opus 4.5Anthropic🔒 Propriétaire76,7 %24 novembre 2025✅ Mesuré
3Qwen 3.6 MaxQwen▫ n.d.76,7 %20 avril 2026✅ Mesuré
4Gemini 3.1 Pro PreviewGoogle▫ n.d.75,6 %19 février 2026✅ Mesuré
5GPT-5.2OpenAI🔒 Propriétaire73,8 %11 décembre 2025✅ Mesuré
6GPT-5OpenAI🔒 Propriétaire73,6 %7 août 2025✅ Mesuré
7Claude Opus 4.1Anthropic🔒 Propriétaire73,3 %5 août 2025✅ Mesuré
8Claude Sonnet 4.5Anthropic🔒 Propriétaire71,3 %29 septembre 2025✅ Mesuré
9Claude Opus 4Anthropic🔒 Propriétaire70,7 %22 mai 2025✅ Mesuré
10GPT-5.1OpenAI🔒 Propriétaire68,0 %13 novembre 2025✅ Mesuré
11GPT-5 miniOpenAI🔒 Propriétaire64,7 %7 août 2025✅ Mesuré
12o3OpenAI🔒 Propriétaire62,3 %16 avril 2025✅ Mesuré
13Claude 3.7 SonnetAnthropic🔒 Propriétaire61,0 %24 février 2025✅ Mesuré
14GPT-4.1OpenAI🔒 Propriétaire48,5 %14 avril 2025✅ Mesuré
15GPT-4oOpenAI🔒 Propriétaire31,0 %27 mars 2025✅ Mesuré

Classement établi sur 15 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 71,3 %.

Notre analyse

Un score élevé indique qu’un modèle résout une forte proportion d’issues en produisant des patchs qui passent les tests unitaires. Cette métrique mesure donc un résultat opérationnel, et pas seulement la plausibilité du code généré. La validation humaine du sous-ensemble et la vérification par tests renforcent la rigueur de l’évaluation. Les scores de la base étant au moins partiellement mesurés par un tiers, ils ne reposent pas uniquement sur des déclarations des éditeurs.

La portée reste toutefois circonscrite à 500 instances, avec des descriptions en anglais et du code principalement en Python. L’accès public appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Avec une médiane de 74 % parmi 32 modèles et un meilleur score de 83 % pour Claude Opus 4.7, le classement révèle des performances déjà élevées et un écart limité entre le centre de la distribution et la tête. Cette concentration peut réduire le pouvoir discriminant du benchmark à mesure que les modèles progressent, sans signifier que les tâches réelles de maintenance logicielle sont entièrement maîtrisées.


Sources des scores : epoch.