DeepSWE 1.1

DeepSWE 1.1 est un benchmark créé par Together AI et Agentica pour évaluer des agents d’ingénierie logicielle dans le harnais mini-swe-agent. Il examine leur aptitude à traiter des tâches concrètes de résolution de problèmes au sein de dépôts de code.

DeepSWE 1.1 est un benchmark créé par Together AI et Agentica pour évaluer des agents d’ingénierie logicielle dans le harnais mini-swe-agent. Il examine leur aptitude à traiter des tâches concrètes de résolution de problèmes au sein de dépôts de code.

Chaque tâche mobilise une chaîne d’actions comprenant l’analyse d’un ticket, l’exploration du dépôt, la modification du code et la production d’un correctif validé par des tests. Le benchmark sert ainsi à comparer la capacité opérationnelle des modèles à mener un travail logiciel jusqu’à sa résolution.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkTogether AI et Agentica
Capacités mesuréesagents, code
ModalitéTexte
Type de questionstâches agentiques de résolution de problèmes logiciels avec modification de dépôts de code
Métrique d'évaluationtaux de résolution des tâches
Languesanglais pour les tickets et instructions, principalement Python pour le code
Année de publication2025

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (19)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire73,0 %9 juillet 2026n.d.
2Claude Fable 5Anthropic🔒 Propriétaire70,0 %9 juin 2026n.d.
3GPT-5.6 TerraOpenAI🔒 Propriétaire70,0 %9 juillet 2026n.d.
4Kimi K3Moonshot AI🟢 Ouvert69,0 %16 juillet 2026n.d.
5Claude Opus 5Anthropic🔒 Propriétaire68,8 %24 juillet 2026Auto-déclaré
6GPT-5.5OpenAI🔒 Propriétaire67,0 %23 avril 2026n.d.
7GPT-5.6 LunaOpenAI🔒 Propriétaire67,0 %9 juillet 2026n.d.
8Claude Opus 4.8Anthropic🔒 Propriétaire59,0 %28 mai 2026n.d.
9Qwen3.8 MaxQwen🔒 Propriétaire56,6 %2 août 2026Auto-déclaré
10Claude Sonnet 5Anthropic🔒 Propriétaire54,0 %30 juin 2026n.d.
11Muse Spark 1.1Meta🔒 Propriétaire53,3 %9 juillet 2026Auto-déclaré
12Grok 4.5xAI🔒 Propriétaire53,0 %16 juillet 2026Auto-déclaré
13GPT-5.4OpenAI🔒 Propriétaire52,0 %5 mars 2026n.d.
14Gemini 3.6 FlashGoogle🔒 Propriétaire49,0 %21 juillet 2026n.d.
15GLM-5.2Zhipu AI🟢 Ouvert44,0 %16 juin 2026n.d.
16Gemini 3.5 FlashGoogle🔒 Propriétaire37,0 %19 mai 2026n.d.
17Kimi K2.7 CodeMoonshot AI🟢 Ouvert31,0 %12 juin 2026n.d.
18Claude Sonnet 4.6Anthropic🔒 Propriétaire30,0 %17 février 2026n.d.
19Gemini 3.1 Pro PreviewGoogle▫ n.d.12,0 %19 février 2026n.d.

Classement établi sur 19 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 54,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent résout une grande proportion des tâches dans le cadre précis de mini-swe-agent. Il traduit donc une bonne maîtrise de l’analyse des tickets, de la navigation dans les dépôts, de l’édition du code et de la validation par tests. Cette dernière fournit un critère mesuré, mais la fiabilité globale doit être nuancée puisque les scores sont majoritairement auto-déclarés par les éditeurs. Leur comparabilité dépend ainsi de l’application cohérente du harnais et du protocole. Le meilleur résultat, obtenu par GPT-5.6 Sol à 73 %, reste nettement au-dessus de la médiane de 54 % parmi les 19 modèles évalués, ce qui révèle des écarts substantiels de performance et ne suggère pas encore une saturation complète au sommet. La contamination éventuelle des tickets par les données d’entraînement demeure un risque à surveiller, car elle pourrait favoriser la mémorisation au détriment de la résolution réelle. Enfin, la portée reste ciblée sur des tickets et instructions en anglais, avec du code principalement en Python, dans un environnement agentique spécifique.


Sources des scores : llm-stats.