DeepSWE 1.1
DeepSWE 1.1 est un benchmark créé par Together AI et Agentica pour évaluer des agents d’ingénierie logicielle dans le harnais mini-swe-agent. Il examine leur aptitude à traiter des tâches concrètes de résolution de problèmes au sein de dépôts de code.
DeepSWE 1.1 est un benchmark créé par Together AI et Agentica pour évaluer des agents d’ingénierie logicielle dans le harnais mini-swe-agent. Il examine leur aptitude à traiter des tâches concrètes de résolution de problèmes au sein de dépôts de code.
Chaque tâche mobilise une chaîne d’actions comprenant l’analyse d’un ticket, l’exploration du dépôt, la modification du code et la production d’un correctif validé par des tests. Le benchmark sert ainsi à comparer la capacité opérationnelle des modèles à mener un travail logiciel jusqu’à sa résolution.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Together AI et Agentica |
| Capacités mesurées | agents, code |
| Modalité | Texte |
| Type de questions | tâches agentiques de résolution de problèmes logiciels avec modification de dépôts de code |
| Métrique d'évaluation | taux de résolution des tâches |
| Langues | anglais pour les tickets et instructions, principalement Python pour le code |
| Année de publication | 2025 |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (19)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 73,0 % | 9 juillet 2026 | n.d. |
| 2 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 70,0 % | 9 juin 2026 | n.d. |
| 3 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 70,0 % | 9 juillet 2026 | n.d. |
| 4 | Kimi K3 | Moonshot AI | 🟢 Ouvert | 69,0 % | 16 juillet 2026 | n.d. |
| 5 | Claude Opus 5 | Anthropic | 🔒 Propriétaire | 68,8 % | 24 juillet 2026 | Auto-déclaré |
| 6 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 67,0 % | 23 avril 2026 | n.d. |
| 7 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 67,0 % | 9 juillet 2026 | n.d. |
| 8 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 59,0 % | 28 mai 2026 | n.d. |
| 9 | Qwen3.8 Max | Qwen | 🔒 Propriétaire | 56,6 % | 2 août 2026 | Auto-déclaré |
| 10 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 54,0 % | 30 juin 2026 | n.d. |
| 11 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 53,3 % | 9 juillet 2026 | Auto-déclaré |
| 12 | Grok 4.5 | xAI | 🔒 Propriétaire | 53,0 % | 16 juillet 2026 | Auto-déclaré |
| 13 | GPT-5.4 | OpenAI | 🔒 Propriétaire | 52,0 % | 5 mars 2026 | n.d. |
| 14 | Gemini 3.6 Flash | 🔒 Propriétaire | 49,0 % | 21 juillet 2026 | n.d. | |
| 15 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 44,0 % | 16 juin 2026 | n.d. |
| 16 | Gemini 3.5 Flash | 🔒 Propriétaire | 37,0 % | 19 mai 2026 | n.d. | |
| 17 | Kimi K2.7 Code | Moonshot AI | 🟢 Ouvert | 31,0 % | 12 juin 2026 | n.d. |
| 18 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 30,0 % | 17 février 2026 | n.d. |
| 19 | Gemini 3.1 Pro Preview | ▫ n.d. | 12,0 % | 19 février 2026 | n.d. |
Classement établi sur 19 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 54,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent résout une grande proportion des tâches dans le cadre précis de mini-swe-agent. Il traduit donc une bonne maîtrise de l’analyse des tickets, de la navigation dans les dépôts, de l’édition du code et de la validation par tests. Cette dernière fournit un critère mesuré, mais la fiabilité globale doit être nuancée puisque les scores sont majoritairement auto-déclarés par les éditeurs. Leur comparabilité dépend ainsi de l’application cohérente du harnais et du protocole. Le meilleur résultat, obtenu par GPT-5.6 Sol à 73 %, reste nettement au-dessus de la médiane de 54 % parmi les 19 modèles évalués, ce qui révèle des écarts substantiels de performance et ne suggère pas encore une saturation complète au sommet. La contamination éventuelle des tickets par les données d’entraînement demeure un risque à surveiller, car elle pourrait favoriser la mémorisation au détriment de la résolution réelle. Enfin, la portée reste ciblée sur des tickets et instructions en anglais, avec du code principalement en Python, dans un environnement agentique spécifique.
Sources des scores : llm-stats.