SWE-Lancer (IC-Diamond subset)
SWE-Lancer (IC-Diamond subset) est un benchmark créé par OpenAI à partir de missions freelance réelles publiées sur Upwork. Il porte sur des tâches indépendantes d’ingénierie logicielle, allant de la correction de bugs à l’implémentation de fonctionnalités dans un dépôt existant.
SWE-Lancer (IC-Diamond subset) est un benchmark créé par OpenAI à partir de missions freelance réelles publiées sur Upwork. Il porte sur des tâches indépendantes d’ingénierie logicielle, allant de la correction de bugs à l’implémentation de fonctionnalités dans un dépôt existant.
Le benchmark mesure la capacité d’un modèle à conduire un travail logiciel autonome de bout en bout. Les solutions sont contrôlées par des tests fonctionnels, tandis que certaines tâches managériales évaluent le choix entre plusieurs propositions techniques. Il vise ainsi une évaluation proche de conditions professionnelles concrètes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Ingénierie logicielle autonome de bout en bout, résolution de bugs et implémentation de fonctionnalités sur un dépôt réel |
| Modalité | Texte |
| Type de questions | tâches d'ingénierie logicielle freelance réelles (corrections de bugs, fonctionnalités), évaluées par tests end-to-end |
| Métrique d'évaluation | tests end-to-end réussis / valeur monétaire des tâches résolues ($) |
| Accès | Public |
| Langues | anglais ; code principalement JavaScript/TypeScript (app Expensify) |
| Taille du jeu | 237 tâches IC SWE (sous-ensemble Diamond, ≈236 300 $) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 🔒 Propriétaire | 100,0 % | 7 août 2025 | Auto-déclaré |
| 2 | GPT-5.3 Codex | OpenAI | 🔒 Propriétaire | 81,4 % | 5 février 2026 | Auto-déclaré |
| 3 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 74,6 % | 11 décembre 2025 | Auto-déclaré |
| 4 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 17,4 % | 5 mars 2026 | Auto-déclaré |
| 5 | GPT-4o | OpenAI | 🔒 Propriétaire | 12,4 % | 27 mars 2025 | Auto-déclaré |
| 6 | o3-mini | OpenAI | 🔒 Propriétaire | 7,4 % | 30 janvier 2025 | Auto-déclaré |
Classement établi sur 6 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 46,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle réussit une part importante des tests end-to-end et résout des tâches représentant une forte valeur monétaire. L’évaluation repose sur des tests vérifiés trois fois par des ingénieurs logiciels expérimentés, ce qui renforce la rigueur du dispositif. La lecture des résultats exige néanmoins de distinguer cette méthode de validation de la provenance des scores publiés, majoritairement auto-déclarés par les éditeurs.
Le meilleur résultat atteint 100 %, ce qui signale une saturation possible du sous-ensemble pour le modèle concerné et réduit sa capacité à départager les systèmes les plus performants. L’accès public appelle aussi à considérer le risque de contamination lors de l’interprétation. La portée reste centrée sur un dépôt réel, l’application Expensify, avec du code principalement JavaScript et TypeScript, ainsi que sur des missions issues d’Upwork.
Le classement montre un écart marqué entre sa médiane et son meilleur score. Toutefois, les six modèles classés sont édités par OpenAI, également créateur du benchmark. Ce classement ne constitue donc pas une comparaison indépendante entre les modèles OpenAI et ceux d’autres éditeurs.
Sources des scores : llm-stats.