SWE-Lancer
SWE-Lancer est un benchmark créé par OpenAI pour évaluer les grands modèles de langage sur des missions réelles d’ingénierie logicielle issues d’Upwork. Les tâches couvrent la correction de bugs, l’implémentation de fonctionnalités et la sélection de propositions techniques.
SWE-Lancer est un benchmark créé par OpenAI pour évaluer les grands modèles de langage sur des missions réelles d’ingénierie logicielle issues d’Upwork. Les tâches couvrent la correction de bugs, l’implémentation de fonctionnalités et la sélection de propositions techniques.
Il rapproche ainsi l’évaluation des modèles de situations professionnelles concrètes, avec des travaux d’ingénierie notés par des tests de bout en bout triple-vérifiés et des décisions managériales comparées aux choix des responsables d’origine. Les performances sont exprimées en taux de réussite et en valeur économique gagnée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Résolution de tâches d'ingénierie logicielle freelance réelles (Upwork) : corrections de bugs, implémentation de fonctionnalités et choix de propositions techniques |
| Modalité | Texte |
| Type de questions | ingénierie logicielle réelle (correction de bug / implémentation de feature + décisions managériales) |
| Métrique d'évaluation | taux de réussite (tests E2E triple-vérifiés) et valeur en dollars gagnée |
| Accès | Public |
| Langues | anglais + code |
| Taille du jeu | plus de 1 400 tâches (~1 M USD au total) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.1 Codex | OpenAI | 🔒 Propriétaire | 66,3 % | 19 novembre 2025 | Auto-déclaré |
| 2 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 37,3 % | 5 mars 2026 | Auto-déclaré |
| 3 | GPT-4o | OpenAI | 🔒 Propriétaire | 32,6 % | 27 mars 2025 | Auto-déclaré |
| 4 | o3-mini | OpenAI | 🔒 Propriétaire | 18,0 % | 30 janvier 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 35,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle réussit une part importante de missions logicielles réelles et génère davantage de valeur associée aux tâches résolues. L’usage de tests E2E triple-vérifiés apporte une base mesurée aux tâches d’ingénierie indépendantes, tandis que les exercices managériaux sont évalués par comparaison avec les décisions prises à l’origine. La fiabilité du classement doit néanmoins être nuancée, car les scores disponibles sont majoritairement auto-déclarés par les éditeurs.
Le meilleur résultat, 66 % pour GPT-5.1 Codex, reste éloigné d’une réussite systématique, ce qui ne suggère pas une saturation du benchmark parmi les modèles classés. Son accès public peut toutefois accroître, avec le temps, le risque d’exposition des modèles aux tâches, donc de contamination des évaluations futures. Sa portée demeure centrée sur l’ingénierie logicielle freelance en anglais et en code, ainsi que sur les décisions managériales associées. Enfin, le classement révèle surtout des écarts internes à l’offre d’OpenAI : les quatre modèles répertoriés proviennent de cet éditeur, également créateur du benchmark. Il ne constitue donc pas une comparaison indépendante entre OpenAI et d’autres éditeurs.
Sources des scores : llm-stats.