SWE-Lancer

SWE-Lancer est un benchmark créé par OpenAI pour évaluer les grands modèles de langage sur des missions réelles d’ingénierie logicielle issues d’Upwork. Les tâches couvrent la correction de bugs, l’implémentation de fonctionnalités et la sélection de propositions techniques.

SWE-Lancer est un benchmark créé par OpenAI pour évaluer les grands modèles de langage sur des missions réelles d’ingénierie logicielle issues d’Upwork. Les tâches couvrent la correction de bugs, l’implémentation de fonctionnalités et la sélection de propositions techniques.

Il rapproche ainsi l’évaluation des modèles de situations professionnelles concrètes, avec des travaux d’ingénierie notés par des tests de bout en bout triple-vérifiés et des décisions managériales comparées aux choix des responsables d’origine. Les performances sont exprimées en taux de réussite et en valeur économique gagnée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesRésolution de tâches d'ingénierie logicielle freelance réelles (Upwork) : corrections de bugs, implémentation de fonctionnalités et choix de propositions techniques
ModalitéTexte
Type de questionsingénierie logicielle réelle (correction de bug / implémentation de feature + décisions managériales)
Métrique d'évaluationtaux de réussite (tests E2E triple-vérifiés) et valeur en dollars gagnée
AccèsPublic
Languesanglais + code
Taille du jeuplus de 1 400 tâches (~1 M USD au total)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.1 CodexOpenAI🔒 Propriétaire66,3 %19 novembre 2025Auto-déclaré
2GPT-4.5OpenAI🔒 Propriétaire37,3 %5 mars 2026Auto-déclaré
3GPT-4oOpenAI🔒 Propriétaire32,6 %27 mars 2025Auto-déclaré
4o3-miniOpenAI🔒 Propriétaire18,0 %30 janvier 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 35,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle réussit une part importante de missions logicielles réelles et génère davantage de valeur associée aux tâches résolues. L’usage de tests E2E triple-vérifiés apporte une base mesurée aux tâches d’ingénierie indépendantes, tandis que les exercices managériaux sont évalués par comparaison avec les décisions prises à l’origine. La fiabilité du classement doit néanmoins être nuancée, car les scores disponibles sont majoritairement auto-déclarés par les éditeurs.

Le meilleur résultat, 66 % pour GPT-5.1 Codex, reste éloigné d’une réussite systématique, ce qui ne suggère pas une saturation du benchmark parmi les modèles classés. Son accès public peut toutefois accroître, avec le temps, le risque d’exposition des modèles aux tâches, donc de contamination des évaluations futures. Sa portée demeure centrée sur l’ingénierie logicielle freelance en anglais et en code, ainsi que sur les décisions managériales associées. Enfin, le classement révèle surtout des écarts internes à l’offre d’OpenAI : les quatre modèles répertoriés proviennent de cet éditeur, également créateur du benchmark. Il ne constitue donc pas une comparaison indépendante entre OpenAI et d’autres éditeurs.


Sources des scores : llm-stats.