FrontierSWE

FrontierSWE est un benchmark créé par Proximal (Proximal-Labs) pour évaluer la capacité d’agents d’IA à mener des projets techniques ouverts sur des horizons allant de plusieurs heures à plusieurs dizaines d’heures.

FrontierSWE est un benchmark créé par Proximal (Proximal-Labs) pour évaluer la capacité d’agents d’IA à mener des projets techniques ouverts sur des horizons allant de plusieurs heures à plusieurs dizaines d’heures.

Ses tâches couvrent notamment l’optimisation de systèmes, la construction de code à grande échelle et la recherche appliquée en machine learning. Il sert ainsi à mesurer non seulement l’implémentation, mais aussi la capacité à poursuivre un objectif complexe, à optimiser une solution et à produire un résultat performant dans la durée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkProximal (Proximal-Labs)
Capacités mesuréesRealisation de projets techniques ouverts a l'echelle de plusieurs heures a dizaines d'heures : optimisation systeme, construction de code a grande echelle, recherche ML appliquee
ModalitéTexte
Type de questionsTaches d'ingenierie ouvertes ultra-long-horizon pour agents (implementation, optimisation perf, recherche ML)
Métrique d'évaluationTaux de reussite / score de performance par tache
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeuPetit ensemble de taches extremement difficiles (nombre non divulgue) ; ~20h allouees, ~11h d'execution moyenne par tache
RessourcesSite / dépôt officiel

Classement des modèles (14)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Fable 5Anthropic🔒 Propriétaire90,0 %9 juin 2026n.d.
2Kimi K3Moonshot AI▫ n.d.81,2 %16 juillet 2026Auto-déclaré
3Claude Opus 4.8Anthropic🔒 Propriétaire75,0 %28 mai 2026n.d.
4GLM-5.2Zhipu AI🟢 Ouvert74,0 %16 juin 2026n.d.
5GPT-5.5OpenAI🔒 Propriétaire73,0 %23 avril 2026n.d.
6Claude Opus 4.7Anthropic🔒 Propriétaire63,0 %16 avril 2026n.d.
7Claude Opus 4.6Anthropic🔒 Propriétaire56,0 %5 février 2026n.d.
8GPT-4.5OpenAI🔒 Propriétaire54,0 %5 mars 2026n.d.
9Gemini 3.1 Pro PreviewGoogle▫ n.d.40,0 %19 février 2026n.d.
10GLM-5.1Zhipu AI🟢 Ouvert31,0 %7 avril 2026n.d.
11DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert29,0 %23 avril 2026n.d.
12Kimi K2.6Moonshot AI🟢 Ouvert27,0 %20 avril 2026n.d.
13Kimi K2.5Moonshot AI🟢 Ouvert26,0 %27 janvier 2026n.d.
14Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire22,0 %31 mars 2026n.d.

Classement établi sur 14 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 55,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur FrontierSWE traduit une forte capacité à achever des tâches d’ingénierie ouvertes et à obtenir de bonnes performances après une exécution prolongée. Le classement met en évidence un écart important entre la médiane de 54 % des 13 modèles évalués et Claude Fable 5, qui atteint 90 %. Ce résultat place nettement le meilleur modèle au-dessus du niveau central de l’ensemble, tout en laissant une marge avant le plafond, ce qui ne signale pas une saturation complète du benchmark.

La durée d’exécution et l’extrême difficulté des tâches renforcent la portée pratique de l’évaluation. Toutefois, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de la rigueur des protocoles appliqués par chacun. Le jeu de test privé et les réponses non divulguées limitent l’exposition directe aux solutions, ce qui réduit le risque de contamination sans l’annuler nécessairement. Enfin, le petit ensemble de tâches, en anglais et centré sur quelques domaines techniques, restreint la portée du classement à l’ingénierie agentique ultra-long-horizon plutôt qu’aux capacités générales des modèles.


Sources des scores : llm-stats.