FrontierSWE
FrontierSWE est un benchmark créé par Proximal (Proximal-Labs) pour évaluer la capacité d’agents d’IA à mener des projets techniques ouverts sur des horizons allant de plusieurs heures à plusieurs dizaines d’heures.
FrontierSWE est un benchmark créé par Proximal (Proximal-Labs) pour évaluer la capacité d’agents d’IA à mener des projets techniques ouverts sur des horizons allant de plusieurs heures à plusieurs dizaines d’heures.
Ses tâches couvrent notamment l’optimisation de systèmes, la construction de code à grande échelle et la recherche appliquée en machine learning. Il sert ainsi à mesurer non seulement l’implémentation, mais aussi la capacité à poursuivre un objectif complexe, à optimiser une solution et à produire un résultat performant dans la durée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Proximal (Proximal-Labs) |
| Capacités mesurées | Realisation de projets techniques ouverts a l'echelle de plusieurs heures a dizaines d'heures : optimisation systeme, construction de code a grande echelle, recherche ML appliquee |
| Modalité | Texte |
| Type de questions | Taches d'ingenierie ouvertes ultra-long-horizon pour agents (implementation, optimisation perf, recherche ML) |
| Métrique d'évaluation | Taux de reussite / score de performance par tache |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | Petit ensemble de taches extremement difficiles (nombre non divulgue) ; ~20h allouees, ~11h d'execution moyenne par tache |
| Ressources | Site / dépôt officiel |
Classement des modèles (14)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 90,0 % | 9 juin 2026 | n.d. |
| 2 | Kimi K3 | Moonshot AI | ▫ n.d. | 81,2 % | 16 juillet 2026 | Auto-déclaré |
| 3 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 75,0 % | 28 mai 2026 | n.d. |
| 4 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 74,0 % | 16 juin 2026 | n.d. |
| 5 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 73,0 % | 23 avril 2026 | n.d. |
| 6 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 63,0 % | 16 avril 2026 | n.d. |
| 7 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 56,0 % | 5 février 2026 | n.d. |
| 8 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 54,0 % | 5 mars 2026 | n.d. |
| 9 | Gemini 3.1 Pro Preview | ▫ n.d. | 40,0 % | 19 février 2026 | n.d. | |
| 10 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 31,0 % | 7 avril 2026 | n.d. |
| 11 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 29,0 % | 23 avril 2026 | n.d. |
| 12 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 27,0 % | 20 avril 2026 | n.d. |
| 13 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 26,0 % | 27 janvier 2026 | n.d. |
| 14 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 22,0 % | 31 mars 2026 | n.d. |
Classement établi sur 14 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 55,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur FrontierSWE traduit une forte capacité à achever des tâches d’ingénierie ouvertes et à obtenir de bonnes performances après une exécution prolongée. Le classement met en évidence un écart important entre la médiane de 54 % des 13 modèles évalués et Claude Fable 5, qui atteint 90 %. Ce résultat place nettement le meilleur modèle au-dessus du niveau central de l’ensemble, tout en laissant une marge avant le plafond, ce qui ne signale pas une saturation complète du benchmark.
La durée d’exécution et l’extrême difficulté des tâches renforcent la portée pratique de l’évaluation. Toutefois, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de la rigueur des protocoles appliqués par chacun. Le jeu de test privé et les réponses non divulguées limitent l’exposition directe aux solutions, ce qui réduit le risque de contamination sans l’annuler nécessairement. Enfin, le petit ensemble de tâches, en anglais et centré sur quelques domaines techniques, restreint la portée du classement à l’ingénierie agentique ultra-long-horizon plutôt qu’aux capacités générales des modèles.
Sources des scores : llm-stats.