FrontierCode 1.1

FrontierCode 1.1 est un benchmark conçu pour évaluer des agents de programmation sur des tâches concrètes de modification de code au sein de dépôts logiciels. Les consignes demandent de comprendre une base de code, d’interpréter une demande de changement et de produire une solution…

FrontierCode 1.1 est un benchmark conçu pour évaluer des agents de programmation sur des tâches concrètes de modification de code au sein de dépôts logiciels. Les consignes demandent de comprendre une base de code, d’interpréter une demande de changement et de produire une solution robuste.

L’évaluation cherche à déterminer si les modifications générées sont suffisamment correctes et fiables pour être fusionnées. Elle situe ainsi les modèles selon leur aptitude à mener un travail de développement agentique jusqu’à un résultat exploitable.

Carte d'identité

CaractéristiqueValeur
Capacités mesuréesagents, code, raisonnement
ModalitéTexte
Type de questionstâches agentiques de modification de code dans des dépôts logiciels
Métrique d'évaluationscore de mergeabilité normalisé, fondé sur des tests unitaires, des rubriques de mainteneurs et des vérificateurs
Languesanglais pour les consignes ; langages de programmation multiples ou non précisés

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (15)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Fable 5Anthropic🔒 Propriétaire53,5 %9 juin 2026n.d.
2Claude Opus 5Anthropic🔒 Propriétaire53,4 %24 juillet 2026n.d.
3GPT-5.6 SolOpenAI🔒 Propriétaire47,5 %9 juillet 2026n.d.
4Claude Opus 4.8Anthropic🔒 Propriétaire46,5 %28 mai 2026n.d.
5GPT-5.5OpenAI🔒 Propriétaire43,0 %23 avril 2026n.d.
6Claude Sonnet 5Anthropic🔒 Propriétaire42,7 %30 juin 2026n.d.
7Grok 4.5xAI🔒 Propriétaire42,4 %16 juillet 2026n.d.
8GPT-5.6 TerraOpenAI🔒 Propriétaire41,3 %9 juillet 2026n.d.
9GPT-5.6 LunaOpenAI🔒 Propriétaire39,8 %9 juillet 2026n.d.
10Claude Opus 4.7Anthropic🔒 Propriétaire38,5 %16 avril 2026n.d.
11Kimi K2.7 CodeMoonshot AI🟢 Ouvert30,1 %12 juin 2026n.d.
12GLM-5.2Zhipu AI🟢 Ouvert24,5 %16 juin 2026n.d.
13DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert17,6 %23 avril 2026n.d.
14MiniMax M3MiniMax🟢 Ouvert14,7 %1 juin 2026n.d.
15Qwen3.7-PlusQwen🔒 Propriétaire10,2 %31 mai 2026n.d.

Classement établi sur 15 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 41,3 %.

Notre analyse

Un score élevé indique que les changements proposés satisfont davantage les critères de mergeabilité définis par le benchmark. L’évaluation combine des tests unitaires, des rubriques établies par des mainteneurs et des vérificateurs, ce qui couvre plusieurs dimensions de la qualité d’une modification. Les exécutions signalées pour un usage déloyal d’internet reçoivent un score nul, afin de limiter cet avantage. La portée reste toutefois ciblée sur la modification agentique de dépôts à partir de consignes en anglais. Elle ne résume donc pas l’ensemble des capacités de programmation d’un modèle. Les résultats disponibles ne suggèrent pas de saturation au sommet, puisque le meilleur score atteint 54 %. Leur interprétation appelle néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante. Dans la base évaluée, Claude Fable 5 se détache avec 54 %, tandis que la médiane de 41 % montre qu’une part importante des modèles produit encore des changements moins régulièrement mergeables selon ce protocole.


Sources des scores : llm-stats.