FrontierCode 1.1
FrontierCode 1.1 est un benchmark conçu pour évaluer des agents de programmation sur des tâches concrètes de modification de code au sein de dépôts logiciels. Les consignes demandent de comprendre une base de code, d’interpréter une demande de changement et de produire une solution…
FrontierCode 1.1 est un benchmark conçu pour évaluer des agents de programmation sur des tâches concrètes de modification de code au sein de dépôts logiciels. Les consignes demandent de comprendre une base de code, d’interpréter une demande de changement et de produire une solution robuste.
L’évaluation cherche à déterminer si les modifications générées sont suffisamment correctes et fiables pour être fusionnées. Elle situe ainsi les modèles selon leur aptitude à mener un travail de développement agentique jusqu’à un résultat exploitable.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Capacités mesurées | agents, code, raisonnement |
| Modalité | Texte |
| Type de questions | tâches agentiques de modification de code dans des dépôts logiciels |
| Métrique d'évaluation | score de mergeabilité normalisé, fondé sur des tests unitaires, des rubriques de mainteneurs et des vérificateurs |
| Langues | anglais pour les consignes ; langages de programmation multiples ou non précisés |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 53,5 % | 9 juin 2026 | n.d. |
| 2 | Claude Opus 5 | Anthropic | 🔒 Propriétaire | 53,4 % | 24 juillet 2026 | n.d. |
| 3 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 47,5 % | 9 juillet 2026 | n.d. |
| 4 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 46,5 % | 28 mai 2026 | n.d. |
| 5 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 43,0 % | 23 avril 2026 | n.d. |
| 6 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 42,7 % | 30 juin 2026 | n.d. |
| 7 | Grok 4.5 | xAI | 🔒 Propriétaire | 42,4 % | 16 juillet 2026 | n.d. |
| 8 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 41,3 % | 9 juillet 2026 | n.d. |
| 9 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 39,8 % | 9 juillet 2026 | n.d. |
| 10 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 38,5 % | 16 avril 2026 | n.d. |
| 11 | Kimi K2.7 Code | Moonshot AI | 🟢 Ouvert | 30,1 % | 12 juin 2026 | n.d. |
| 12 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 24,5 % | 16 juin 2026 | n.d. |
| 13 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 17,6 % | 23 avril 2026 | n.d. |
| 14 | MiniMax M3 | MiniMax | 🟢 Ouvert | 14,7 % | 1 juin 2026 | n.d. |
| 15 | Qwen3.7-Plus | Qwen | 🔒 Propriétaire | 10,2 % | 31 mai 2026 | n.d. |
Classement établi sur 15 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 41,3 %.
Notre analyse
Un score élevé indique que les changements proposés satisfont davantage les critères de mergeabilité définis par le benchmark. L’évaluation combine des tests unitaires, des rubriques établies par des mainteneurs et des vérificateurs, ce qui couvre plusieurs dimensions de la qualité d’une modification. Les exécutions signalées pour un usage déloyal d’internet reçoivent un score nul, afin de limiter cet avantage. La portée reste toutefois ciblée sur la modification agentique de dépôts à partir de consignes en anglais. Elle ne résume donc pas l’ensemble des capacités de programmation d’un modèle. Les résultats disponibles ne suggèrent pas de saturation au sommet, puisque le meilleur score atteint 54 %. Leur interprétation appelle néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante. Dans la base évaluée, Claude Fable 5 se détache avec 54 %, tandis que la médiane de 41 % montre qu’une part importante des modèles produit encore des changements moins régulièrement mergeables selon ce protocole.
Sources des scores : llm-stats.