CyberGym
CyberGym est un benchmark de cybersécurité créé en 2025 par une équipe de l’UC Berkeley menée par Dawn Song. Il évalue des agents IA dans un environnement contrôlé, à travers des tâches fondées sur des vulnérabilités logicielles réelles.
CyberGym est un benchmark de cybersécurité créé en 2025 par une équipe de l’UC Berkeley menée par Dawn Song. Il évalue des agents IA dans un environnement contrôlé, à travers des tâches fondées sur des vulnérabilités logicielles réelles.
Les agents doivent analyser une description et le code associé, identifier la faille puis générer une preuve de concept capable de la reproduire. CyberGym mesure ainsi des aptitudes pratiques d’analyse de sécurité, au-delà de la simple restitution de connaissances, et permet de comparer les modèles sur leur capacité à accomplir une tâche agentique vérifiable.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | UC Berkeley (Dawn Song et al.) |
| Capacités mesurées | Identification et reproduction de vulnérabilités logicielles réelles, analyse de sécurité par des agents IA |
| Modalité | Texte |
| Type de questions | tâches de cybersécurité agentiques (génération d'un PoC reproduisant une vulnérabilité à partir de sa description et du code) |
| Métrique d'évaluation | taux de succès (reproduction effective de la vulnérabilité) |
| Accès | Public |
| Langues | anglais (descriptions) ; code multi-langage (C/C++, etc.) |
| Taille du jeu | 1 507 vulnérabilités réelles sur 188 projets logiciels |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 83,1 % | — | Auto-déclaré |
| 2 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 81,8 % | 23 avril 2026 | Auto-déclaré |
| 3 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 78,8 % | 28 mai 2026 | Auto-déclaré |
| 4 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 73,8 % | 5 février 2026 | Auto-déclaré |
| 5 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 73,1 % | 16 avril 2026 | Auto-déclaré |
| 6 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 70,2 % | 24 juin 2026 | Auto-déclaré |
| 7 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 68,7 % | 7 avril 2026 | Auto-déclaré |
| 8 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 67,0 % | 24 juin 2026 | Auto-déclaré |
| 9 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 41,3 % | 27 janvier 2026 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 73,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent parvient fréquemment à produire une preuve de concept reproduisant effectivement les vulnérabilités proposées. La métrique repose donc sur l’aboutissement concret de la tâche, plutôt que sur une appréciation qualitative de la réponse. La médiane de 73 % parmi les neuf modèles évalués traduit des performances déjà élevées, sans saturation complète puisque le meilleur résultat, obtenu par Claude Mythos Preview, atteint 83 %.
La lecture du classement exige néanmoins de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui limite l’homogénéité de leur validation par rapport à une évaluation entièrement mesurée de manière indépendante. L’accès public au benchmark impose aussi de considérer le risque de contamination lors de l’interprétation des résultats. Enfin, CyberGym couvre une portée précise : la reproduction de vulnérabilités réelles à partir d’une description et de code, dans un environnement contrôlé. Le classement renseigne donc sur cette compétence agentique de cybersécurité, et non sur l’ensemble des capacités générales ou des pratiques de sécurité d’un modèle.
Sources des scores : llm-stats.