CyberGym

CyberGym est un benchmark de cybersécurité créé en 2025 par une équipe de l’UC Berkeley menée par Dawn Song. Il évalue des agents IA dans un environnement contrôlé, à travers des tâches fondées sur des vulnérabilités logicielles réelles.

CyberGym est un benchmark de cybersécurité créé en 2025 par une équipe de l’UC Berkeley menée par Dawn Song. Il évalue des agents IA dans un environnement contrôlé, à travers des tâches fondées sur des vulnérabilités logicielles réelles.

Les agents doivent analyser une description et le code associé, identifier la faille puis générer une preuve de concept capable de la reproduire. CyberGym mesure ainsi des aptitudes pratiques d’analyse de sécurité, au-delà de la simple restitution de connaissances, et permet de comparer les modèles sur leur capacité à accomplir une tâche agentique vérifiable.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkUC Berkeley (Dawn Song et al.)
Capacités mesuréesIdentification et reproduction de vulnérabilités logicielles réelles, analyse de sécurité par des agents IA
ModalitéTexte
Type de questionstâches de cybersécurité agentiques (génération d'un PoC reproduisant une vulnérabilité à partir de sa description et du code)
Métrique d'évaluationtaux de succès (reproduction effective de la vulnérabilité)
AccèsPublic
Languesanglais (descriptions) ; code multi-langage (C/C++, etc.)
Taille du jeu1 507 vulnérabilités réelles sur 188 projets logiciels
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Mythos PreviewAnthropic🔒 Propriétaire83,1 %Auto-déclaré
2GPT-5.5OpenAI🔒 Propriétaire81,8 %23 avril 2026Auto-déclaré
3Claude Opus 4.8Anthropic🔒 Propriétaire78,8 %28 mai 2026Auto-déclaré
4Claude Opus 4.6Anthropic🔒 Propriétaire73,8 %5 février 2026Auto-déclaré
5Claude Opus 4.7Anthropic🔒 Propriétaire73,1 %16 avril 2026Auto-déclaré
6Seed 2.1 ProByteDance🔒 Propriétaire70,2 %24 juin 2026Auto-déclaré
7GLM-5.1Zhipu AI🟢 Ouvert68,7 %7 avril 2026Auto-déclaré
8Seed 2.1 TurboByteDance🔒 Propriétaire67,0 %24 juin 2026Auto-déclaré
9Kimi K2.5Moonshot AI🟢 Ouvert41,3 %27 janvier 2026Auto-déclaré

Classement établi sur 9 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 73,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent parvient fréquemment à produire une preuve de concept reproduisant effectivement les vulnérabilités proposées. La métrique repose donc sur l’aboutissement concret de la tâche, plutôt que sur une appréciation qualitative de la réponse. La médiane de 73 % parmi les neuf modèles évalués traduit des performances déjà élevées, sans saturation complète puisque le meilleur résultat, obtenu par Claude Mythos Preview, atteint 83 %.

La lecture du classement exige néanmoins de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui limite l’homogénéité de leur validation par rapport à une évaluation entièrement mesurée de manière indépendante. L’accès public au benchmark impose aussi de considérer le risque de contamination lors de l’interprétation des résultats. Enfin, CyberGym couvre une portée précise : la reproduction de vulnérabilités réelles à partir d’une description et de code, dans un environnement contrôlé. Le classement renseigne donc sur cette compétence agentique de cybersécurité, et non sur l’ensemble des capacités générales ou des pratiques de sécurité d’un modèle.


Sources des scores : llm-stats.