HiddenMath

HiddenMath est un benchmark interne de Google DeepMind consacré au raisonnement mathématique de niveau compétition. Il repose sur des problèmes nouveaux, conservés dans un jeu de test privé, afin d’évaluer la capacité des modèles à construire un raisonnement plutôt qu’à restituer des…

HiddenMath est un benchmark interne de Google DeepMind consacré au raisonnement mathématique de niveau compétition. Il repose sur des problèmes nouveaux, conservés dans un jeu de test privé, afin d’évaluer la capacité des modèles à construire un raisonnement plutôt qu’à restituer des réponses mémorisées pendant leur entraînement.

Ce dispositif sert de jeu retenu dans l’évaluation des modèles. Les questions et leurs réponses n’étant pas divulguées, HiddenMath vise à limiter la contamination du test et à fournir un indicateur ciblé des performances mathématiques en anglais.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle DeepMind
Capacités mesuréesRaisonnement mathématique de niveau compétition, conçu comme jeu retenu (held-out) pour éviter la contamination/mémorisation des modèles
ModalitéTexte
Type de questionsProblèmes de mathématiques de niveau compétition (jeu de holdout interne)
Métrique d'évaluationAccuracy (présumé)
AccèsJeu de test privé (réponses non divulguées)
Licencepropriétaire
Languesanglais

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 2.0 FlashGoogle🔒 Propriétaire63,0 %21 janvier 2025Auto-déclaré
2Gemma 3 27BGoogle🟢 Ouvert60,3 %12 mars 2025Auto-déclaré
3Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire55,3 %5 février 2025Auto-déclaré
4Gemma 3 12BGoogle🟢 Ouvert54,5 %12 mars 2025Auto-déclaré
5Gemini 1.5 ProGoogle🔒 Propriétaire52,0 %1 mai 2024Auto-déclaré
6Gemini 1.5 FlashGoogle🔒 Propriétaire47,2 %1 mai 2024Auto-déclaré
7Gemma 3 4BGoogle🟢 Ouvert43,0 %12 mars 2025Auto-déclaré
8Gemma 3n E4B InstructedGoogle🔒 Propriétaire37,7 %26 juin 2025Auto-déclaré
9Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert37,7 %20 mai 2025Auto-déclaré
10Gemini 1.5 Flash 8BGoogle🔒 Propriétaire32,8 %15 mars 2024Auto-déclaré
11Gemma 3n E2B InstructedGoogle🔒 Propriétaire27,7 %26 juin 2025Auto-déclaré
12Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert27,7 %20 mai 2025Auto-déclaré
13Gemma 3 1BGoogle🟢 Ouvert15,8 %12 mars 2025Auto-déclaré

Classement établi sur 13 modèles évalués, dont 13 de grands éditeurs. Score médian de l'ensemble : 43,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur HiddenMath indique qu’un modèle résout correctement une plus grande part de problèmes mathématiques de niveau compétition, selon une métrique d’accuracy présumée. La médiane de 43 % et le meilleur résultat de 63 %, obtenu par Gemini 2.0 Flash, suggèrent que le classement n’est pas saturé et conserve un pouvoir de différenciation entre les modèles évalués. Le caractère privé du jeu, ses problèmes nouveaux et la non-divulgation des réponses renforcent sa résistance à la contamination et à la mémorisation. Cette rigueur doit toutefois être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment. La portée reste ciblée sur des mathématiques de compétition en anglais, et ne représente donc pas l’ensemble des capacités d’un modèle. Enfin, les 13 modèles classés sont tous édités par Google, également créateur du benchmark. Le classement renseigne ainsi sur les écarts internes à cette gamme, mais ne constitue pas une source indépendante pour comparer les modèles Google à ceux d’autres éditeurs.


Sources des scores : llm-stats.