HiddenMath
HiddenMath est un benchmark interne de Google DeepMind consacré au raisonnement mathématique de niveau compétition. Il repose sur des problèmes nouveaux, conservés dans un jeu de test privé, afin d’évaluer la capacité des modèles à construire un raisonnement plutôt qu’à restituer des…
HiddenMath est un benchmark interne de Google DeepMind consacré au raisonnement mathématique de niveau compétition. Il repose sur des problèmes nouveaux, conservés dans un jeu de test privé, afin d’évaluer la capacité des modèles à construire un raisonnement plutôt qu’à restituer des réponses mémorisées pendant leur entraînement.
Ce dispositif sert de jeu retenu dans l’évaluation des modèles. Les questions et leurs réponses n’étant pas divulguées, HiddenMath vise à limiter la contamination du test et à fournir un indicateur ciblé des performances mathématiques en anglais.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google DeepMind |
| Capacités mesurées | Raisonnement mathématique de niveau compétition, conçu comme jeu retenu (held-out) pour éviter la contamination/mémorisation des modèles |
| Modalité | Texte |
| Type de questions | Problèmes de mathématiques de niveau compétition (jeu de holdout interne) |
| Métrique d'évaluation | Accuracy (présumé) |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | propriétaire |
| Langues | anglais |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 2.0 Flash | 🔒 Propriétaire | 63,0 % | 21 janvier 2025 | Auto-déclaré | |
| 2 | Gemma 3 27B | 🟢 Ouvert | 60,3 % | 12 mars 2025 | Auto-déclaré | |
| 3 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 55,3 % | 5 février 2025 | Auto-déclaré | |
| 4 | Gemma 3 12B | 🟢 Ouvert | 54,5 % | 12 mars 2025 | Auto-déclaré | |
| 5 | Gemini 1.5 Pro | 🔒 Propriétaire | 52,0 % | 1 mai 2024 | Auto-déclaré | |
| 6 | Gemini 1.5 Flash | 🔒 Propriétaire | 47,2 % | 1 mai 2024 | Auto-déclaré | |
| 7 | Gemma 3 4B | 🟢 Ouvert | 43,0 % | 12 mars 2025 | Auto-déclaré | |
| 8 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 37,7 % | 26 juin 2025 | Auto-déclaré | |
| 9 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 37,7 % | 20 mai 2025 | Auto-déclaré | |
| 10 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 32,8 % | 15 mars 2024 | Auto-déclaré | |
| 11 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 27,7 % | 26 juin 2025 | Auto-déclaré | |
| 12 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 27,7 % | 20 mai 2025 | Auto-déclaré | |
| 13 | Gemma 3 1B | 🟢 Ouvert | 15,8 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 13 de grands éditeurs. Score médian de l'ensemble : 43,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur HiddenMath indique qu’un modèle résout correctement une plus grande part de problèmes mathématiques de niveau compétition, selon une métrique d’accuracy présumée. La médiane de 43 % et le meilleur résultat de 63 %, obtenu par Gemini 2.0 Flash, suggèrent que le classement n’est pas saturé et conserve un pouvoir de différenciation entre les modèles évalués. Le caractère privé du jeu, ses problèmes nouveaux et la non-divulgation des réponses renforcent sa résistance à la contamination et à la mémorisation. Cette rigueur doit toutefois être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés indépendamment. La portée reste ciblée sur des mathématiques de compétition en anglais, et ne représente donc pas l’ensemble des capacités d’un modèle. Enfin, les 13 modèles classés sont tous édités par Google, également créateur du benchmark. Le classement renseigne ainsi sur les écarts internes à cette gamme, mais ne constitue pas une source indépendante pour comparer les modèles Google à ceux d’autres éditeurs.
Sources des scores : llm-stats.