HMMT Feb 26
HMMT Feb 26 est un benchmark de MathArena, créé par l’ETH Zurich et eth-sri à partir de problèmes du Harvard-MIT Mathematics Tournament. Il évalue la capacité des modèles d’IA à résoudre des exercices avancés de mathématiques de compétition.
HMMT Feb 26 est un benchmark de MathArena, créé par l’ETH Zurich et eth-sri à partir de problèmes du Harvard-MIT Mathematics Tournament. Il évalue la capacité des modèles d’IA à résoudre des exercices avancés de mathématiques de compétition.
Les réponses attendues, courtes ou numériques, sollicitent principalement le raisonnement mathématique. Le benchmark sert ainsi à comparer les performances des modèles sur des problèmes exigeants, selon une mesure d’exactitude calculée sur plusieurs essais pour chaque problème.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MathArena (ETH Zurich / eth-sri) |
| Capacités mesurées | Resolution de problemes mathematiques avances de competition (raisonnement) |
| Modalité | Texte |
| Type de questions | Problemes de competition mathematique (reponse courte/numerique) |
| Métrique d'évaluation | Exactitude (moyenne sur 4 essais par probleme) |
| Accès | Public |
| Licence | CC BY-NC-SA 4.0 |
| Langues | Anglais |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 97,1 % | 19 mai 2026 | Auto-déclaré |
| 2 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 95,2 % | 23 avril 2026 | Auto-déclaré |
| 3 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 94,8 % | 23 avril 2026 | Auto-déclaré |
| 4 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 92,9 % | 31 mai 2026 | Auto-déclaré |
| 5 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 92,7 % | 20 avril 2026 | Auto-déclaré |
| 6 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 92,5 % | 16 juin 2026 | Auto-déclaré |
| 7 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 87,8 % | 31 mars 2026 | Auto-déclaré |
| 8 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 84,9 % | 2 juin 2026 | Auto-déclaré |
| 9 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,3 % | 21 avril 2026 | Auto-déclaré |
| 10 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,6 % | 16 avril 2026 | Auto-déclaré |
| 11 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 82,6 % | 7 avril 2026 | Auto-déclaré |
Classement établi sur 11 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 92,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur HMMT Feb 26 indique qu’un modèle fournit fréquemment la réponse exacte à des problèmes avancés de compétition, avec une performance consolidée par une moyenne sur quatre essais par problème. Ce protocole réduit l’influence d’une réussite ou d’un échec isolé. La portée reste toutefois ciblée : le benchmark couvre des questions en anglais, à réponse courte ou numérique, et ne représente donc pas l’ensemble des compétences mathématiques ou des formes de raisonnement.
Avec une médiane de 92 % parmi les 11 modèles évalués et un meilleur résultat de 97 % pour Qwen3.7 Max, le classement montre des performances très élevées et relativement resserrées. Cette proximité avec le score maximal suggère un risque de saturation, qui peut réduire le pouvoir discriminant du benchmark entre les meilleurs modèles. Son accès public crée aussi un risque de contamination des évaluations si les problèmes entrent dans les données d’entraînement. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison présente une fiabilité moindre qu’une évaluation entièrement mesurée et vérifiée de façon indépendante.
Sources des scores : llm-stats.