HMMT Feb 26

HMMT Feb 26 est un benchmark de MathArena, créé par l’ETH Zurich et eth-sri à partir de problèmes du Harvard-MIT Mathematics Tournament. Il évalue la capacité des modèles d’IA à résoudre des exercices avancés de mathématiques de compétition.

HMMT Feb 26 est un benchmark de MathArena, créé par l’ETH Zurich et eth-sri à partir de problèmes du Harvard-MIT Mathematics Tournament. Il évalue la capacité des modèles d’IA à résoudre des exercices avancés de mathématiques de compétition.

Les réponses attendues, courtes ou numériques, sollicitent principalement le raisonnement mathématique. Le benchmark sert ainsi à comparer les performances des modèles sur des problèmes exigeants, selon une mesure d’exactitude calculée sur plusieurs essais pour chaque problème.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMathArena (ETH Zurich / eth-sri)
Capacités mesuréesResolution de problemes mathematiques avances de competition (raisonnement)
ModalitéTexte
Type de questionsProblemes de competition mathematique (reponse courte/numerique)
Métrique d'évaluationExactitude (moyenne sur 4 essais par probleme)
AccèsPublic
LicenceCC BY-NC-SA 4.0
LanguesAnglais
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire97,1 %19 mai 2026Auto-déclaré
2DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert95,2 %23 avril 2026Auto-déclaré
3DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert94,8 %23 avril 2026Auto-déclaré
4Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire92,9 %31 mai 2026Auto-déclaré
5Kimi K2.6Moonshot AI🟢 Ouvert92,7 %20 avril 2026Auto-déclaré
6GLM-5.2Zhipu AI🟢 Ouvert92,5 %16 juin 2026Auto-déclaré
7Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire87,8 %31 mars 2026Auto-déclaré
8MAI-Thinking-1Microsoft🔒 Propriétaire84,9 %2 juin 2026Auto-déclaré
9Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert84,3 %21 avril 2026Auto-déclaré
10Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert83,6 %16 avril 2026Auto-déclaré
11GLM-5.1Zhipu AI🟢 Ouvert82,6 %7 avril 2026Auto-déclaré

Classement établi sur 11 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 92,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur HMMT Feb 26 indique qu’un modèle fournit fréquemment la réponse exacte à des problèmes avancés de compétition, avec une performance consolidée par une moyenne sur quatre essais par problème. Ce protocole réduit l’influence d’une réussite ou d’un échec isolé. La portée reste toutefois ciblée : le benchmark couvre des questions en anglais, à réponse courte ou numérique, et ne représente donc pas l’ensemble des compétences mathématiques ou des formes de raisonnement.

Avec une médiane de 92 % parmi les 11 modèles évalués et un meilleur résultat de 97 % pour Qwen3.7 Max, le classement montre des performances très élevées et relativement resserrées. Cette proximité avec le score maximal suggère un risque de saturation, qui peut réduire le pouvoir discriminant du benchmark entre les meilleurs modèles. Son accès public crée aussi un risque de contamination des évaluations si les problèmes entrent dans les données d’entraînement. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison présente une fiabilité moindre qu’une évaluation entièrement mesurée et vérifiée de façon indépendante.


Sources des scores : llm-stats.