HMMT 2025

HMMT 2025 est un benchmark de raisonnement mathématique conçu par MathArena à partir de problèmes du Harvard-MIT Mathematics Tournament, une compétition prestigieuse organisée par des étudiants pour des lycéens.

HMMT 2025 est un benchmark de raisonnement mathématique conçu par MathArena à partir de problèmes du Harvard-MIT Mathematics Tournament, une compétition prestigieuse organisée par des étudiants pour des lycéens.

Il évalue la capacité des modèles à résoudre en anglais des problèmes de niveau olympiade, sous la forme de réponses courtes ou numériques. Fondé sur les compétitions HMMT, avec leurs épreuves individuelles et collectives, il sert à comparer les performances des modèles sur des tâches mathématiques exigeantes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMathArena (a partir des problemes du Harvard-MIT Mathematics Tournament)
Capacités mesuréesRaisonnement mathematique de competition olympiade niveau lycee
ModalitéTexte
Type de questionsproblemes de competition mathematique a reponse courte/numerique
Métrique d'évaluationexactitude moyenne sur 4 essais par probleme (echelle 0-1)
AccèsPublic
Languesanglais
Taille du jeu~30 problemes par competition (HMMT fevrier et novembre 2025)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (33)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.2 ProOpenAI🔒 Propriétaire100,0 %11 décembre 2025Auto-déclaré
2GPT-5.2OpenAI🔒 Propriétaire99,4 %11 décembre 2025Auto-déclaré
3DeepSeek-V3.2-SpecialeDeepSeek🟢 Ouvert99,2 %1 décembre 2025Auto-déclaré
4Kimi K2 0905Moonshot AI🔒 Propriétaire97,5 %5 septembre 2025Auto-déclaré
5Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire96,7 %31 mars 2026Auto-déclaré
6Kimi K2.5Moonshot AI🟢 Ouvert95,4 %27 janvier 2026Auto-déclaré
7Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert94,8 %16 février 2026Auto-déclaré
8Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert94,7 %11 mars 2026Auto-déclaré
9GLM-5.2Zhipu AI🟢 Ouvert94,4 %16 juin 2026Auto-déclaré
10GLM-5.1Zhipu AI🟢 Ouvert94,0 %7 avril 2026Auto-déclaré
11Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert93,8 %21 avril 2026Auto-déclaré
12GPT-5OpenAI🔒 Propriétaire93,3 %7 août 2025Auto-déclaré
13Grok 4 FastxAI🔒 Propriétaire93,3 %28 août 2025Auto-déclaré
14Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert92,0 %24 février 2026Auto-déclaré
15Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert91,4 %24 février 2026Auto-déclaré
16Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert90,7 %16 avril 2026Auto-déclaré
17DeepSeek-V3.2DeepSeek🟢 Ouvert90,2 %1 décembre 2025Auto-déclaré
18DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert90,2 %1 décembre 2025Auto-déclaré
19Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert89,0 %24 février 2026Auto-déclaré
20GPT-5 miniOpenAI🔒 Propriétaire87,8 %7 août 2025Auto-déclaré
21Sarvam-105BSarvam AI🟢 Ouvert85,8 %6 mars 2026Auto-déclaré
22MiMo-V2-FlashXiaomi🟢 Ouvert84,4 %16 décembre 2025Auto-déclaré
23DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert83,6 %29 septembre 2025Auto-déclaré
24Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert83,2 %2 mars 2026Auto-déclaré
25DeepSeek-R1-0528DeepSeek🟢 Ouvert79,4 %28 mai 2025Auto-déclaré
26GPT-5 nanoOpenAI🔒 Propriétaire75,6 %7 août 2025Auto-déclaré
27Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert74,0 %2 mars 2026Auto-déclaré
28Sarvam-30BSarvam AI🟢 Ouvert73,3 %6 mars 2026Auto-déclaré
29Kimi K2 InstructMoonshot AI🟢 Ouvert38,8 %11 juillet 2025Auto-déclaré
30Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert38,8 %5 septembre 2025Auto-déclaré
31GPT-4.1 miniOpenAI🔒 Propriétaire35,0 %14 avril 2025Auto-déclaré
32DeepSeek-V3.1DeepSeek🟢 Ouvert33,5 %10 janvier 2025Auto-déclaré
33GPT-4.1OpenAI🔒 Propriétaire28,9 %14 avril 2025Auto-déclaré

Classement établi sur 33 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 90,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur HMMT 2025 indique qu’un modèle produit fréquemment la réponse exacte à des problèmes de compétition mathématique de niveau lycée. L’exactitude moyenne calculée sur quatre essais par problème évalue une performance répétée plutôt qu’une réussite isolée. La rigueur comparative reste toutefois limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité du contrôle entre modèles.

Le score médian de 90 % parmi les 33 modèles évalués, associé au résultat parfait de GPT-5.2 Pro, signale une forte concentration des performances dans le haut de l’échelle et un risque de saturation. Le classement distingue donc surtout les modèles proches de la maîtrise complète de ce jeu. L’accès public peut aussi favoriser une exposition préalable aux problèmes, avec un risque de contamination. Enfin, la portée demeure ciblée : problèmes en anglais, réponses courtes ou numériques, et raisonnement mathématique de compétition. Le benchmark ne représente donc pas l’ensemble des capacités mathématiques ni les autres formes de raisonnement d’un modèle.


Sources des scores : llm-stats.