HMMT 2025
HMMT 2025 est un benchmark de raisonnement mathématique conçu par MathArena à partir de problèmes du Harvard-MIT Mathematics Tournament, une compétition prestigieuse organisée par des étudiants pour des lycéens.
HMMT 2025 est un benchmark de raisonnement mathématique conçu par MathArena à partir de problèmes du Harvard-MIT Mathematics Tournament, une compétition prestigieuse organisée par des étudiants pour des lycéens.
Il évalue la capacité des modèles à résoudre en anglais des problèmes de niveau olympiade, sous la forme de réponses courtes ou numériques. Fondé sur les compétitions HMMT, avec leurs épreuves individuelles et collectives, il sert à comparer les performances des modèles sur des tâches mathématiques exigeantes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MathArena (a partir des problemes du Harvard-MIT Mathematics Tournament) |
| Capacités mesurées | Raisonnement mathematique de competition olympiade niveau lycee |
| Modalité | Texte |
| Type de questions | problemes de competition mathematique a reponse courte/numerique |
| Métrique d'évaluation | exactitude moyenne sur 4 essais par probleme (echelle 0-1) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | ~30 problemes par competition (HMMT fevrier et novembre 2025) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (33)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.2 Pro | OpenAI | 🔒 Propriétaire | 100,0 % | 11 décembre 2025 | Auto-déclaré |
| 2 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 99,4 % | 11 décembre 2025 | Auto-déclaré |
| 3 | DeepSeek-V3.2-Speciale | DeepSeek | 🟢 Ouvert | 99,2 % | 1 décembre 2025 | Auto-déclaré |
| 4 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 97,5 % | 5 septembre 2025 | Auto-déclaré |
| 5 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 96,7 % | 31 mars 2026 | Auto-déclaré |
| 6 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 95,4 % | 27 janvier 2026 | Auto-déclaré |
| 7 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,8 % | 16 février 2026 | Auto-déclaré |
| 8 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 94,7 % | 11 mars 2026 | Auto-déclaré |
| 9 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 94,4 % | 16 juin 2026 | Auto-déclaré |
| 10 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 94,0 % | 7 avril 2026 | Auto-déclaré |
| 11 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,8 % | 21 avril 2026 | Auto-déclaré |
| 12 | GPT-5 | OpenAI | 🔒 Propriétaire | 93,3 % | 7 août 2025 | Auto-déclaré |
| 13 | Grok 4 Fast | xAI | 🔒 Propriétaire | 93,3 % | 28 août 2025 | Auto-déclaré |
| 14 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,0 % | 24 février 2026 | Auto-déclaré |
| 15 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,4 % | 24 février 2026 | Auto-déclaré |
| 16 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,7 % | 16 avril 2026 | Auto-déclaré |
| 17 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 90,2 % | 1 décembre 2025 | Auto-déclaré |
| 18 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 90,2 % | 1 décembre 2025 | Auto-déclaré |
| 19 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,0 % | 24 février 2026 | Auto-déclaré |
| 20 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 87,8 % | 7 août 2025 | Auto-déclaré |
| 21 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 85,8 % | 6 mars 2026 | Auto-déclaré |
| 22 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 84,4 % | 16 décembre 2025 | Auto-déclaré |
| 23 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 83,6 % | 29 septembre 2025 | Auto-déclaré |
| 24 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,2 % | 2 mars 2026 | Auto-déclaré |
| 25 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 79,4 % | 28 mai 2025 | Auto-déclaré |
| 26 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 75,6 % | 7 août 2025 | Auto-déclaré |
| 27 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,0 % | 2 mars 2026 | Auto-déclaré |
| 28 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 73,3 % | 6 mars 2026 | Auto-déclaré |
| 29 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 38,8 % | 11 juillet 2025 | Auto-déclaré |
| 30 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 38,8 % | 5 septembre 2025 | Auto-déclaré |
| 31 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 35,0 % | 14 avril 2025 | Auto-déclaré |
| 32 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 33,5 % | 10 janvier 2025 | Auto-déclaré |
| 33 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 28,9 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 33 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 90,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur HMMT 2025 indique qu’un modèle produit fréquemment la réponse exacte à des problèmes de compétition mathématique de niveau lycée. L’exactitude moyenne calculée sur quatre essais par problème évalue une performance répétée plutôt qu’une réussite isolée. La rigueur comparative reste toutefois limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité du contrôle entre modèles.
Le score médian de 90 % parmi les 33 modèles évalués, associé au résultat parfait de GPT-5.2 Pro, signale une forte concentration des performances dans le haut de l’échelle et un risque de saturation. Le classement distingue donc surtout les modèles proches de la maîtrise complète de ce jeu. L’accès public peut aussi favoriser une exposition préalable aux problèmes, avec un risque de contamination. Enfin, la portée demeure ciblée : problèmes en anglais, réponses courtes ou numériques, et raisonnement mathématique de compétition. Le benchmark ne représente donc pas l’ensemble des capacités mathématiques ni les autres formes de raisonnement d’un modèle.
Sources des scores : llm-stats.