HMMT25
HMMT25 est un benchmark conçu par MathArena à partir des problèmes du Harvard-MIT Mathematics Tournament 2025, une compétition de mathématiques organisée par des étudiants à destination des lycéens. Il repose sur des problèmes de concours en anglais appelant des réponses courtes ou…
HMMT25 est un benchmark conçu par MathArena à partir des problèmes du Harvard-MIT Mathematics Tournament 2025, une compétition de mathématiques organisée par des étudiants à destination des lycéens. Il repose sur des problèmes de concours en anglais appelant des réponses courtes ou numériques.
Le benchmark mesure la capacité des modèles d’IA à résoudre des exercices de raisonnement mathématique de niveau olympiade au lycée. Il sert ainsi à comparer leur aptitude à produire une réponse exacte face à des problèmes exigeants issus d’un cadre compétitif.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MathArena (a partir des problemes du Harvard-MIT Mathematics Tournament) |
| Capacités mesurées | Raisonnement mathematique de competition olympiade niveau lycee |
| Modalité | Texte |
| Type de questions | problemes de competition mathematique a reponse courte/numerique |
| Métrique d'évaluation | exactitude moyenne sur 4 essais par probleme (echelle 0-1) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | ~30 problemes par competition (HMMT 2025) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (25)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Grok-4 Heavy | xAI | 🔒 Propriétaire | 96,7 % | — | Auto-déclaré |
| 2 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 94,6 % | 31 mars 2026 | Auto-déclaré |
| 3 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,7 % | 16 février 2026 | Auto-déclaré |
| 4 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,7 % | 21 avril 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,3 % | 24 février 2026 | Auto-déclaré |
| 6 | Grok-4 | xAI | 🔒 Propriétaire | 90,0 % | 9 juillet 2025 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,8 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,2 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,1 % | 16 avril 2026 | Auto-déclaré |
| 10 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 85,8 % | 6 mars 2026 | Auto-déclaré |
| 11 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 25 juillet 2025 | Auto-déclaré |
| 12 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,9 % | 2 mars 2026 | Auto-déclaré |
| 13 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,4 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,8 % | 2 mars 2026 | Auto-déclaré |
| 15 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 74,2 % | 6 mars 2026 | Auto-déclaré |
| 16 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,9 % | 10 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,6 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,6 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,4 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,4 % | 22 juillet 2025 | Auto-déclaré |
| 21 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,1 % | 10 septembre 2025 | Auto-déclaré |
| 22 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 53,1 % | 22 septembre 2025 | Auto-déclaré |
| 23 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,6 % | 22 septembre 2025 | Auto-déclaré |
| 24 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 32,5 % | 22 septembre 2025 | Auto-déclaré |
| 25 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 30,7 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 25 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 77,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur HMMT25 indique qu’un modèle fournit régulièrement la réponse exacte à des problèmes de mathématiques de compétition, l’exactitude étant moyennée sur quatre essais par problème. Cette répétition atténue l’effet d’une réussite ou d’un échec isolé. La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.
Avec une médiane de 77 % parmi les 25 modèles recensés et Grok-4 Heavy en tête à 97 %, le classement montre un niveau globalement élevé et un leader proche du plafond. Cette proximité peut réduire la capacité du benchmark à distinguer finement les meilleurs modèles, signe d’une possible saturation. Son accès public et son origine dans des problèmes de tournoi imposent aussi de considérer le risque qu’un modèle ait déjà rencontré certains contenus, ce qui peut influencer la mesure. Enfin, sa portée reste ciblée : environ 30 problèmes par compétition, en anglais, à réponse courte ou numérique. Les résultats caractérisent donc surtout le raisonnement mathématique compétitif de niveau lycée.
Sources des scores : llm-stats.