HMMT25

HMMT25 est un benchmark conçu par MathArena à partir des problèmes du Harvard-MIT Mathematics Tournament 2025, une compétition de mathématiques organisée par des étudiants à destination des lycéens. Il repose sur des problèmes de concours en anglais appelant des réponses courtes ou…

HMMT25 est un benchmark conçu par MathArena à partir des problèmes du Harvard-MIT Mathematics Tournament 2025, une compétition de mathématiques organisée par des étudiants à destination des lycéens. Il repose sur des problèmes de concours en anglais appelant des réponses courtes ou numériques.

Le benchmark mesure la capacité des modèles d’IA à résoudre des exercices de raisonnement mathématique de niveau olympiade au lycée. Il sert ainsi à comparer leur aptitude à produire une réponse exacte face à des problèmes exigeants issus d’un cadre compétitif.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMathArena (a partir des problemes du Harvard-MIT Mathematics Tournament)
Capacités mesuréesRaisonnement mathematique de competition olympiade niveau lycee
ModalitéTexte
Type de questionsproblemes de competition mathematique a reponse courte/numerique
Métrique d'évaluationexactitude moyenne sur 4 essais par probleme (echelle 0-1)
AccèsPublic
Languesanglais
Taille du jeu~30 problemes par competition (HMMT 2025)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (25)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Grok-4 HeavyxAI🔒 Propriétaire96,7 %Auto-déclaré
2Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire94,6 %31 mars 2026Auto-déclaré
3Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert92,7 %16 février 2026Auto-déclaré
4Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert90,7 %21 avril 2026Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert90,3 %24 février 2026Auto-déclaré
6Grok-4xAI🔒 Propriétaire90,0 %9 juillet 2025Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert89,8 %24 février 2026Auto-déclaré
8Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert89,2 %24 février 2026Auto-déclaré
9Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert89,1 %16 avril 2026Auto-déclaré
10Sarvam-105BSarvam AI🟢 Ouvert85,8 %6 mars 2026Auto-déclaré
11Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert83,9 %25 juillet 2025Auto-déclaré
12Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert82,9 %2 mars 2026Auto-déclaré
13Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert77,4 %22 septembre 2025Auto-déclaré
14Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert76,8 %2 mars 2026Auto-déclaré
15Sarvam-30BSarvam AI🟢 Ouvert74,2 %6 mars 2026Auto-déclaré
16Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert73,9 %10 septembre 2025Auto-déclaré
17Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert67,6 %22 septembre 2025Auto-déclaré
18Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert60,6 %22 septembre 2025Auto-déclaré
19Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,4 %22 septembre 2025Auto-déclaré
20Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert55,4 %22 juillet 2025Auto-déclaré
21Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert54,1 %10 septembre 2025Auto-déclaré
22Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert53,1 %22 septembre 2025Auto-déclaré
23Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert50,6 %22 septembre 2025Auto-déclaré
24Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert32,5 %22 septembre 2025Auto-déclaré
25Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert30,7 %22 septembre 2025Auto-déclaré

Classement établi sur 25 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 77,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur HMMT25 indique qu’un modèle fournit régulièrement la réponse exacte à des problèmes de mathématiques de compétition, l’exactitude étant moyennée sur quatre essais par problème. Cette répétition atténue l’effet d’une réussite ou d’un échec isolé. La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.

Avec une médiane de 77 % parmi les 25 modèles recensés et Grok-4 Heavy en tête à 97 %, le classement montre un niveau globalement élevé et un leader proche du plafond. Cette proximité peut réduire la capacité du benchmark à distinguer finement les meilleurs modèles, signe d’une possible saturation. Son accès public et son origine dans des problèmes de tournoi imposent aussi de considérer le risque qu’un modèle ait déjà rencontré certains contenus, ce qui peut influencer la mesure. Enfin, sa portée reste ciblée : environ 30 problèmes par compétition, en anglais, à réponse courte ou numérique. Les résultats caractérisent donc surtout le raisonnement mathématique compétitif de niveau lycée.


Sources des scores : llm-stats.