MATH

Publié en 2021 par D. Hendrycks et ses coauteurs, MATH est un benchmark consacré à la résolution de problèmes issus de concours de mathématiques. Ses questions ouvertes exigent une réponse courte, accompagnée dans le jeu de données d’une solution détaillée étape par étape.

Publié en 2021 par D. Hendrycks et ses coauteurs, MATH est un benchmark consacré à la résolution de problèmes issus de concours de mathématiques. Ses questions ouvertes exigent une réponse courte, accompagnée dans le jeu de données d’une solution détaillée étape par étape.

MATH évalue le raisonnement multi-étapes, la manipulation symbolique et la maîtrise de plusieurs domaines, notamment l’algèbre, la géométrie, la théorie des nombres, les probabilités et le pré-calcul. Il sert à comparer la capacité des modèles à produire une réponse finale exacte sur des problèmes difficiles et de niveaux variés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkD. Hendrycks et al.
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte avec solution détaillée
Métrique d'évaluationaccuracy / exact match sur la réponse finale
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeu12 500 problèmes
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (70)

#ModèleÉditeurLicenceScoreSortieFiabilité
1o3-miniOpenAI🔒 Propriétaire97,9 %30 janvier 2025Auto-déclaré
2o1OpenAI🔒 Propriétaire96,4 %17 décembre 2024Auto-déclaré
3MiniStral 3 (14B Instruct 2512)Mistral AI🟢 Ouvert90,4 %4 décembre 2025Auto-déclaré
4Mistral Large 3Mistral AI🟢 Ouvert90,4 %1 septembre 2025Auto-déclaré
5Gemini 2.0 FlashGoogle🔒 Propriétaire89,7 %21 janvier 2025Auto-déclaré
6Kimi K2 0905Moonshot AI🔒 Propriétaire89,1 %5 septembre 2025Auto-déclaré
7Gemma 3 27BGoogle🟢 Ouvert89,0 %12 mars 2025Auto-déclaré
8Ministral 3 (8B Instruct 2512)Mistral AI🟢 Ouvert87,6 %4 décembre 2025Auto-déclaré
9Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire86,8 %5 février 2025Auto-déclaré
10Gemini 1.5 ProGoogle🔒 Propriétaire86,5 %1 mai 2024Auto-déclaré
11MiMo-V2.5-ProXiaomi🟢 Ouvert86,2 %27 avril 2026Auto-déclaré
12o1-previewOpenAI🔒 Propriétaire85,5 %12 septembre 2024Auto-déclaré
13GPT-5OpenAI🔒 Propriétaire84,7 %7 août 2025Auto-déclaré
14Gemma 3 12BGoogle🟢 Ouvert83,8 %12 mars 2025Auto-déclaré
15Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,1 %19 septembre 2024Auto-déclaré
16Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,1 %19 septembre 2024Auto-déclaré
17Ministral 3 (3B Instruct 2512)Mistral AI🟢 Ouvert83,0 %4 décembre 2025Auto-déclaré
18Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,2 %28 février 2025Auto-déclaré
19Phi 4Microsoft🟢 Ouvert80,4 %12 décembre 2024Auto-déclaré
20Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,0 %19 septembre 2024Auto-déclaré
21Claude 3.5 SonnetAnthropic🔒 Propriétaire78,3 %22 octobre 2024Auto-déclaré
22Gemini 1.5 FlashGoogle🔒 Propriétaire77,9 %1 mai 2024Auto-déclaré
23Llama 3.3 70B InstructMeta🟢 Ouvert77,0 %6 décembre 2024Auto-déclaré
24GPT-4oOpenAI🔒 Propriétaire76,6 %27 mars 2025Auto-déclaré
25Nova ProAmazon🔒 Propriétaire76,6 %20 novembre 2024Auto-déclaré
26Grok-2xAI🔒 Propriétaire76,1 %13 août 2024Auto-déclaré
27Gemma 3 4BGoogle🟢 Ouvert75,6 %12 mars 2025Auto-déclaré
28Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert75,5 %19 septembre 2024Auto-déclaré
29DeepSeek-V2.5DeepSeek🟢 Ouvert74,7 %8 mai 2024Auto-déclaré
30Llama 3.1 405B InstructMeta🟢 Ouvert73,8 %23 juillet 2024Auto-déclaré
31Nova LiteAmazon🔒 Propriétaire73,3 %20 novembre 2024Auto-déclaré
32Grok-2 minixAI🔒 Propriétaire73,0 %13 août 2024Auto-déclaré
33GPT-4 TurboOpenAI🔒 Propriétaire72,6 %9 avril 2024Auto-déclaré
34Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert71,8 %29 avril 2025Auto-déclaré
35Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert71,5 %27 mars 2025Auto-déclaré
36Mistral Small 3 24B InstructMistral AI🟢 Ouvert70,6 %30 janvier 2025Auto-déclaré
37GPT-4o miniOpenAI🔒 Propriétaire70,2 %18 juillet 2024Auto-déclaré
38Kimi K2 BaseMoonshot AI🟢 Ouvert70,2 %11 juillet 2025Auto-déclaré
39Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert69,4 %20 juin 2025Auto-déclaré
40Claude 3.5 HaikuAnthropic🔒 Propriétaire69,4 %4 novembre 2024Auto-déclaré
41Mistral Small 3.1 24B InstructMistral AI🟢 Ouvert69,3 %17 mars 2025Auto-déclaré
42Nova MicroAmazon🔒 Propriétaire69,3 %20 novembre 2024Auto-déclaré
43Llama 3.2 90B InstructMeta🟢 Ouvert68,0 %25 septembre 2024Auto-déclaré
44Phi 4 MiniMicrosoft🟢 Ouvert64,0 %30 avril 2025Auto-déclaré
45Llama 4 MaverickMeta🟢 Ouvert61,2 %5 avril 2025Auto-déclaré
46Claude 3 OpusAnthropic🔒 Propriétaire60,1 %29 février 2024Auto-déclaré
47Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert59,7 %23 juillet 2024Auto-déclaré
48Phi-3.5-MoE-instructMicrosoft🟢 Ouvert59,5 %23 août 2024Auto-déclaré
49Gemini 1.5 Flash 8BGoogle🔒 Propriétaire58,7 %15 mars 2024Auto-déclaré
50Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,2 %19 septembre 2024Auto-déclaré
51Ministral 8B InstructMistral AI🟢 Ouvert54,5 %16 octobre 2024Auto-déclaré
52Llama 3.2 11B InstructMeta🟢 Ouvert51,9 %25 septembre 2024Auto-déclaré
53Grok-1.5xAI🔒 Propriétaire50,6 %28 mars 2024Auto-déclaré
54Llama 4 ScoutMeta🟢 Ouvert50,3 %5 avril 2025Auto-déclaré
55Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert49,6 %23 juillet 2024Auto-déclaré
56Phi-3.5-mini-instructMicrosoft🟢 Ouvert48,5 %23 août 2024Auto-déclaré
57Pixtral-12BMistral AI🟢 Ouvert48,1 %17 septembre 2024Auto-déclaré
58Gemma 3 1BGoogle🟢 Ouvert48,0 %12 mars 2025Auto-déclaré
59Llama 3.2 3B InstructMeta🟢 Ouvert48,0 %25 septembre 2024Auto-déclaré
60Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert46,6 %19 septembre 2024Auto-déclaré
61Mistral Small 3 24B BaseMistral AI🟢 Ouvert46,0 %30 janvier 2025Auto-déclaré
62Claude 3 SonnetAnthropic🔒 Propriétaire43,1 %29 février 2024Auto-déclaré
63GPT-3.5 TurboOpenAI🔒 Propriétaire43,1 %21 mars 2023n.d.
64Gemma 2 27BGoogle🟢 Ouvert42,3 %27 juin 2024Auto-déclaré
65GPT-4OpenAI🔒 Propriétaire42,0 %28 août 2023Auto-déclaré
66Claude 3 HaikuAnthropic🔒 Propriétaire38,9 %13 mars 2024Auto-déclaré
67Gemma 2 9BGoogle🟢 Ouvert36,6 %27 juin 2024Auto-déclaré
68Gemini 1.0 ProGoogle🔒 Propriétaire32,6 %15 février 2024n.d.
69Hermes 3 70BNous Research🟢 Ouvert20,8 %15 août 2024Auto-déclaré
70ERNIE 4.5Baidu🔒 Propriétaire12,4 %25 juin 2025Auto-déclaré

Classement établi sur 70 modèles évalués, dont 54 de grands éditeurs. Score médian de l'ensemble : 71,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MATH indique qu’un modèle fournit fréquemment la réponse finale exacte à des problèmes de concours nécessitant plusieurs étapes de raisonnement. L’exact match impose une validation stricte du résultat final, mais ne mesure pas directement la qualité du raisonnement produit, même si chaque problème possède une solution détaillée de référence.

Dans la base, la médiane de 71 % sur 70 modèles traduit des performances déjà solides, tandis que les 98 % de o3-mini placent le meilleur résultat près du plafond. Cette proximité suggère une saturation au sommet du classement, où de faibles écarts deviennent moins discriminants. La fiabilité comparative doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique. Le caractère public du jeu crée par ailleurs un risque de contamination des évaluations. Enfin, MATH porte uniquement sur des problèmes en anglais et sur sept domaines mathématiques de niveau concours. Son classement renseigne donc sur cette capacité ciblée, et non sur l’ensemble des aptitudes d’un modèle.


Sources des scores : llm-stats.