MATH
Publié en 2021 par D. Hendrycks et ses coauteurs, MATH est un benchmark consacré à la résolution de problèmes issus de concours de mathématiques. Ses questions ouvertes exigent une réponse courte, accompagnée dans le jeu de données d’une solution détaillée étape par étape.
Publié en 2021 par D. Hendrycks et ses coauteurs, MATH est un benchmark consacré à la résolution de problèmes issus de concours de mathématiques. Ses questions ouvertes exigent une réponse courte, accompagnée dans le jeu de données d’une solution détaillée étape par étape.
MATH évalue le raisonnement multi-étapes, la manipulation symbolique et la maîtrise de plusieurs domaines, notamment l’algèbre, la géométrie, la théorie des nombres, les probabilités et le pré-calcul. Il sert à comparer la capacité des modèles à produire une réponse finale exacte sur des problèmes difficiles et de niveaux variés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | D. Hendrycks et al. |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte avec solution détaillée |
| Métrique d'évaluation | accuracy / exact match sur la réponse finale |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | 12 500 problèmes |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (70)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | o3-mini | OpenAI | 🔒 Propriétaire | 97,9 % | 30 janvier 2025 | Auto-déclaré |
| 2 | o1 | OpenAI | 🔒 Propriétaire | 96,4 % | 17 décembre 2024 | Auto-déclaré |
| 3 | MiniStral 3 (14B Instruct 2512) | Mistral AI | 🟢 Ouvert | 90,4 % | 4 décembre 2025 | Auto-déclaré |
| 4 | Mistral Large 3 | Mistral AI | 🟢 Ouvert | 90,4 % | 1 septembre 2025 | Auto-déclaré |
| 5 | Gemini 2.0 Flash | 🔒 Propriétaire | 89,7 % | 21 janvier 2025 | Auto-déclaré | |
| 6 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 89,1 % | 5 septembre 2025 | Auto-déclaré |
| 7 | Gemma 3 27B | 🟢 Ouvert | 89,0 % | 12 mars 2025 | Auto-déclaré | |
| 8 | Ministral 3 (8B Instruct 2512) | Mistral AI | 🟢 Ouvert | 87,6 % | 4 décembre 2025 | Auto-déclaré |
| 9 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 86,8 % | 5 février 2025 | Auto-déclaré | |
| 10 | Gemini 1.5 Pro | 🔒 Propriétaire | 86,5 % | 1 mai 2024 | Auto-déclaré | |
| 11 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 86,2 % | 27 avril 2026 | Auto-déclaré |
| 12 | o1-preview | OpenAI | 🔒 Propriétaire | 85,5 % | 12 septembre 2024 | Auto-déclaré |
| 13 | GPT-5 | OpenAI | 🔒 Propriétaire | 84,7 % | 7 août 2025 | Auto-déclaré |
| 14 | Gemma 3 12B | 🟢 Ouvert | 83,8 % | 12 mars 2025 | Auto-déclaré | |
| 15 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,1 % | 19 septembre 2024 | Auto-déclaré |
| 16 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,1 % | 19 septembre 2024 | Auto-déclaré |
| 17 | Ministral 3 (3B Instruct 2512) | Mistral AI | 🟢 Ouvert | 83,0 % | 4 décembre 2025 | Auto-déclaré |
| 18 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,2 % | 28 février 2025 | Auto-déclaré |
| 19 | Phi 4 | Microsoft | 🟢 Ouvert | 80,4 % | 12 décembre 2024 | Auto-déclaré |
| 20 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,0 % | 19 septembre 2024 | Auto-déclaré |
| 21 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 78,3 % | 22 octobre 2024 | Auto-déclaré |
| 22 | Gemini 1.5 Flash | 🔒 Propriétaire | 77,9 % | 1 mai 2024 | Auto-déclaré | |
| 23 | Llama 3.3 70B Instruct | Meta | 🟢 Ouvert | 77,0 % | 6 décembre 2024 | Auto-déclaré |
| 24 | GPT-4o | OpenAI | 🔒 Propriétaire | 76,6 % | 27 mars 2025 | Auto-déclaré |
| 25 | Nova Pro | Amazon | 🔒 Propriétaire | 76,6 % | 20 novembre 2024 | Auto-déclaré |
| 26 | Grok-2 | xAI | 🔒 Propriétaire | 76,1 % | 13 août 2024 | Auto-déclaré |
| 27 | Gemma 3 4B | 🟢 Ouvert | 75,6 % | 12 mars 2025 | Auto-déclaré | |
| 28 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,5 % | 19 septembre 2024 | Auto-déclaré |
| 29 | DeepSeek-V2.5 | DeepSeek | 🟢 Ouvert | 74,7 % | 8 mai 2024 | Auto-déclaré |
| 30 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 73,8 % | 23 juillet 2024 | Auto-déclaré |
| 31 | Nova Lite | Amazon | 🔒 Propriétaire | 73,3 % | 20 novembre 2024 | Auto-déclaré |
| 32 | Grok-2 mini | xAI | 🔒 Propriétaire | 73,0 % | 13 août 2024 | Auto-déclaré |
| 33 | GPT-4 Turbo | OpenAI | 🔒 Propriétaire | 72,6 % | 9 avril 2024 | Auto-déclaré |
| 34 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,8 % | 29 avril 2025 | Auto-déclaré |
| 35 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,5 % | 27 mars 2025 | Auto-déclaré |
| 36 | Mistral Small 3 24B Instruct | Mistral AI | 🟢 Ouvert | 70,6 % | 30 janvier 2025 | Auto-déclaré |
| 37 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 70,2 % | 18 juillet 2024 | Auto-déclaré |
| 38 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 70,2 % | 11 juillet 2025 | Auto-déclaré |
| 39 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 69,4 % | 20 juin 2025 | Auto-déclaré |
| 40 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 69,4 % | 4 novembre 2024 | Auto-déclaré |
| 41 | Mistral Small 3.1 24B Instruct | Mistral AI | 🟢 Ouvert | 69,3 % | 17 mars 2025 | Auto-déclaré |
| 42 | Nova Micro | Amazon | 🔒 Propriétaire | 69,3 % | 20 novembre 2024 | Auto-déclaré |
| 43 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 68,0 % | 25 septembre 2024 | Auto-déclaré |
| 44 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 64,0 % | 30 avril 2025 | Auto-déclaré |
| 45 | Llama 4 Maverick | Meta | 🟢 Ouvert | 61,2 % | 5 avril 2025 | Auto-déclaré |
| 46 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 60,1 % | 29 février 2024 | Auto-déclaré |
| 47 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,7 % | 23 juillet 2024 | Auto-déclaré |
| 48 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 59,5 % | 23 août 2024 | Auto-déclaré |
| 49 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 58,7 % | 15 mars 2024 | Auto-déclaré | |
| 50 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,2 % | 19 septembre 2024 | Auto-déclaré |
| 51 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 54,5 % | 16 octobre 2024 | Auto-déclaré |
| 52 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 51,9 % | 25 septembre 2024 | Auto-déclaré |
| 53 | Grok-1.5 | xAI | 🔒 Propriétaire | 50,6 % | 28 mars 2024 | Auto-déclaré |
| 54 | Llama 4 Scout | Meta | 🟢 Ouvert | 50,3 % | 5 avril 2025 | Auto-déclaré |
| 55 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,6 % | 23 juillet 2024 | Auto-déclaré |
| 56 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 48,5 % | 23 août 2024 | Auto-déclaré |
| 57 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 48,1 % | 17 septembre 2024 | Auto-déclaré |
| 58 | Gemma 3 1B | 🟢 Ouvert | 48,0 % | 12 mars 2025 | Auto-déclaré | |
| 59 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 48,0 % | 25 septembre 2024 | Auto-déclaré |
| 60 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,6 % | 19 septembre 2024 | Auto-déclaré |
| 61 | Mistral Small 3 24B Base | Mistral AI | 🟢 Ouvert | 46,0 % | 30 janvier 2025 | Auto-déclaré |
| 62 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 43,1 % | 29 février 2024 | Auto-déclaré |
| 63 | GPT-3.5 Turbo | OpenAI | 🔒 Propriétaire | 43,1 % | 21 mars 2023 | n.d. |
| 64 | Gemma 2 27B | 🟢 Ouvert | 42,3 % | 27 juin 2024 | Auto-déclaré | |
| 65 | GPT-4 | OpenAI | 🔒 Propriétaire | 42,0 % | 28 août 2023 | Auto-déclaré |
| 66 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 38,9 % | 13 mars 2024 | Auto-déclaré |
| 67 | Gemma 2 9B | 🟢 Ouvert | 36,6 % | 27 juin 2024 | Auto-déclaré | |
| 68 | Gemini 1.0 Pro | 🔒 Propriétaire | 32,6 % | 15 février 2024 | n.d. | |
| 69 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 20,8 % | 15 août 2024 | Auto-déclaré |
| 70 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 12,4 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 70 modèles évalués, dont 54 de grands éditeurs. Score médian de l'ensemble : 71,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MATH indique qu’un modèle fournit fréquemment la réponse finale exacte à des problèmes de concours nécessitant plusieurs étapes de raisonnement. L’exact match impose une validation stricte du résultat final, mais ne mesure pas directement la qualité du raisonnement produit, même si chaque problème possède une solution détaillée de référence.
Dans la base, la médiane de 71 % sur 70 modèles traduit des performances déjà solides, tandis que les 98 % de o3-mini placent le meilleur résultat près du plafond. Cette proximité suggère une saturation au sommet du classement, où de faibles écarts deviennent moins discriminants. La fiabilité comparative doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique. Le caractère public du jeu crée par ailleurs un risque de contamination des évaluations. Enfin, MATH porte uniquement sur des problèmes en anglais et sur sept domaines mathématiques de niveau concours. Son classement renseigne donc sur cette capacité ciblée, et non sur l’ensemble des aptitudes d’un modèle.
Sources des scores : llm-stats.