MATH level 5
Epoch: MATH level 5 est une évaluation issue du benchmark MATH, créé par D. Hendrycks et ses coauteurs en 2021. Elle porte sur le sous-ensemble réunissant les problèmes de difficulté maximale, tirés de mathématiques de compétition et accompagnés de solutions.
Epoch: MATH level 5 est une évaluation issue du benchmark MATH, créé par D. Hendrycks et ses coauteurs en 2021. Elle porte sur le sous-ensemble réunissant les problèmes de difficulté maximale, tirés de mathématiques de compétition et accompagnés de solutions.
À travers des questions ouvertes à réponse courte, ce benchmark mesure la capacité des modèles à produire des réponses mathématiques correctes sur des problèmes particulièrement exigeants. Il sert ainsi à comparer leur raisonnement mathématique dans la partie la plus difficile du jeu MATH.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | D. Hendrycks et al. |
| Capacités mesurées | Mesure la capacité à résoudre des problèmes de mathématiques de compétition, en particulier les problèmes les plus difficiles du jeu MATH. |
| Modalité | Texte |
| Type de questions | questions ouvertes de mathématiques à réponse courte |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | sous-ensemble des problèmes de niveau 5 du jeu MATH ; MATH complet contient 12 500 problèmes |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (59)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 🔒 Propriétaire | 98,1 % | 7 août 2025 | ✅ Mesuré |
| 2 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 97,8 % | 7 août 2025 | ✅ Mesuré |
| 3 | o3 | OpenAI | 🔒 Propriétaire | 97,8 % | 16 avril 2025 | ✅ Mesuré |
| 4 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 97,7 % | 29 septembre 2025 | ✅ Mesuré |
| 5 | Qwen3-Max-Instruct | Qwen | ▫ n.d. | 97,1 % | 24 septembre 2025 | ✅ Mesuré |
| 6 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 96,4 % | 15 octobre 2025 | ✅ Mesuré |
| 7 | Gemini 2.5 Pro Preview | ▫ n.d. | 95,9 % | 5 juin 2025 | ✅ Mesuré | |
| 8 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 95,2 % | 7 août 2025 | ✅ Mesuré |
| 9 | o1 | OpenAI | 🔒 Propriétaire | 94,7 % | 17 décembre 2024 | ✅ Mesuré |
| 10 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 91,2 % | 24 février 2025 | ✅ Mesuré |
| 11 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 87,3 % | 14 avril 2025 | ✅ Mesuré |
| 12 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 85,0 % | 22 mai 2025 | ✅ Mesuré |
| 13 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 84,4 % | 22 mai 2025 | ✅ Mesuré |
| 14 | Gemini 2.0 Pro Exp | ▫ n.d. | 83,5 % | 5 février 2025 | ✅ Mesuré | |
| 15 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 83,0 % | 14 avril 2025 | ✅ Mesuré |
| 16 | Mistral: Mistral Medium 3 | Mistral AI | ▫ n.d. | 81,6 % | 7 mai 2025 | ✅ Mesuré |
| 17 | OpenAI: GPT-4.5 (Preview) | OpenAI | 🔒 Propriétaire | 78,6 % | 27 février 2025 | ✅ Mesuré |
| 18 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 70,0 % | 14 avril 2025 | ✅ Mesuré |
| 19 | qwen2.5-max | Qwen | ▫ n.d. | 67,2 % | 25 janvier 2025 | ✅ Mesuré |
| 20 | qwen-plus-2025-01-25 | Alibaba Cloud / Qwen Team | ▫ n.d. | 65,3 % | 8 septembre 2025 | ✅ Mesuré |
| 21 | Qwen2.5-72B | Qwen | ▫ n.d. | 63,2 % | 19 septembre 2024 | ✅ Mesuré |
| 22 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 56,9 % | 22 octobre 2024 | ✅ Mesuré |
| 23 | Qwen: Qwen-Turbo | Alibaba Cloud / Qwen Team | ▫ n.d. | 56,2 % | 1 février 2025 | ✅ Mesuré |
| 24 | Qwen2.5-32B | Qwen | ▫ n.d. | 56,1 % | 17 septembre 2024 | ✅ Mesuré |
| 25 | GPT-4o | OpenAI | 🔒 Propriétaire | 53,3 % | 27 mars 2025 | ✅ Mesuré |
| 26 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 52,6 % | 18 juillet 2024 | ✅ Mesuré |
| 27 | Llama 3.1-405B | Meta | ▫ n.d. | 49,8 % | 23 juillet 2024 | ✅ Mesuré |
| 28 | Mistral Small 3.1 | Mistral AI | ▫ n.d. | 46,8 % | 17 mars 2025 | ✅ Mesuré |
| 29 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 46,4 % | 4 novembre 2024 | ✅ Mesuré |
| 30 | Mistral Small 3 | Mistral AI | ▫ n.d. | 44,8 % | 25 janvier 2025 | ✅ Mesuré |
| 31 | Tulu 3 (Tülu 3) 70B | Allen Institute for AI | ▫ n.d. | 42,7 % | 21 novembre 2024 | ✅ Mesuré |
| 32 | Llama 3.3 70B | Meta | ▫ n.d. | 41,6 % | 6 décembre 2024 | ✅ Mesuré |
| 33 | OpenAI: GPT-4 Turbo Preview | OpenAI | 🔒 Propriétaire | 40,0 % | 25 janvier 2024 | ✅ Mesuré |
| 34 | Llama 3.2 90B | Meta | ▫ n.d. | 39,4 % | 24 septembre 2024 | ✅ Mesuré |
| 35 | Qwen2-72B | Qwen | ▫ n.d. | 39,1 % | 7 juin 2024 | ✅ Mesuré |
| 36 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 37,5 % | 29 février 2024 | ✅ Mesuré |
| 37 | Llama 3.1-70B | Meta | ▫ n.d. | 36,7 % | 23 juillet 2024 | ✅ Mesuré |
| 38 | WizardLM-2 8x22B | Microsoft | 🟢 Ouvert | 25,7 % | 16 avril 2024 | ✅ Mesuré |
| 39 | Yi-1.5-34B | 01.AI | ▫ n.d. | 25,5 % | 13 mai 2024 | ✅ Mesuré |
| 40 | Mistral Large | Mistral AI | ▫ n.d. | 24,5 % | 26 février 2024 | ✅ Mesuré |
| 41 | Mixtral 8x22B | Mistral AI | ▫ n.d. | 24,2 % | 17 avril 2024 | ✅ Mesuré |
| 42 | GPT-4 | OpenAI | 🔒 Propriétaire | 23,0 % | 28 août 2023 | ✅ Mesuré |
| 43 | Llama 3.1-8B | Meta | ▫ n.d. | 22,9 % | 23 juillet 2024 | ✅ Mesuré |
| 44 | Hermes 2 Theta Llama-3 70B | Nous Research | ▫ n.d. | 22,7 % | 20 juin 2024 | ✅ Mesuré |
| 45 | Llama 3-70B | Meta | ▫ n.d. | 22,6 % | 18 avril 2024 | ✅ Mesuré |
| 46 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 18,2 % | 29 février 2024 | ✅ Mesuré |
| 47 | phi-3-medium 14B | Microsoft | ▫ n.d. | 17,6 % | 23 avril 2024 | ✅ Mesuré |
| 48 | Mistral: Ministral 8B | Mistral AI | ▫ n.d. | 14,9 % | 17 octobre 2024 | ✅ Mesuré |
| 49 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 14,9 % | 13 mars 2024 | ✅ Mesuré |
| 50 | Mistral: Ministral 3B | Mistral AI | ▫ n.d. | 14,4 % | 17 octobre 2024 | ✅ Mesuré |
| 51 | Claude 2 | Anthropic | 🔒 Propriétaire | 11,7 % | 11 juillet 2023 | ✅ Mesuré |
| 52 | DBRX | Databricks | ▫ n.d. | 11,7 % | 27 mars 2024 | ✅ Mesuré |
| 53 | Mistral NeMo | Mistral AI | ▫ n.d. | 10,8 % | 18 juillet 2024 | ✅ Mesuré |
| 54 | Mixtral 8x7B | Mistral AI | ▫ n.d. | 10,0 % | 11 décembre 2023 | ✅ Mesuré |
| 55 | DeepSeek LLM 67B | DeepSeek | ▫ n.d. | 6,4 % | 29 novembre 2023 | ✅ Mesuré |
| 56 | Llama 3-8B | Meta | ▫ n.d. | 6,1 % | 18 avril 2024 | ✅ Mesuré |
| 57 | Yi-34B | 01.AI | ▫ n.d. | 5,1 % | 2 novembre 2023 | ✅ Mesuré |
| 58 | Mistral 7B | Mistral AI | ▫ n.d. | 3,7 % | 27 mai 2024 | ✅ Mesuré |
| 59 | Llama 2-70B | Meta | ▫ n.d. | 3,3 % | 18 juillet 2023 | ✅ Mesuré |
Classement établi sur 59 modèles évalués, dont 52 de grands éditeurs. Score médian de l'ensemble : 44,8 %.
Notre analyse
Un score élevé indique qu’un modèle résout correctement une forte proportion des problèmes de niveau 5, selon une mesure d’accuracy. La fiabilité du classement est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt que de reposer uniquement sur des résultats auto-déclarés. Dans la base considérée, la médiane de 56 % et le score de 98 % atteint par GPT-5 montrent un écart important entre la performance centrale des 84 modèles et le meilleur résultat. Cette proximité du score maximal avec 100 % signale aussi un risque de saturation au sommet, susceptible de réduire le pouvoir discriminant du benchmark entre les modèles les plus performants. Comme MATH est public, l’interprétation doit également tenir compte d’un possible enjeu de contamination par exposition aux problèmes. Enfin, la portée reste ciblée : Epoch: MATH level 5 évalue des réponses courtes à des problèmes de mathématiques de compétition en anglais, et non l’ensemble des capacités mathématiques ou générales d’un modèle.
Sources des scores : epoch.