MATH level 5

Epoch: MATH level 5 est une évaluation issue du benchmark MATH, créé par D. Hendrycks et ses coauteurs en 2021. Elle porte sur le sous-ensemble réunissant les problèmes de difficulté maximale, tirés de mathématiques de compétition et accompagnés de solutions.

Epoch: MATH level 5 est une évaluation issue du benchmark MATH, créé par D. Hendrycks et ses coauteurs en 2021. Elle porte sur le sous-ensemble réunissant les problèmes de difficulté maximale, tirés de mathématiques de compétition et accompagnés de solutions.

À travers des questions ouvertes à réponse courte, ce benchmark mesure la capacité des modèles à produire des réponses mathématiques correctes sur des problèmes particulièrement exigeants. Il sert ainsi à comparer leur raisonnement mathématique dans la partie la plus difficile du jeu MATH.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkD. Hendrycks et al.
Capacités mesuréesMesure la capacité à résoudre des problèmes de mathématiques de compétition, en particulier les problèmes les plus difficiles du jeu MATH.
ModalitéTexte
Type de questionsquestions ouvertes de mathématiques à réponse courte
Métrique d'évaluationaccuracy
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeusous-ensemble des problèmes de niveau 5 du jeu MATH ; MATH complet contient 12 500 problèmes
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (59)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5OpenAI🔒 Propriétaire98,1 %7 août 2025✅ Mesuré
2GPT-5 miniOpenAI🔒 Propriétaire97,8 %7 août 2025✅ Mesuré
3o3OpenAI🔒 Propriétaire97,8 %16 avril 2025✅ Mesuré
4Claude Sonnet 4.5Anthropic🔒 Propriétaire97,7 %29 septembre 2025✅ Mesuré
5Qwen3-Max-InstructQwen▫ n.d.97,1 %24 septembre 2025✅ Mesuré
6Claude Haiku 4.5Anthropic🔒 Propriétaire96,4 %15 octobre 2025✅ Mesuré
7Gemini 2.5 Pro PreviewGoogle▫ n.d.95,9 %5 juin 2025✅ Mesuré
8GPT-5 nanoOpenAI🔒 Propriétaire95,2 %7 août 2025✅ Mesuré
9o1OpenAI🔒 Propriétaire94,7 %17 décembre 2024✅ Mesuré
10Claude 3.7 SonnetAnthropic🔒 Propriétaire91,2 %24 février 2025✅ Mesuré
11GPT-4.1 miniOpenAI🔒 Propriétaire87,3 %14 avril 2025✅ Mesuré
12Claude Opus 4Anthropic🔒 Propriétaire85,0 %22 mai 2025✅ Mesuré
13Claude Sonnet 4Anthropic🔒 Propriétaire84,4 %22 mai 2025✅ Mesuré
14Gemini 2.0 Pro ExpGoogle▫ n.d.83,5 %5 février 2025✅ Mesuré
15GPT-4.1OpenAI🔒 Propriétaire83,0 %14 avril 2025✅ Mesuré
16Mistral: Mistral Medium 3Mistral AI▫ n.d.81,6 %7 mai 2025✅ Mesuré
17OpenAI: GPT-4.5 (Preview)OpenAI🔒 Propriétaire78,6 %27 février 2025✅ Mesuré
18GPT-4.1 nanoOpenAI🔒 Propriétaire70,0 %14 avril 2025✅ Mesuré
19qwen2.5-maxQwen▫ n.d.67,2 %25 janvier 2025✅ Mesuré
20qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.65,3 %8 septembre 2025✅ Mesuré
21Qwen2.5-72BQwen▫ n.d.63,2 %19 septembre 2024✅ Mesuré
22Claude 3.5 SonnetAnthropic🔒 Propriétaire56,9 %22 octobre 2024✅ Mesuré
23Qwen: Qwen-TurboAlibaba Cloud / Qwen Team▫ n.d.56,2 %1 février 2025✅ Mesuré
24Qwen2.5-32BQwen▫ n.d.56,1 %17 septembre 2024✅ Mesuré
25GPT-4oOpenAI🔒 Propriétaire53,3 %27 mars 2025✅ Mesuré
26GPT-4o miniOpenAI🔒 Propriétaire52,6 %18 juillet 2024✅ Mesuré
27Llama 3.1-405BMeta▫ n.d.49,8 %23 juillet 2024✅ Mesuré
28Mistral Small 3.1Mistral AI▫ n.d.46,8 %17 mars 2025✅ Mesuré
29Claude 3.5 HaikuAnthropic🔒 Propriétaire46,4 %4 novembre 2024✅ Mesuré
30Mistral Small 3Mistral AI▫ n.d.44,8 %25 janvier 2025✅ Mesuré
31Tulu 3 (Tülu 3) 70BAllen Institute for AI▫ n.d.42,7 %21 novembre 2024✅ Mesuré
32Llama 3.3 70BMeta▫ n.d.41,6 %6 décembre 2024✅ Mesuré
33OpenAI: GPT-4 Turbo PreviewOpenAI🔒 Propriétaire40,0 %25 janvier 2024✅ Mesuré
34Llama 3.2 90BMeta▫ n.d.39,4 %24 septembre 2024✅ Mesuré
35Qwen2-72BQwen▫ n.d.39,1 %7 juin 2024✅ Mesuré
36Claude 3 OpusAnthropic🔒 Propriétaire37,5 %29 février 2024✅ Mesuré
37Llama 3.1-70BMeta▫ n.d.36,7 %23 juillet 2024✅ Mesuré
38WizardLM-2 8x22BMicrosoft🟢 Ouvert25,7 %16 avril 2024✅ Mesuré
39Yi-1.5-34B01.AI▫ n.d.25,5 %13 mai 2024✅ Mesuré
40Mistral LargeMistral AI▫ n.d.24,5 %26 février 2024✅ Mesuré
41Mixtral 8x22BMistral AI▫ n.d.24,2 %17 avril 2024✅ Mesuré
42GPT-4OpenAI🔒 Propriétaire23,0 %28 août 2023✅ Mesuré
43Llama 3.1-8BMeta▫ n.d.22,9 %23 juillet 2024✅ Mesuré
44Hermes 2 Theta Llama-3 70BNous Research▫ n.d.22,7 %20 juin 2024✅ Mesuré
45Llama 3-70BMeta▫ n.d.22,6 %18 avril 2024✅ Mesuré
46Claude 3 SonnetAnthropic🔒 Propriétaire18,2 %29 février 2024✅ Mesuré
47phi-3-medium 14BMicrosoft▫ n.d.17,6 %23 avril 2024✅ Mesuré
48Mistral: Ministral 8BMistral AI▫ n.d.14,9 %17 octobre 2024✅ Mesuré
49Claude 3 HaikuAnthropic🔒 Propriétaire14,9 %13 mars 2024✅ Mesuré
50Mistral: Ministral 3BMistral AI▫ n.d.14,4 %17 octobre 2024✅ Mesuré
51Claude 2Anthropic🔒 Propriétaire11,7 %11 juillet 2023✅ Mesuré
52DBRXDatabricks▫ n.d.11,7 %27 mars 2024✅ Mesuré
53Mistral NeMoMistral AI▫ n.d.10,8 %18 juillet 2024✅ Mesuré
54Mixtral 8x7BMistral AI▫ n.d.10,0 %11 décembre 2023✅ Mesuré
55DeepSeek LLM 67BDeepSeek▫ n.d.6,4 %29 novembre 2023✅ Mesuré
56Llama 3-8BMeta▫ n.d.6,1 %18 avril 2024✅ Mesuré
57Yi-34B01.AI▫ n.d.5,1 %2 novembre 2023✅ Mesuré
58Mistral 7BMistral AI▫ n.d.3,7 %27 mai 2024✅ Mesuré
59Llama 2-70BMeta▫ n.d.3,3 %18 juillet 2023✅ Mesuré

Classement établi sur 59 modèles évalués, dont 52 de grands éditeurs. Score médian de l'ensemble : 44,8 %.

Notre analyse

Un score élevé indique qu’un modèle résout correctement une forte proportion des problèmes de niveau 5, selon une mesure d’accuracy. La fiabilité du classement est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt que de reposer uniquement sur des résultats auto-déclarés. Dans la base considérée, la médiane de 56 % et le score de 98 % atteint par GPT-5 montrent un écart important entre la performance centrale des 84 modèles et le meilleur résultat. Cette proximité du score maximal avec 100 % signale aussi un risque de saturation au sommet, susceptible de réduire le pouvoir discriminant du benchmark entre les modèles les plus performants. Comme MATH est public, l’interprétation doit également tenir compte d’un possible enjeu de contamination par exposition aux problèmes. Enfin, la portée reste ciblée : Epoch: MATH level 5 évalue des réponses courtes à des problèmes de mathématiques de compétition en anglais, et non l’ensemble des capacités mathématiques ou générales d’un modèle.


Sources des scores : epoch.