MATH-500

MATH-500 est un sous-ensemble du jeu MATH consacré à 500 problèmes exigeants issus de compétitions mathématiques. Créé par OpenAI, dans les travaux de H. Lightman et al. à partir du corpus de D. Hendrycks et al., il couvre plusieurs niveaux de difficulté et sept domaines mathématiques.

MATH-500 est un sous-ensemble du jeu MATH consacré à 500 problèmes exigeants issus de compétitions mathématiques. Créé par OpenAI, dans les travaux de H. Lightman et al. à partir du corpus de D. Hendrycks et al., il couvre plusieurs niveaux de difficulté et sept domaines mathématiques.

Le benchmark évalue la capacité des modèles à résoudre des questions ouvertes à réponse courte, en mobilisant un raisonnement en plusieurs étapes, du calcul symbolique et la sélection de la réponse finale correcte. Les solutions détaillées associées aux problèmes en font un outil d’évaluation ciblé sur les mathématiques de compétition.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI (H. Lightman et al.), à partir du jeu MATH de D. Hendrycks et al.
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes de mathématiques à réponse courte, avec solutions détaillées
Métrique d'évaluationexact match / accuracy
AccèsPublic
Languesanglais
Taille du jeu500 problèmes
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (31)

#ModèleÉditeurLicenceScoreSortieFiabilité
1LongCat-Flash-ThinkingMeituan🟢 Ouvert99,2 %22 septembre 2025Auto-déclaré
2Sarvam-105BSarvam AI🟢 Ouvert98,6 %6 mars 2026Auto-déclaré
3GLM-4.5Zhipu AI🟢 Ouvert98,2 %28 juillet 2025Auto-déclaré
4GLM-4.5-AirZhipu AI🟢 Ouvert98,1 %28 juillet 2025Auto-déclaré
5Nemotron Nano 9B v2NVIDIA🟢 Ouvert97,8 %18 août 2025Auto-déclaré
6Kimi K2 InstructMoonshot AI🟢 Ouvert97,4 %11 juillet 2025Auto-déclaré
7Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert97,4 %5 septembre 2025Auto-déclaré
8Llama 3.1 Nemotron Ultra 253B v1NVIDIA🟢 Ouvert97,0 %7 avril 2025Auto-déclaré
9Sarvam-30BSarvam AI🟢 Ouvert97,0 %6 mars 2026Auto-déclaré
10LongCat-Flash-LiteMeituan🟢 Ouvert96,8 %5 février 2026Auto-déclaré
11Llama-3.3 Nemotron Super 49B v1NVIDIA🟢 Ouvert96,6 %18 mars 2025Auto-déclaré
12LongCat-Flash-ChatMeituan🟢 Ouvert96,4 %29 août 2025Auto-déclaré
13Claude 3.7 SonnetAnthropic🔒 Propriétaire96,2 %24 février 2025Auto-déclaré
14Kimi-k1.5Moonshot AI🔒 Propriétaire96,2 %20 janvier 2025Auto-déclaré
15MiniMax M1MiniMax🟢 Ouvert96,0 %17 juin 2025Auto-déclaré
16DeepSeek R1 ZeroDeepSeek🟢 Ouvert95,9 %20 janvier 2025Auto-déclaré
17Llama 3.1 Nemotron Nano 8B V1NVIDIA🟢 Ouvert95,4 %18 mars 2025Auto-déclaré
18Phi 4 MiniMicrosoft🟢 Ouvert94,6 %30 avril 2025Auto-déclaré
19DeepSeek R1 Distill Llama 70BDeepSeek🟢 Ouvert94,5 %20 janvier 2025Auto-déclaré
20DeepSeek R1 Distill Qwen 32BDeepSeek🟢 Ouvert94,3 %20 janvier 2025Auto-déclaré
21DeepSeek-V3 0324DeepSeek🟢 Ouvert94,0 %25 mars 2025Auto-déclaré
22DeepSeek R1 Distill Qwen 14BDeepSeek🟢 Ouvert93,9 %20 janvier 2025Auto-déclaré
23DeepSeek R1 Distill Qwen 7BDeepSeek🟢 Ouvert92,8 %20 janvier 2025Auto-déclaré
24QwQ-32BAlibaba Cloud / Qwen Team🟢 Ouvert90,6 %5 mars 2025Auto-déclaré
25QwQ-32B-PreviewAlibaba Cloud / Qwen Team🟢 Ouvert90,6 %28 novembre 2024Auto-déclaré
26DeepSeek-V3DeepSeek🟢 Ouvert90,2 %25 décembre 2024Auto-déclaré
27o1-miniOpenAI🔒 Propriétaire90,0 %12 septembre 2024Auto-déclaré
28DeepSeek R1 Distill Llama 8BDeepSeek🟢 Ouvert89,1 %20 janvier 2025Auto-déclaré
29DeepSeek R1 Distill Qwen 1.5BDeepSeek🟢 Ouvert83,9 %20 janvier 2025Auto-déclaré
30Granite 3.3 8B BaseIBM🟢 Ouvert69,0 %16 avril 2025Auto-déclaré
31Granite 3.3 8B InstructIBM🟢 Ouvert69,0 %16 avril 2025Auto-déclaré

Classement établi sur 31 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 95,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MATH-500 indique qu’un modèle fournit très souvent la réponse finale exacte à des problèmes mathématiques difficiles. La métrique exact match mesure directement cette correction finale, mais ne suffit pas à établir la qualité de chaque étape du raisonnement, même si le jeu contient des solutions détaillées. La comparaison doit aussi être interprétée avec prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.

Le score médian de 96 % parmi 31 modèles et le résultat de 99 % obtenu par LongCat-Flash-Thinking signalent une forte concentration près du maximum. Cette saturation réduit la capacité du benchmark à départager finement les meilleurs systèmes. Son accès public appelle également à la vigilance quant au risque de contamination des évaluations. Enfin, sa portée reste ciblée sur des problèmes en anglais, issus de compétitions et répartis entre sept matières. Le classement révèle donc surtout les écarts de performance sur ce cadre mathématique précis, avec un avantage limité pour le modèle en tête.


Sources des scores : llm-stats.