MATH-500
MATH-500 est un sous-ensemble du jeu MATH consacré à 500 problèmes exigeants issus de compétitions mathématiques. Créé par OpenAI, dans les travaux de H. Lightman et al. à partir du corpus de D. Hendrycks et al., il couvre plusieurs niveaux de difficulté et sept domaines mathématiques.
MATH-500 est un sous-ensemble du jeu MATH consacré à 500 problèmes exigeants issus de compétitions mathématiques. Créé par OpenAI, dans les travaux de H. Lightman et al. à partir du corpus de D. Hendrycks et al., il couvre plusieurs niveaux de difficulté et sept domaines mathématiques.
Le benchmark évalue la capacité des modèles à résoudre des questions ouvertes à réponse courte, en mobilisant un raisonnement en plusieurs étapes, du calcul symbolique et la sélection de la réponse finale correcte. Les solutions détaillées associées aux problèmes en font un outil d’évaluation ciblé sur les mathématiques de compétition.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI (H. Lightman et al.), à partir du jeu MATH de D. Hendrycks et al. |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes de mathématiques à réponse courte, avec solutions détaillées |
| Métrique d'évaluation | exact match / accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 500 problèmes |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (31)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 99,2 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 98,6 % | 6 mars 2026 | Auto-déclaré |
| 3 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 98,2 % | 28 juillet 2025 | Auto-déclaré |
| 4 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 98,1 % | 28 juillet 2025 | Auto-déclaré |
| 5 | Nemotron Nano 9B v2 | NVIDIA | 🟢 Ouvert | 97,8 % | 18 août 2025 | Auto-déclaré |
| 6 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 97,4 % | 11 juillet 2025 | Auto-déclaré |
| 7 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 97,4 % | 5 septembre 2025 | Auto-déclaré |
| 8 | Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 🟢 Ouvert | 97,0 % | 7 avril 2025 | Auto-déclaré |
| 9 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 97,0 % | 6 mars 2026 | Auto-déclaré |
| 10 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 96,8 % | 5 février 2026 | Auto-déclaré |
| 11 | Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 🟢 Ouvert | 96,6 % | 18 mars 2025 | Auto-déclaré |
| 12 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 96,4 % | 29 août 2025 | Auto-déclaré |
| 13 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 96,2 % | 24 février 2025 | Auto-déclaré |
| 14 | Kimi-k1.5 | Moonshot AI | 🔒 Propriétaire | 96,2 % | 20 janvier 2025 | Auto-déclaré |
| 15 | MiniMax M1 | MiniMax | 🟢 Ouvert | 96,0 % | 17 juin 2025 | Auto-déclaré |
| 16 | DeepSeek R1 Zero | DeepSeek | 🟢 Ouvert | 95,9 % | 20 janvier 2025 | Auto-déclaré |
| 17 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 🟢 Ouvert | 95,4 % | 18 mars 2025 | Auto-déclaré |
| 18 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 94,6 % | 30 avril 2025 | Auto-déclaré |
| 19 | DeepSeek R1 Distill Llama 70B | DeepSeek | 🟢 Ouvert | 94,5 % | 20 janvier 2025 | Auto-déclaré |
| 20 | DeepSeek R1 Distill Qwen 32B | DeepSeek | 🟢 Ouvert | 94,3 % | 20 janvier 2025 | Auto-déclaré |
| 21 | DeepSeek-V3 0324 | DeepSeek | 🟢 Ouvert | 94,0 % | 25 mars 2025 | Auto-déclaré |
| 22 | DeepSeek R1 Distill Qwen 14B | DeepSeek | 🟢 Ouvert | 93,9 % | 20 janvier 2025 | Auto-déclaré |
| 23 | DeepSeek R1 Distill Qwen 7B | DeepSeek | 🟢 Ouvert | 92,8 % | 20 janvier 2025 | Auto-déclaré |
| 24 | QwQ-32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,6 % | 5 mars 2025 | Auto-déclaré |
| 25 | QwQ-32B-Preview | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,6 % | 28 novembre 2024 | Auto-déclaré |
| 26 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 90,2 % | 25 décembre 2024 | Auto-déclaré |
| 27 | o1-mini | OpenAI | 🔒 Propriétaire | 90,0 % | 12 septembre 2024 | Auto-déclaré |
| 28 | DeepSeek R1 Distill Llama 8B | DeepSeek | 🟢 Ouvert | 89,1 % | 20 janvier 2025 | Auto-déclaré |
| 29 | DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 🟢 Ouvert | 83,9 % | 20 janvier 2025 | Auto-déclaré |
| 30 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 69,0 % | 16 avril 2025 | Auto-déclaré |
| 31 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 69,0 % | 16 avril 2025 | Auto-déclaré |
Classement établi sur 31 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 95,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MATH-500 indique qu’un modèle fournit très souvent la réponse finale exacte à des problèmes mathématiques difficiles. La métrique exact match mesure directement cette correction finale, mais ne suffit pas à établir la qualité de chaque étape du raisonnement, même si le jeu contient des solutions détaillées. La comparaison doit aussi être interprétée avec prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.
Le score médian de 96 % parmi 31 modèles et le résultat de 99 % obtenu par LongCat-Flash-Thinking signalent une forte concentration près du maximum. Cette saturation réduit la capacité du benchmark à départager finement les meilleurs systèmes. Son accès public appelle également à la vigilance quant au risque de contamination des évaluations. Enfin, sa portée reste ciblée sur des problèmes en anglais, issus de compétitions et répartis entre sept matières. Le classement révèle donc surtout les écarts de performance sur ce cadre mathématique précis, avec un avantage limité pour le modèle en tête.
Sources des scores : llm-stats.