MATH (CoT)
MATH (CoT), créé par D. Hendrycks et al., est un benchmark consacré à des problèmes difficiles issus de compétitions mathématiques. Les exercices couvrent plusieurs niveaux de difficulté et sept domaines, avec des solutions complètes étape par étape.
MATH (CoT), créé par D. Hendrycks et al., est un benchmark consacré à des problèmes difficiles issus de compétitions mathématiques. Les exercices couvrent plusieurs niveaux de difficulté et sept domaines, avec des solutions complètes étape par étape.
Cette variante mobilise le Chain-of-Thought prompting afin d’encourager un raisonnement multi-étapes avant la production d’une réponse courte. Elle sert à évaluer la capacité des modèles à résoudre des problèmes de compétition et à parvenir à une réponse finale correcte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | D. Hendrycks et al. |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes de mathématiques à réponse courte, avec raisonnement étape par étape attendu dans cette variante CoT |
| Métrique d'évaluation | exact match / accuracy sur la réponse finale |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 12 500 problèmes |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 68,0 % | 23 juillet 2024 | Auto-déclaré |
| 2 | Ministral 3 (14B Base 2512) | Mistral AI | 🟢 Ouvert | 67,6 % | 4 décembre 2025 | Auto-déclaré |
| 3 | Mistral Large 3 | Mistral AI | 🟢 Ouvert | 67,6 % | 1 septembre 2025 | Auto-déclaré |
| 4 | Ministral 3 (8B Base 2512) | Mistral AI | 🟢 Ouvert | 62,6 % | 4 décembre 2025 | Auto-déclaré |
| 5 | Ministral 3 (3B Base 2512) | Mistral AI | 🟢 Ouvert | 60,1 % | 4 décembre 2025 | Auto-déclaré |
| 6 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 51,9 % | 23 juillet 2024 | Auto-déclaré |
Classement établi sur 6 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 65,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle fournit fréquemment la réponse finale exacte après un raisonnement guidé étape par étape. La métrique porte toutefois sur cette réponse finale, et non sur la validité détaillée du raisonnement produit. La rigueur des comparaisons doit aussi être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs.
Le classement est resserré : parmi les six modèles évalués, Llama 3.1 70B Instruct arrive en tête à 68 %, contre une médiane de 65 %. Cet écart limité suggère une différenciation modeste dans cet ensemble, sans démontrer à lui seul une saturation générale du benchmark. Son accès public peut par ailleurs exposer l’évaluation à un risque de contamination des données d’entraînement. Enfin, sa portée reste centrée sur des problèmes de compétition en anglais, à réponse courte, provenant notamment d’AMC 10, AMC 12 et AIME. Les résultats caractérisent donc cette forme précise de raisonnement mathématique, plutôt qu’une capacité mathématique universelle.
Sources des scores : llm-stats.