MATH (CoT)

MATH (CoT), créé par D. Hendrycks et al., est un benchmark consacré à des problèmes difficiles issus de compétitions mathématiques. Les exercices couvrent plusieurs niveaux de difficulté et sept domaines, avec des solutions complètes étape par étape.

MATH (CoT), créé par D. Hendrycks et al., est un benchmark consacré à des problèmes difficiles issus de compétitions mathématiques. Les exercices couvrent plusieurs niveaux de difficulté et sept domaines, avec des solutions complètes étape par étape.

Cette variante mobilise le Chain-of-Thought prompting afin d’encourager un raisonnement multi-étapes avant la production d’une réponse courte. Elle sert à évaluer la capacité des modèles à résoudre des problèmes de compétition et à parvenir à une réponse finale correcte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkD. Hendrycks et al.
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes de mathématiques à réponse courte, avec raisonnement étape par étape attendu dans cette variante CoT
Métrique d'évaluationexact match / accuracy sur la réponse finale
AccèsPublic
Languesanglais
Taille du jeu12 500 problèmes
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Llama 3.1 70B InstructMeta🟢 Ouvert68,0 %23 juillet 2024Auto-déclaré
2Ministral 3 (14B Base 2512)Mistral AI🟢 Ouvert67,6 %4 décembre 2025Auto-déclaré
3Mistral Large 3Mistral AI🟢 Ouvert67,6 %1 septembre 2025Auto-déclaré
4Ministral 3 (8B Base 2512)Mistral AI🟢 Ouvert62,6 %4 décembre 2025Auto-déclaré
5Ministral 3 (3B Base 2512)Mistral AI🟢 Ouvert60,1 %4 décembre 2025Auto-déclaré
6Llama 3.1 8B InstructMeta🟢 Ouvert51,9 %23 juillet 2024Auto-déclaré

Classement établi sur 6 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 65,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle fournit fréquemment la réponse finale exacte après un raisonnement guidé étape par étape. La métrique porte toutefois sur cette réponse finale, et non sur la validité détaillée du raisonnement produit. La rigueur des comparaisons doit aussi être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs.

Le classement est resserré : parmi les six modèles évalués, Llama 3.1 70B Instruct arrive en tête à 68 %, contre une médiane de 65 %. Cet écart limité suggère une différenciation modeste dans cet ensemble, sans démontrer à lui seul une saturation générale du benchmark. Son accès public peut par ailleurs exposer l’évaluation à un risque de contamination des données d’entraînement. Enfin, sa portée reste centrée sur des problèmes de compétition en anglais, à réponse courte, provenant notamment d’AMC 10, AMC 12 et AIME. Les résultats caractérisent donc cette forme précise de raisonnement mathématique, plutôt qu’une capacité mathématique universelle.


Sources des scores : llm-stats.