MGSM

MGSM est un benchmark de raisonnement mathématique multilingue créé par Google Research et F. Shi et al. Il rassemble des problèmes de niveau école primaire issus de GSM8K, puis traduits manuellement dans plusieurs langues typologiquement diverses.

MGSM est un benchmark de raisonnement mathématique multilingue créé par Google Research et F. Shi et al. Il rassemble des problèmes de niveau école primaire issus de GSM8K, puis traduits manuellement dans plusieurs langues typologiquement diverses.

Les modèles doivent produire une réponse numérique courte à des questions ouvertes mobilisant le raisonnement arithmétique. MGSM sert ainsi à comparer leur capacité à résoudre un même type de problème dans différents contextes linguistiques, au-delà d’une évaluation limitée à une seule langue.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle Research / F. Shi et al.
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte numérique
Métrique d'évaluationaccuracy / exact match
AccèsPublic
Languesmultilingue (10 langues : espagnol, français, allemand, russe, chinois, japonais, thaï, swahili, bengali, télougou)
Taille du jeu250 problèmes par langue, soit 2 500 items traduits au total
Année de publication2022
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (30)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Llama 4 MaverickMeta🟢 Ouvert92,3 %5 avril 2025Auto-déclaré
2o3-miniOpenAI🔒 Propriétaire92,0 %30 janvier 2025Auto-déclaré
3Claude 3.5 SonnetAnthropic🔒 Propriétaire91,6 %22 octobre 2024Auto-déclaré
4Llama 3.3 70B InstructMeta🟢 Ouvert91,1 %6 décembre 2024Auto-déclaré
5o1-previewOpenAI🔒 Propriétaire90,8 %12 septembre 2024Auto-déclaré
6Claude 3 OpusAnthropic🔒 Propriétaire90,7 %29 février 2024Auto-déclaré
7Llama 4 ScoutMeta🟢 Ouvert90,6 %5 avril 2025Auto-déclaré
8GPT-4oOpenAI🔒 Propriétaire90,5 %27 mars 2025Auto-déclaré
9o1OpenAI🔒 Propriétaire89,3 %17 décembre 2024Auto-déclaré
10GPT-4 TurboOpenAI🔒 Propriétaire88,5 %9 avril 2024Auto-déclaré
11Gemini 1.5 ProGoogle🔒 Propriétaire87,5 %1 mai 2024Auto-déclaré
12GPT-4o miniOpenAI🔒 Propriétaire87,0 %18 juillet 2024Auto-déclaré
13Llama 3.2 90B InstructMeta🟢 Ouvert86,9 %25 septembre 2024Auto-déclaré
14Claude 3.5 HaikuAnthropic🔒 Propriétaire85,6 %4 novembre 2024Auto-déclaré
15Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert83,5 %29 avril 2025Auto-déclaré
16Claude 3 SonnetAnthropic🔒 Propriétaire83,5 %29 février 2024Auto-déclaré
17Gemini 1.5 FlashGoogle🔒 Propriétaire82,6 %1 mai 2024Auto-déclaré
18Phi 4Microsoft🟢 Ouvert80,6 %12 décembre 2024Auto-déclaré
19Claude 3 HaikuAnthropic🔒 Propriétaire75,1 %13 mars 2024Auto-déclaré
20GPT-4OpenAI🔒 Propriétaire74,5 %28 août 2023Auto-déclaré
21Llama 3.2 11B InstructMeta🟢 Ouvert68,9 %25 septembre 2024Auto-déclaré
22Gemma 3n E4B InstructedGoogle🔒 Propriétaire67,0 %26 juin 2025Auto-déclaré
23Phi 4 MiniMicrosoft🟢 Ouvert63,9 %30 avril 2025Auto-déclaré
24Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert60,7 %20 mai 2025Auto-déclaré
25Phi-3.5-MoE-instructMicrosoft🟢 Ouvert58,7 %23 août 2024Auto-déclaré
26Llama 3.2 3B InstructMeta🟢 Ouvert58,2 %25 septembre 2024Auto-déclaré
27GPT-3.5 TurboOpenAI🔒 Propriétaire56,3 %21 mars 2023n.d.
28Gemma 3n E2B InstructedGoogle🔒 Propriétaire53,1 %26 juin 2025Auto-déclaré
29Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert53,1 %20 mai 2025Auto-déclaré
30Phi-3.5-mini-instructMicrosoft🟢 Ouvert47,9 %23 août 2024Auto-déclaré

Classement établi sur 30 modèles évalués, dont 29 de grands éditeurs. Score médian de l'ensemble : 83,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MGSM indique qu’un modèle fournit fréquemment la réponse numérique exacte à des problèmes arithmétiques scolaires dans les langues couvertes. L’exact match mesure strictement la justesse de la réponse finale, sans évaluer séparément la qualité du raisonnement produit. La médiane de 84 % parmi les 30 modèles suivis, face aux 92 % de Llama 4 Maverick, montre un niveau général déjà élevé et un écart limité en tête. Cette concentration peut réduire le pouvoir discriminant du benchmark à mesure que les performances progressent. La comparaison doit aussi rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. L’accès public et la filiation avec GSM8K créent également un risque d’exposition préalable aux items, susceptible d’affecter l’interprétation des résultats. Enfin, la portée demeure ciblée sur des problèmes de mathématiques de niveau primaire, traduits dans dix langues, avec des réponses numériques courtes. Le classement renseigne donc sur ce cadre précis, et non sur l’ensemble des aptitudes mathématiques ou multilingues.


Sources des scores : llm-stats.