MGSM
MGSM est un benchmark de raisonnement mathématique multilingue créé par Google Research et F. Shi et al. Il rassemble des problèmes de niveau école primaire issus de GSM8K, puis traduits manuellement dans plusieurs langues typologiquement diverses.
MGSM est un benchmark de raisonnement mathématique multilingue créé par Google Research et F. Shi et al. Il rassemble des problèmes de niveau école primaire issus de GSM8K, puis traduits manuellement dans plusieurs langues typologiquement diverses.
Les modèles doivent produire une réponse numérique courte à des questions ouvertes mobilisant le raisonnement arithmétique. MGSM sert ainsi à comparer leur capacité à résoudre un même type de problème dans différents contextes linguistiques, au-delà d’une évaluation limitée à une seule langue.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google Research / F. Shi et al. |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte numérique |
| Métrique d'évaluation | accuracy / exact match |
| Accès | Public |
| Langues | multilingue (10 langues : espagnol, français, allemand, russe, chinois, japonais, thaï, swahili, bengali, télougou) |
| Taille du jeu | 250 problèmes par langue, soit 2 500 items traduits au total |
| Année de publication | 2022 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (30)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Llama 4 Maverick | Meta | 🟢 Ouvert | 92,3 % | 5 avril 2025 | Auto-déclaré |
| 2 | o3-mini | OpenAI | 🔒 Propriétaire | 92,0 % | 30 janvier 2025 | Auto-déclaré |
| 3 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 91,6 % | 22 octobre 2024 | Auto-déclaré |
| 4 | Llama 3.3 70B Instruct | Meta | 🟢 Ouvert | 91,1 % | 6 décembre 2024 | Auto-déclaré |
| 5 | o1-preview | OpenAI | 🔒 Propriétaire | 90,8 % | 12 septembre 2024 | Auto-déclaré |
| 6 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 90,7 % | 29 février 2024 | Auto-déclaré |
| 7 | Llama 4 Scout | Meta | 🟢 Ouvert | 90,6 % | 5 avril 2025 | Auto-déclaré |
| 8 | GPT-4o | OpenAI | 🔒 Propriétaire | 90,5 % | 27 mars 2025 | Auto-déclaré |
| 9 | o1 | OpenAI | 🔒 Propriétaire | 89,3 % | 17 décembre 2024 | Auto-déclaré |
| 10 | GPT-4 Turbo | OpenAI | 🔒 Propriétaire | 88,5 % | 9 avril 2024 | Auto-déclaré |
| 11 | Gemini 1.5 Pro | 🔒 Propriétaire | 87,5 % | 1 mai 2024 | Auto-déclaré | |
| 12 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 87,0 % | 18 juillet 2024 | Auto-déclaré |
| 13 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 86,9 % | 25 septembre 2024 | Auto-déclaré |
| 14 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 85,6 % | 4 novembre 2024 | Auto-déclaré |
| 15 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,5 % | 29 avril 2025 | Auto-déclaré |
| 16 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 83,5 % | 29 février 2024 | Auto-déclaré |
| 17 | Gemini 1.5 Flash | 🔒 Propriétaire | 82,6 % | 1 mai 2024 | Auto-déclaré | |
| 18 | Phi 4 | Microsoft | 🟢 Ouvert | 80,6 % | 12 décembre 2024 | Auto-déclaré |
| 19 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 75,1 % | 13 mars 2024 | Auto-déclaré |
| 20 | GPT-4 | OpenAI | 🔒 Propriétaire | 74,5 % | 28 août 2023 | Auto-déclaré |
| 21 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 68,9 % | 25 septembre 2024 | Auto-déclaré |
| 22 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 67,0 % | 26 juin 2025 | Auto-déclaré | |
| 23 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 63,9 % | 30 avril 2025 | Auto-déclaré |
| 24 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 60,7 % | 20 mai 2025 | Auto-déclaré | |
| 25 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 58,7 % | 23 août 2024 | Auto-déclaré |
| 26 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 58,2 % | 25 septembre 2024 | Auto-déclaré |
| 27 | GPT-3.5 Turbo | OpenAI | 🔒 Propriétaire | 56,3 % | 21 mars 2023 | n.d. |
| 28 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 53,1 % | 26 juin 2025 | Auto-déclaré | |
| 29 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 53,1 % | 20 mai 2025 | Auto-déclaré | |
| 30 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 47,9 % | 23 août 2024 | Auto-déclaré |
Classement établi sur 30 modèles évalués, dont 29 de grands éditeurs. Score médian de l'ensemble : 83,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MGSM indique qu’un modèle fournit fréquemment la réponse numérique exacte à des problèmes arithmétiques scolaires dans les langues couvertes. L’exact match mesure strictement la justesse de la réponse finale, sans évaluer séparément la qualité du raisonnement produit. La médiane de 84 % parmi les 30 modèles suivis, face aux 92 % de Llama 4 Maverick, montre un niveau général déjà élevé et un écart limité en tête. Cette concentration peut réduire le pouvoir discriminant du benchmark à mesure que les performances progressent. La comparaison doit aussi rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. L’accès public et la filiation avec GSM8K créent également un risque d’exposition préalable aux items, susceptible d’affecter l’interprétation des résultats. Enfin, la portée demeure ciblée sur des problèmes de mathématiques de niveau primaire, traduits dans dix langues, avec des réponses numériques courtes. Le classement renseigne donc sur ce cadre précis, et non sur l’ensemble des aptitudes mathématiques ou multilingues.
Sources des scores : llm-stats.