GSM8k
GSM8k est un benchmark créé par OpenAI, sous la direction de Karl Cobbe et de ses coauteurs. Il rassemble des problèmes de mathématiques rédigés en anglais, formulés en langage naturel et inspirés du niveau de l’école primaire.
GSM8k est un benchmark créé par OpenAI, sous la direction de Karl Cobbe et de ses coauteurs. Il rassemble des problèmes de mathématiques rédigés en anglais, formulés en langage naturel et inspirés du niveau de l’école primaire.
Son objectif est de mesurer la capacité des modèles à enchaîner plusieurs étapes de raisonnement et à effectuer des opérations arithmétiques élémentaires pour produire une réponse courte. GSM8k sert ainsi à comparer leur aptitude à résoudre correctement des problèmes mathématiques structurés, au-delà de la simple restitution d’un résultat.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI (Karl Cobbe et al.) |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte, avec problèmes de mathématiques en langage naturel |
| Métrique d'évaluation | exact match / accuracy sur la réponse finale |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | 8 792 problèmes environ (7 473 entraînement, 1 319 test) |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (47)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 99,6 % | 27 avril 2026 | Auto-déclaré |
| 2 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 97,3 % | 11 juillet 2025 | Auto-déclaré |
| 3 | o1 | OpenAI | 🔒 Propriétaire | 97,1 % | 17 décembre 2024 | Auto-déclaré |
| 4 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 97,0 % | 5 mars 2026 | Auto-déclaré |
| 5 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 96,8 % | 23 juillet 2024 | Auto-déclaré |
| 6 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 96,4 % | 22 octobre 2024 | Auto-déclaré |
| 7 | Gemma 3 27B | 🟢 Ouvert | 95,9 % | 12 mars 2025 | Auto-déclaré | |
| 8 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,9 % | 19 septembre 2024 | Auto-déclaré |
| 9 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,8 % | 19 septembre 2024 | Auto-déclaré |
| 10 | DeepSeek-V2.5 | DeepSeek | 🟢 Ouvert | 95,1 % | 8 mai 2024 | Auto-déclaré |
| 11 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 95,0 % | 29 février 2024 | Auto-déclaré |
| 12 | Nova Pro | Amazon | 🔒 Propriétaire | 94,8 % | 20 novembre 2024 | Auto-déclaré |
| 13 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,8 % | 19 septembre 2024 | Auto-déclaré |
| 14 | Nova Lite | Amazon | 🔒 Propriétaire | 94,5 % | 20 novembre 2024 | Auto-déclaré |
| 15 | Gemma 3 12B | 🟢 Ouvert | 94,4 % | 12 mars 2025 | Auto-déclaré | |
| 16 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,4 % | 29 avril 2025 | Auto-déclaré |
| 17 | Mistral Large 2 | Mistral AI | 🟢 Ouvert | 93,0 % | 24 juillet 2024 | Auto-déclaré |
| 18 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 92,3 % | 29 février 2024 | Auto-déclaré |
| 19 | Nova Micro | Amazon | 🔒 Propriétaire | 92,3 % | 20 novembre 2024 | Auto-déclaré |
| 20 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 92,1 % | 11 juillet 2025 | Auto-déclaré |
| 21 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,6 % | 19 septembre 2024 | Auto-déclaré |
| 22 | Llama 3.1 Nemotron 70B Instruct | NVIDIA | 🟢 Ouvert | 91,4 % | 1 octobre 2024 | Auto-déclaré |
| 23 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,1 % | 23 juillet 2024 | Auto-déclaré |
| 24 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,1 % | 19 septembre 2024 | Auto-déclaré |
| 25 | Gemini 1.5 Pro | 🔒 Propriétaire | 90,8 % | 1 mai 2024 | Auto-déclaré | |
| 26 | Grok-1.5 | xAI | 🔒 Propriétaire | 90,0 % | 28 mars 2024 | Auto-déclaré |
| 27 | Gemma 3 4B | 🟢 Ouvert | 89,2 % | 12 mars 2025 | Auto-déclaré | |
| 28 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 88,9 % | 13 mars 2024 | Auto-déclaré |
| 29 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 88,7 % | 23 août 2024 | Auto-déclaré |
| 30 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,7 % | 27 mars 2025 | Auto-déclaré |
| 31 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 88,6 % | 30 avril 2025 | Auto-déclaré |
| 32 | Jamba 1.5 Large | AI21 Labs | 🟢 Ouvert | 87,0 % | 22 août 2024 | Auto-déclaré |
| 33 | Gemini 1.5 Flash | 🔒 Propriétaire | 86,2 % | 1 mai 2024 | Auto-déclaré | |
| 34 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 86,2 % | 23 août 2024 | Auto-déclaré |
| 35 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 19 septembre 2024 | Auto-déclaré |
| 36 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,3 % | 23 juillet 2024 | Auto-déclaré |
| 37 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 80,9 % | 16 avril 2025 | Auto-déclaré |
| 38 | Mistral Small 3 24B Base | Mistral AI | 🟢 Ouvert | 80,7 % | 30 janvier 2025 | Auto-déclaré |
| 39 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 77,7 % | 25 septembre 2024 | Auto-déclaré |
| 40 | Jamba 1.5 Mini | AI21 Labs | 🟢 Ouvert | 75,8 % | 22 août 2024 | Auto-déclaré |
| 41 | Gemma 2 27B | 🟢 Ouvert | 74,0 % | 27 juin 2024 | Auto-déclaré | |
| 42 | Cohere: Command R (08-2024) | Cohere | 🟢 Ouvert | 70,7 % | 30 août 2024 | Auto-déclaré |
| 43 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 70,1 % | 2 mai 2025 | Auto-déclaré |
| 44 | Gemma 2 9B | 🟢 Ouvert | 68,6 % | 27 juin 2024 | Auto-déclaré | |
| 45 | Gemma 3 1B | 🟢 Ouvert | 62,8 % | 12 mars 2025 | Auto-déclaré | |
| 46 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 59,0 % | 16 avril 2025 | Auto-déclaré |
| 47 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 25,2 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 47 modèles évalués, dont 27 de grands éditeurs. Score médian de l'ensemble : 91,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur GSM8k indique qu’un modèle fournit fréquemment la réponse finale exacte à des problèmes exigeant plusieurs étapes de raisonnement arithmétique. La métrique exact match reste stricte sur le résultat final, mais elle ne mesure pas directement la qualité ou la validité des étapes intermédiaires. La fiabilité comparative doit aussi être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure unique.
Le score médian de 91 % parmi les 47 modèles évalués et le résultat de 100 % obtenu par MiMo-V2.5-Pro signalent une forte saturation du benchmark au sommet du classement. Les écarts restants deviennent donc peu discriminants. Son accès public peut également exposer l’évaluation à un risque de contamination des données d’entraînement, ce qui impose de la prudence dans l’interprétation. Enfin, sa portée demeure ciblée sur des problèmes scolaires en anglais, avec des opérations élémentaires et des réponses courtes. Le classement révèle ainsi une maîtrise très élevée de cette tâche précise, sans constituer une mesure générale des capacités mathématiques ou du raisonnement d’un modèle.
Sources des scores : llm-stats.