GSM8k

GSM8k est un benchmark créé par OpenAI, sous la direction de Karl Cobbe et de ses coauteurs. Il rassemble des problèmes de mathématiques rédigés en anglais, formulés en langage naturel et inspirés du niveau de l’école primaire.

GSM8k est un benchmark créé par OpenAI, sous la direction de Karl Cobbe et de ses coauteurs. Il rassemble des problèmes de mathématiques rédigés en anglais, formulés en langage naturel et inspirés du niveau de l’école primaire.

Son objectif est de mesurer la capacité des modèles à enchaîner plusieurs étapes de raisonnement et à effectuer des opérations arithmétiques élémentaires pour produire une réponse courte. GSM8k sert ainsi à comparer leur aptitude à résoudre correctement des problèmes mathématiques structurés, au-delà de la simple restitution d’un résultat.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI (Karl Cobbe et al.)
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte, avec problèmes de mathématiques en langage naturel
Métrique d'évaluationexact match / accuracy sur la réponse finale
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeu8 792 problèmes environ (7 473 entraînement, 1 319 test)
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (47)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiMo-V2.5-ProXiaomi🟢 Ouvert99,6 %27 avril 2026Auto-déclaré
2Kimi K2 InstructMoonshot AI🟢 Ouvert97,3 %11 juillet 2025Auto-déclaré
3o1OpenAI🔒 Propriétaire97,1 %17 décembre 2024Auto-déclaré
4GPT-4.5OpenAI🔒 Propriétaire97,0 %5 mars 2026Auto-déclaré
5Llama 3.1 405B InstructMeta🟢 Ouvert96,8 %23 juillet 2024Auto-déclaré
6Claude 3.5 SonnetAnthropic🔒 Propriétaire96,4 %22 octobre 2024Auto-déclaré
7Gemma 3 27BGoogle🟢 Ouvert95,9 %12 mars 2025Auto-déclaré
8Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert95,9 %19 septembre 2024Auto-déclaré
9Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert95,8 %19 septembre 2024Auto-déclaré
10DeepSeek-V2.5DeepSeek🟢 Ouvert95,1 %8 mai 2024Auto-déclaré
11Claude 3 OpusAnthropic🔒 Propriétaire95,0 %29 février 2024Auto-déclaré
12Nova ProAmazon🔒 Propriétaire94,8 %20 novembre 2024Auto-déclaré
13Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert94,8 %19 septembre 2024Auto-déclaré
14Nova LiteAmazon🔒 Propriétaire94,5 %20 novembre 2024Auto-déclaré
15Gemma 3 12BGoogle🟢 Ouvert94,4 %12 mars 2025Auto-déclaré
16Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert94,4 %29 avril 2025Auto-déclaré
17Mistral Large 2Mistral AI🟢 Ouvert93,0 %24 juillet 2024Auto-déclaré
18Claude 3 SonnetAnthropic🔒 Propriétaire92,3 %29 février 2024Auto-déclaré
19Nova MicroAmazon🔒 Propriétaire92,3 %20 novembre 2024Auto-déclaré
20Kimi K2 BaseMoonshot AI🟢 Ouvert92,1 %11 juillet 2025Auto-déclaré
21Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert91,6 %19 septembre 2024Auto-déclaré
22Llama 3.1 Nemotron 70B InstructNVIDIA🟢 Ouvert91,4 %1 octobre 2024Auto-déclaré
23Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert91,1 %23 juillet 2024Auto-déclaré
24Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert91,1 %19 septembre 2024Auto-déclaré
25Gemini 1.5 ProGoogle🔒 Propriétaire90,8 %1 mai 2024Auto-déclaré
26Grok-1.5xAI🔒 Propriétaire90,0 %28 mars 2024Auto-déclaré
27Gemma 3 4BGoogle🟢 Ouvert89,2 %12 mars 2025Auto-déclaré
28Claude 3 HaikuAnthropic🔒 Propriétaire88,9 %13 mars 2024Auto-déclaré
29Phi-3.5-MoE-instructMicrosoft🟢 Ouvert88,7 %23 août 2024Auto-déclaré
30Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert88,7 %27 mars 2025Auto-déclaré
31Phi 4 MiniMicrosoft🟢 Ouvert88,6 %30 avril 2025Auto-déclaré
32Jamba 1.5 LargeAI21 Labs🟢 Ouvert87,0 %22 août 2024Auto-déclaré
33Gemini 1.5 FlashGoogle🔒 Propriétaire86,2 %1 mai 2024Auto-déclaré
34Phi-3.5-mini-instructMicrosoft🟢 Ouvert86,2 %23 août 2024Auto-déclaré
35Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %19 septembre 2024Auto-déclaré
36Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,3 %23 juillet 2024Auto-déclaré
37Granite 3.3 8B InstructIBM🟢 Ouvert80,9 %16 avril 2025Auto-déclaré
38Mistral Small 3 24B BaseMistral AI🟢 Ouvert80,7 %30 janvier 2025Auto-déclaré
39Llama 3.2 3B InstructMeta🟢 Ouvert77,7 %25 septembre 2024Auto-déclaré
40Jamba 1.5 MiniAI21 Labs🟢 Ouvert75,8 %22 août 2024Auto-déclaré
41Gemma 2 27BGoogle🟢 Ouvert74,0 %27 juin 2024Auto-déclaré
42Cohere: Command R (08-2024)Cohere🟢 Ouvert70,7 %30 août 2024Auto-déclaré
43IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert70,1 %2 mai 2025Auto-déclaré
44Gemma 2 9BGoogle🟢 Ouvert68,6 %27 juin 2024Auto-déclaré
45Gemma 3 1BGoogle🟢 Ouvert62,8 %12 mars 2025Auto-déclaré
46Granite 3.3 8B BaseIBM🟢 Ouvert59,0 %16 avril 2025Auto-déclaré
47ERNIE 4.5Baidu🔒 Propriétaire25,2 %25 juin 2025Auto-déclaré

Classement établi sur 47 modèles évalués, dont 27 de grands éditeurs. Score médian de l'ensemble : 91,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur GSM8k indique qu’un modèle fournit fréquemment la réponse finale exacte à des problèmes exigeant plusieurs étapes de raisonnement arithmétique. La métrique exact match reste stricte sur le résultat final, mais elle ne mesure pas directement la qualité ou la validité des étapes intermédiaires. La fiabilité comparative doit aussi être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure unique.

Le score médian de 91 % parmi les 47 modèles évalués et le résultat de 100 % obtenu par MiMo-V2.5-Pro signalent une forte saturation du benchmark au sommet du classement. Les écarts restants deviennent donc peu discriminants. Son accès public peut également exposer l’évaluation à un risque de contamination des données d’entraînement, ce qui impose de la prudence dans l’interprétation. Enfin, sa portée demeure ciblée sur des problèmes scolaires en anglais, avec des opérations élémentaires et des réponses courtes. Le classement révèle ainsi une maîtrise très élevée de cette tâche précise, sans constituer une mesure générale des capacités mathématiques ou du raisonnement d’un modèle.


Sources des scores : llm-stats.