MMLU

MMLU, pour Massive Multitask Language Understanding, est un benchmark créé par D. Hendrycks et ses coauteurs en 2020. Il évalue les connaissances d’un modèle dans des domaines variés, notamment les sciences, les sciences humaines, les sciences sociales et les disciplines professionnelles.

MMLU, pour Massive Multitask Language Understanding, est un benchmark créé par D. Hendrycks et ses coauteurs en 2020. Il évalue les connaissances d’un modèle dans des domaines variés, notamment les sciences, les sciences humaines, les sciences sociales et les disciplines professionnelles.

À travers des questions à choix multiple en anglais, MMLU mesure conjointement la compréhension linguistique, les connaissances factuelles et spécialisées, ainsi que le raisonnement en contexte QCM. Il sert ainsi de référence transversale pour comparer les capacités générales des modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkD. Hendrycks et al.
Capacités mesuréesfinance, généraliste, santé, langage, juridique, mathématiques, raisonnement
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeuenviron 15 900 questions, dont 14 042 questions de test, couvrant 57 sujets
Année de publication2020
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (98)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5OpenAI🔒 Propriétaire92,5 %7 août 2025Auto-déclaré
2o1OpenAI🔒 Propriétaire91,8 %17 décembre 2024Auto-déclaré
3GPT-4.5OpenAI🔒 Propriétaire90,8 %5 mars 2026Auto-déclaré
4o1-previewOpenAI🔒 Propriétaire90,8 %12 septembre 2024Auto-déclaré
5Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert90,6 %22 septembre 2025Auto-déclaré
6Sarvam-105BSarvam AI🟢 Ouvert90,6 %6 mars 2026Auto-déclaré
7Claude 3.5 SonnetAnthropic🔒 Propriétaire90,4 %22 octobre 2024Auto-déclaré
8GPT-4.1OpenAI🔒 Propriétaire90,2 %14 avril 2025Auto-déclaré
9Kimi K2 0905Moonshot AI🔒 Propriétaire90,2 %5 septembre 2025Auto-déclaré
10GPT OSS 120BOpenAI🟢 Ouvert90,0 %5 août 2025Auto-déclaré
11LongCat-Flash-ChatMeituan🟢 Ouvert89,7 %29 août 2025Auto-déclaré
12Kimi K2 InstructMoonshot AI🟢 Ouvert89,5 %11 juillet 2025Auto-déclaré
13Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert89,5 %5 septembre 2025Auto-déclaré
14MiMo-V2.5-ProXiaomi🟢 Ouvert89,4 %27 avril 2026Auto-déclaré
15Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,8 %22 septembre 2025Auto-déclaré
16Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert88,7 %22 septembre 2025Auto-déclaré
17DeepSeek-V3DeepSeek🟢 Ouvert88,5 %25 décembre 2024Auto-déclaré
18Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert87,8 %29 avril 2025Auto-déclaré
19Kimi K2 BaseMoonshot AI🟢 Ouvert87,8 %11 juillet 2025Auto-déclaré
20Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert87,6 %22 septembre 2025Auto-déclaré
21GPT-4.1 miniOpenAI🔒 Propriétaire87,5 %14 avril 2025Auto-déclaré
22Grok-2xAI🔒 Propriétaire87,5 %13 août 2024Auto-déclaré
23Kimi-k1.5Moonshot AI🔒 Propriétaire87,4 %20 janvier 2025Auto-déclaré
24Llama 3.1 405B InstructMeta🟢 Ouvert87,3 %23 juillet 2024Auto-déclaré
25o3-miniOpenAI🔒 Propriétaire86,9 %30 janvier 2025Auto-déclaré
26Claude 3 OpusAnthropic🔒 Propriétaire86,8 %29 février 2024Auto-déclaré
27GPT-4 TurboOpenAI🔒 Propriétaire86,5 %9 avril 2024Auto-déclaré
28GPT-4OpenAI🔒 Propriétaire86,4 %28 août 2023Auto-déclaré
29Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert86,4 %22 septembre 2025Auto-déclaré
30Grok-2 minixAI🔒 Propriétaire86,2 %13 août 2024Auto-déclaré
31Llama 3.2 90B InstructMeta🟢 Ouvert86,0 %25 septembre 2024Auto-déclaré
32Llama 3.3 70B InstructMeta🟢 Ouvert86,0 %6 décembre 2024Auto-déclaré
33Gemini 1.5 ProGoogle🔒 Propriétaire85,9 %1 mai 2024Auto-déclaré
34Nova ProAmazon🔒 Propriétaire85,9 %20 novembre 2024Auto-déclaré
35GPT-4oOpenAI🔒 Propriétaire85,7 %27 mars 2025Auto-déclaré
36LongCat-Flash-LiteMeituan🟢 Ouvert85,5 %5 février 2026Auto-déclaré
37Llama 4 MaverickMeta🟢 Ouvert85,5 %5 avril 2025Auto-déclaré
38GPT OSS 20BOpenAI🟢 Ouvert85,3 %5 août 2025Auto-déclaré
39Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert85,2 %22 septembre 2025Auto-déclaré
40o1-miniOpenAI🔒 Propriétaire85,2 %12 septembre 2024Auto-déclaré
41Sarvam-30BSarvam AI🟢 Ouvert85,1 %6 mars 2026Auto-déclaré
42Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,0 %22 septembre 2025Auto-déclaré
43Phi 4Microsoft🟢 Ouvert84,8 %12 décembre 2024Auto-déclaré
44Mistral Large 2Mistral AI🟢 Ouvert84,0 %24 juillet 2024Auto-déclaré
45Llama 3.1 70B InstructMeta🟢 Ouvert83,6 %23 juillet 2024Auto-déclaré
46Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,3 %19 septembre 2024Auto-déclaré
47Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,3 %23 juillet 2024Auto-déclaré
48GPT-4o miniOpenAI🔒 Propriétaire82,0 %18 juillet 2024Auto-déclaré
49Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert81,5 %22 septembre 2025Auto-déclaré
50Grok-1.5xAI🔒 Propriétaire81,3 %28 mars 2024Auto-déclaré
51Jamba 1.5 LargeAI21 Labs🟢 Ouvert81,2 %22 août 2024Auto-déclaré
52Mistral Small 3.1 24B BaseMistral AI🟢 Ouvert81,0 %17 mars 2025Auto-déclaré
53Mistral Small 3 24B BaseMistral AI🟢 Ouvert80,7 %30 janvier 2025Auto-déclaré
54Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,7 %22 septembre 2025Auto-déclaré
55Mistral Small 3.1 24B InstructMistral AI🟢 Ouvert80,6 %17 mars 2025Auto-déclaré
56Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert80,5 %20 juin 2025Auto-déclaré
57Nova LiteAmazon🔒 Propriétaire80,5 %20 novembre 2024Auto-déclaré
58DeepSeek-V2.5DeepSeek🟢 Ouvert80,4 %8 mai 2024Auto-déclaré
59Llama 3.1 Nemotron 70B InstructNVIDIA🟢 Ouvert80,2 %1 octobre 2024Auto-déclaré
60GPT-4.1 nanoOpenAI🔒 Propriétaire80,1 %14 avril 2025Auto-déclaré
61Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert79,7 %19 septembre 2024Auto-déclaré
62Llama 4 ScoutMeta🟢 Ouvert79,6 %5 avril 2025Auto-déclaré
63Ministral 3 (14B Base 2512)Mistral AI🟢 Ouvert79,4 %4 décembre 2025Auto-déclaré
64Hermes 3 70BNous Research🟢 Ouvert79,1 %15 août 2024Auto-déclaré
65Claude 3 SonnetAnthropic🔒 Propriétaire79,0 %29 février 2024Auto-déclaré
66Gemini 1.5 FlashGoogle🔒 Propriétaire78,9 %1 mai 2024Auto-déclaré
67Phi-3.5-MoE-instructMicrosoft🟢 Ouvert78,9 %23 août 2024Auto-déclaré
68Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert78,4 %28 février 2025Auto-déclaré
69Nova MicroAmazon🔒 Propriétaire77,6 %20 novembre 2024Auto-déclaré
70Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,2 %22 septembre 2025Auto-déclaré
71Ministral 3 (8B Base 2512)Mistral AI🟢 Ouvert76,1 %4 décembre 2025Auto-déclaré
72Cohere: Command R (08-2024)Cohere🟢 Ouvert75,7 %30 août 2024Auto-déclaré
73Claude 3 HaikuAnthropic🔒 Propriétaire75,2 %13 mars 2024Auto-déclaré
74Gemma 2 27BGoogle🟢 Ouvert75,2 %27 juin 2024Auto-déclaré
75Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert75,1 %19 septembre 2024Auto-déclaré
76Llama 3.2 11B InstructMeta🟢 Ouvert73,0 %25 septembre 2024Auto-déclaré
77Gemini 1.0 ProGoogle🔒 Propriétaire71,8 %15 février 2024Auto-déclaré
78Gemma 2 9BGoogle🟢 Ouvert71,3 %27 juin 2024Auto-déclaré
79Ministral 3 (3B Base 2512)Mistral AI🟢 Ouvert70,7 %4 décembre 2025Auto-déclaré
80Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,5 %23 juillet 2024Auto-déclaré
81GPT-3.5 TurboOpenAI🔒 Propriétaire69,8 %21 mars 2023n.d.
82Jamba 1.5 MiniAI21 Labs🟢 Ouvert69,7 %22 août 2024Auto-déclaré
83Llama 3.1 8B InstructMeta🟢 Ouvert69,4 %23 juillet 2024Auto-déclaré
84Pixtral-12BMistral AI🟢 Ouvert69,2 %17 septembre 2024Auto-déclaré
85Phi-3.5-mini-instructMicrosoft🟢 Ouvert69,0 %23 août 2024Auto-déclaré
86Mistral NeMo InstructMistral AI🟢 Ouvert68,0 %18 juillet 2024Auto-déclaré
87Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,6 %19 septembre 2024Auto-déclaré
88Phi 4 MiniMicrosoft🟢 Ouvert67,3 %30 avril 2025Auto-déclaré
89Granite 3.3 8B InstructIBM🟢 Ouvert65,5 %16 avril 2025Auto-déclaré
90Ministral 8B InstructMistral AI🟢 Ouvert65,0 %16 octobre 2024Auto-déclaré
91Gemma 3n E4B InstructedGoogle🔒 Propriétaire64,9 %26 juin 2025Auto-déclaré
92Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert64,9 %20 mai 2025Auto-déclaré
93Granite 3.3 8B BaseIBM🟢 Ouvert63,9 %16 avril 2025Auto-déclaré
94Llama 3.2 3B InstructMeta🟢 Ouvert63,4 %25 septembre 2024Auto-déclaré
95IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert60,4 %2 mai 2025Auto-déclaré
96Gemma 3n E2B InstructedGoogle🔒 Propriétaire60,1 %26 juin 2025Auto-déclaré
97Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert60,1 %20 mai 2025Auto-déclaré
98ERNIE 4.5Baidu🔒 Propriétaire41,9 %25 juin 2025Auto-déclaré

Classement établi sur 98 modèles évalués, dont 62 de grands éditeurs. Score médian de l'ensemble : 81,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé à MMLU indique qu’un modèle répond correctement à une large proportion de questions couvrant des sujets divers. Il reflète donc une combinaison de compréhension linguistique, de restitution de connaissances et de raisonnement dans un cadre QCM. La portée reste toutefois circonscrite à ce format, à l’anglais et aux 57 sujets du jeu, sans résumer à elle seule toutes les capacités d’un modèle.

Dans la base, la médiane de 81 % et le meilleur résultat de 92 %, obtenu par GPT-5 d’OpenAI, montrent un niveau globalement élevé parmi les 98 modèles évalués. Ce resserrement vers le haut peut réduire le pouvoir discriminant du benchmark entre les systèmes les plus performants, ce qui constitue un effet de saturation. L’interprétation du classement exige aussi de la prudence sur le plan méthodologique, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le classement révèle néanmoins les écarts de réussite observés sur ce corpus multidomaine, dans les limites précises de son format et de sa couverture.


Sources des scores : llm-stats.