MMMLU

MMMLU est un benchmark multilingue créé par OpenAI en 2024. Adapté de MMLU, il réunit des questions traduites professionnellement afin d’évaluer des modèles dans plusieurs langues et dans un large éventail de matières.

MMMLU est un benchmark multilingue créé par OpenAI en 2024. Adapté de MMLU, il réunit des questions traduites professionnellement afin d’évaluer des modèles dans plusieurs langues et dans un large éventail de matières.

Ses QCM mesurent conjointement la compréhension linguistique, les connaissances générales et spécialisées, ainsi que le raisonnement multitâche. MMMLU sert ainsi à comparer la capacité des modèles à mobiliser leurs acquis dans différents contextes linguistiques et disciplinaires.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesgénéraliste, langage, mathématiques, raisonnement
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
Languesmultilingue (14 langues : arabe, bengali, allemand, espagnol, français, hindi, indonésien, italien, japonais, coréen, portugais, swahili, yoruba, chinois)
Taille du jeuenviron 15 908 questions par langue, soit environ 222 700 items traduits pour 14 langues
Année de publication2024
RessourcesSite / dépôt officiel

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (49)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Mythos PreviewAnthropic🔒 Propriétaire92,7 %Auto-déclaré
2Gemini 3.1 Pro PreviewGoogle▫ n.d.92,6 %19 février 2026Auto-déclaré
3Gemini 3 FlashGoogle🔒 Propriétaire91,8 %17 décembre 2025Auto-déclaré
4Gemini 3 ProGoogle🔒 Propriétaire91,8 %18 novembre 2025Auto-déclaré
5Claude Opus 4.7Anthropic🔒 Propriétaire91,5 %16 avril 2026Auto-déclaré
6Claude Opus 4.6Anthropic🔒 Propriétaire91,1 %5 février 2026Auto-déclaré
7Claude Opus 4.5Anthropic🔒 Propriétaire90,8 %24 novembre 2025Auto-déclaré
8Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire90,3 %19 mai 2026Auto-déclaré
9GPT-5.2OpenAI🔒 Propriétaire89,6 %11 décembre 2025Auto-déclaré
10Claude Opus 4.1Anthropic🔒 Propriétaire89,5 %5 août 2025Auto-déclaré
11Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire89,5 %31 mars 2026Auto-déclaré
12Claude Sonnet 4.6Anthropic🔒 Propriétaire89,3 %17 février 2026Auto-déclaré
13Claude Sonnet 4.5Anthropic🔒 Propriétaire89,1 %29 septembre 2025Auto-déclaré
14Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire89,0 %31 mai 2026Auto-déclaré
15Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire88,9 %3 mars 2026Auto-déclaré
16Claude Opus 4Anthropic🔒 Propriétaire88,8 %22 mai 2025Auto-déclaré
17Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert88,5 %16 février 2026Auto-déclaré
18Gemma 4 31BGoogle🟢 Ouvert88,4 %2 avril 2026Auto-déclaré
19o1OpenAI🔒 Propriétaire87,7 %17 décembre 2024Auto-déclaré
20GPT-4.1OpenAI🔒 Propriétaire87,3 %14 avril 2025Auto-déclaré
21Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert86,7 %29 avril 2025Auto-déclaré
22Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert86,7 %24 février 2026Auto-déclaré
23Claude Sonnet 4Anthropic🔒 Propriétaire86,5 %22 mai 2025Auto-déclaré
24Gemma 4 26B-A4BGoogle🟢 Ouvert86,3 %2 avril 2026Auto-déclaré
25Claude 3.7 SonnetAnthropic🔒 Propriétaire86,1 %24 février 2025Auto-déclaré
26Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert85,9 %24 février 2026Auto-déclaré
27K-EXAONE-236B-A23BLG AI Research🔒 Propriétaire85,7 %31 décembre 2025Auto-déclaré
28Mistral Large 3 (675B Base)Mistral AI🟢 Ouvert85,5 %4 décembre 2025Auto-déclaré
29Mistral Large 3 (675B Instruct 2512 Eagle)Mistral AI🟢 Ouvert85,5 %4 décembre 2025Auto-déclaré
30Mistral Large 3 (675B Instruct 2512 NVFP4)Mistral AI🟢 Ouvert85,5 %4 décembre 2025Auto-déclaré
31Mistral Large 3 (675B Instruct 2512)Mistral AI🟢 Ouvert85,5 %4 décembre 2025Auto-déclaré
32Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert85,2 %24 février 2026Auto-déclaré
33GPT-4.5OpenAI🔒 Propriétaire85,1 %5 mars 2026Auto-déclaré
34GPT OSS 120BOpenAI🟢 Ouvert83,8 %5 août 2025Auto-déclaré
35Gemma 4 12BGoogle🟢 Ouvert83,4 %23 mai 2026Auto-déclaré
36Claude Haiku 4.5Anthropic🔒 Propriétaire83,0 %15 octobre 2025Auto-déclaré
37DiffusionGemma 26B-A4BGoogle🟢 Ouvert81,5 %10 juin 2026Auto-déclaré
38GPT-4oOpenAI🔒 Propriétaire81,4 %27 mars 2025Auto-déclaré
39Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert81,2 %2 mars 2026Auto-déclaré
40GPT-4.1 miniOpenAI🔒 Propriétaire78,5 %14 avril 2025Auto-déclaré
41Gemma 4 E4BGoogle🟢 Ouvert76,6 %2 avril 2026Auto-déclaré
42Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert76,1 %2 mars 2026Auto-déclaré
43Mistral Large 3Mistral AI🟢 Ouvert74,2 %1 septembre 2025Auto-déclaré
44Phi-3.5-MoE-instructMicrosoft🟢 Ouvert69,9 %23 août 2024Auto-déclaré
45Gemma 4 E2BGoogle🟢 Ouvert67,4 %2 avril 2026Auto-déclaré
46GPT-4.1 nanoOpenAI🔒 Propriétaire66,9 %14 avril 2025Auto-déclaré
47Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert63,1 %2 mars 2026Auto-déclaré
48Phi-3.5-mini-instructMicrosoft🟢 Ouvert55,4 %23 août 2024Auto-déclaré
49Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert44,3 %2 mars 2026Auto-déclaré

Classement établi sur 49 modèles évalués, dont 36 de grands éditeurs. Score médian de l'ensemble : 86,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMMLU indique qu’un modèle répond correctement à une forte proportion de QCM couvrant 57 sujets et plusieurs langues. Il traduit donc une bonne performance combinée en compréhension, en connaissances et en raisonnement multitâche, dans le cadre précis de questions à choix multiple. Le niveau médian de 86 % parmi les 49 modèles de la base, avec Claude Mythos Preview en tête à 93 %, révèle des performances globalement élevées et des écarts relativement resserrés au sommet. Cette proximité peut signaler une saturation partielle du benchmark, qui devient alors moins discriminant entre les meilleurs modèles. L’interprétation du classement exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun. Le caractère public du jeu crée par ailleurs un risque de contamination des données d’entraînement. Enfin, MMMLU évalue une portée définie par ses traductions, ses 57 matières et son format QCM, sans résumer à lui seul l’ensemble des capacités d’un modèle.


Sources des scores : llm-stats.