MMMLU
MMMLU est un benchmark multilingue créé par OpenAI en 2024. Adapté de MMLU, il réunit des questions traduites professionnellement afin d’évaluer des modèles dans plusieurs langues et dans un large éventail de matières.
MMMLU est un benchmark multilingue créé par OpenAI en 2024. Adapté de MMLU, il réunit des questions traduites professionnellement afin d’évaluer des modèles dans plusieurs langues et dans un large éventail de matières.
Ses QCM mesurent conjointement la compréhension linguistique, les connaissances générales et spécialisées, ainsi que le raisonnement multitâche. MMMLU sert ainsi à comparer la capacité des modèles à mobiliser leurs acquis dans différents contextes linguistiques et disciplinaires.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | généraliste, langage, mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | multilingue (14 langues : arabe, bengali, allemand, espagnol, français, hindi, indonésien, italien, japonais, coréen, portugais, swahili, yoruba, chinois) |
| Taille du jeu | environ 15 908 questions par langue, soit environ 222 700 items traduits pour 14 langues |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (49)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 92,7 % | — | Auto-déclaré |
| 2 | Gemini 3.1 Pro Preview | ▫ n.d. | 92,6 % | 19 février 2026 | Auto-déclaré | |
| 3 | Gemini 3 Flash | 🔒 Propriétaire | 91,8 % | 17 décembre 2025 | Auto-déclaré | |
| 4 | Gemini 3 Pro | 🔒 Propriétaire | 91,8 % | 18 novembre 2025 | Auto-déclaré | |
| 5 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 91,5 % | 16 avril 2026 | Auto-déclaré |
| 6 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 91,1 % | 5 février 2026 | Auto-déclaré |
| 7 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 90,8 % | 24 novembre 2025 | Auto-déclaré |
| 8 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 90,3 % | 19 mai 2026 | Auto-déclaré |
| 9 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 89,6 % | 11 décembre 2025 | Auto-déclaré |
| 10 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 89,5 % | 5 août 2025 | Auto-déclaré |
| 11 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 89,5 % | 31 mars 2026 | Auto-déclaré |
| 12 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 89,3 % | 17 février 2026 | Auto-déclaré |
| 13 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 89,1 % | 29 septembre 2025 | Auto-déclaré |
| 14 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 89,0 % | 31 mai 2026 | Auto-déclaré |
| 15 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 88,9 % | 3 mars 2026 | Auto-déclaré | |
| 16 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 88,8 % | 22 mai 2025 | Auto-déclaré |
| 17 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,5 % | 16 février 2026 | Auto-déclaré |
| 18 | Gemma 4 31B | 🟢 Ouvert | 88,4 % | 2 avril 2026 | Auto-déclaré | |
| 19 | o1 | OpenAI | 🔒 Propriétaire | 87,7 % | 17 décembre 2024 | Auto-déclaré |
| 20 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 87,3 % | 14 avril 2025 | Auto-déclaré |
| 21 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,7 % | 29 avril 2025 | Auto-déclaré |
| 22 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,7 % | 24 février 2026 | Auto-déclaré |
| 23 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 86,5 % | 22 mai 2025 | Auto-déclaré |
| 24 | Gemma 4 26B-A4B | 🟢 Ouvert | 86,3 % | 2 avril 2026 | Auto-déclaré | |
| 25 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 86,1 % | 24 février 2025 | Auto-déclaré |
| 26 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,9 % | 24 février 2026 | Auto-déclaré |
| 27 | K-EXAONE-236B-A23B | LG AI Research | 🔒 Propriétaire | 85,7 % | 31 décembre 2025 | Auto-déclaré |
| 28 | Mistral Large 3 (675B Base) | Mistral AI | 🟢 Ouvert | 85,5 % | 4 décembre 2025 | Auto-déclaré |
| 29 | Mistral Large 3 (675B Instruct 2512 Eagle) | Mistral AI | 🟢 Ouvert | 85,5 % | 4 décembre 2025 | Auto-déclaré |
| 30 | Mistral Large 3 (675B Instruct 2512 NVFP4) | Mistral AI | 🟢 Ouvert | 85,5 % | 4 décembre 2025 | Auto-déclaré |
| 31 | Mistral Large 3 (675B Instruct 2512) | Mistral AI | 🟢 Ouvert | 85,5 % | 4 décembre 2025 | Auto-déclaré |
| 32 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,2 % | 24 février 2026 | Auto-déclaré |
| 33 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 85,1 % | 5 mars 2026 | Auto-déclaré |
| 34 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 83,8 % | 5 août 2025 | Auto-déclaré |
| 35 | Gemma 4 12B | 🟢 Ouvert | 83,4 % | 23 mai 2026 | Auto-déclaré | |
| 36 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 83,0 % | 15 octobre 2025 | Auto-déclaré |
| 37 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 81,5 % | 10 juin 2026 | Auto-déclaré | |
| 38 | GPT-4o | OpenAI | 🔒 Propriétaire | 81,4 % | 27 mars 2025 | Auto-déclaré |
| 39 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,2 % | 2 mars 2026 | Auto-déclaré |
| 40 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 78,5 % | 14 avril 2025 | Auto-déclaré |
| 41 | Gemma 4 E4B | 🟢 Ouvert | 76,6 % | 2 avril 2026 | Auto-déclaré | |
| 42 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,1 % | 2 mars 2026 | Auto-déclaré |
| 43 | Mistral Large 3 | Mistral AI | 🟢 Ouvert | 74,2 % | 1 septembre 2025 | Auto-déclaré |
| 44 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 69,9 % | 23 août 2024 | Auto-déclaré |
| 45 | Gemma 4 E2B | 🟢 Ouvert | 67,4 % | 2 avril 2026 | Auto-déclaré | |
| 46 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 66,9 % | 14 avril 2025 | Auto-déclaré |
| 47 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,1 % | 2 mars 2026 | Auto-déclaré |
| 48 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 55,4 % | 23 août 2024 | Auto-déclaré |
| 49 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,3 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 49 modèles évalués, dont 36 de grands éditeurs. Score médian de l'ensemble : 86,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMMLU indique qu’un modèle répond correctement à une forte proportion de QCM couvrant 57 sujets et plusieurs langues. Il traduit donc une bonne performance combinée en compréhension, en connaissances et en raisonnement multitâche, dans le cadre précis de questions à choix multiple. Le niveau médian de 86 % parmi les 49 modèles de la base, avec Claude Mythos Preview en tête à 93 %, révèle des performances globalement élevées et des écarts relativement resserrés au sommet. Cette proximité peut signaler une saturation partielle du benchmark, qui devient alors moins discriminant entre les meilleurs modèles. L’interprétation du classement exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun. Le caractère public du jeu crée par ailleurs un risque de contamination des données d’entraînement. Enfin, MMMLU évalue une portée définie par ses traductions, ses 57 matières et son format QCM, sans résumer à lui seul l’ensemble des capacités d’un modèle.
Sources des scores : llm-stats.