MMLU
MMLU, pour Massive Multitask Language Understanding, est un benchmark créé par D. Hendrycks et ses coauteurs en 2020. Il évalue les connaissances d’un modèle dans des domaines variés, notamment les sciences, les sciences humaines, les sciences sociales et les disciplines professionnelles.
MMLU, pour Massive Multitask Language Understanding, est un benchmark créé par D. Hendrycks et ses coauteurs en 2020. Il évalue les connaissances d’un modèle dans des domaines variés, notamment les sciences, les sciences humaines, les sciences sociales et les disciplines professionnelles.
À travers des questions à choix multiple en anglais, MMLU mesure conjointement la compréhension linguistique, les connaissances factuelles et spécialisées, ainsi que le raisonnement en contexte QCM. Il sert ainsi de référence transversale pour comparer les capacités générales des modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | D. Hendrycks et al. |
| Capacités mesurées | finance, généraliste, santé, langage, juridique, mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | environ 15 900 questions, dont 14 042 questions de test, couvrant 57 sujets |
| Année de publication | 2020 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (98)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 🔒 Propriétaire | 92,5 % | 7 août 2025 | Auto-déclaré |
| 2 | o1 | OpenAI | 🔒 Propriétaire | 91,8 % | 17 décembre 2024 | Auto-déclaré |
| 3 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 90,8 % | 5 mars 2026 | Auto-déclaré |
| 4 | o1-preview | OpenAI | 🔒 Propriétaire | 90,8 % | 12 septembre 2024 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,6 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 90,6 % | 6 mars 2026 | Auto-déclaré |
| 7 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 90,4 % | 22 octobre 2024 | Auto-déclaré |
| 8 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 90,2 % | 14 avril 2025 | Auto-déclaré |
| 9 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 90,2 % | 5 septembre 2025 | Auto-déclaré |
| 10 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 90,0 % | 5 août 2025 | Auto-déclaré |
| 11 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 89,7 % | 29 août 2025 | Auto-déclaré |
| 12 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 89,5 % | 11 juillet 2025 | Auto-déclaré |
| 13 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 89,5 % | 5 septembre 2025 | Auto-déclaré |
| 14 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 89,4 % | 27 avril 2026 | Auto-déclaré |
| 15 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,8 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,7 % | 22 septembre 2025 | Auto-déclaré |
| 17 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 88,5 % | 25 décembre 2024 | Auto-déclaré |
| 18 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,8 % | 29 avril 2025 | Auto-déclaré |
| 19 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 87,8 % | 11 juillet 2025 | Auto-déclaré |
| 20 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,6 % | 22 septembre 2025 | Auto-déclaré |
| 21 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 87,5 % | 14 avril 2025 | Auto-déclaré |
| 22 | Grok-2 | xAI | 🔒 Propriétaire | 87,5 % | 13 août 2024 | Auto-déclaré |
| 23 | Kimi-k1.5 | Moonshot AI | 🔒 Propriétaire | 87,4 % | 20 janvier 2025 | Auto-déclaré |
| 24 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 87,3 % | 23 juillet 2024 | Auto-déclaré |
| 25 | o3-mini | OpenAI | 🔒 Propriétaire | 86,9 % | 30 janvier 2025 | Auto-déclaré |
| 26 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 86,8 % | 29 février 2024 | Auto-déclaré |
| 27 | GPT-4 Turbo | OpenAI | 🔒 Propriétaire | 86,5 % | 9 avril 2024 | Auto-déclaré |
| 28 | GPT-4 | OpenAI | 🔒 Propriétaire | 86,4 % | 28 août 2023 | Auto-déclaré |
| 29 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,4 % | 22 septembre 2025 | Auto-déclaré |
| 30 | Grok-2 mini | xAI | 🔒 Propriétaire | 86,2 % | 13 août 2024 | Auto-déclaré |
| 31 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 86,0 % | 25 septembre 2024 | Auto-déclaré |
| 32 | Llama 3.3 70B Instruct | Meta | 🟢 Ouvert | 86,0 % | 6 décembre 2024 | Auto-déclaré |
| 33 | Gemini 1.5 Pro | 🔒 Propriétaire | 85,9 % | 1 mai 2024 | Auto-déclaré | |
| 34 | Nova Pro | Amazon | 🔒 Propriétaire | 85,9 % | 20 novembre 2024 | Auto-déclaré |
| 35 | GPT-4o | OpenAI | 🔒 Propriétaire | 85,7 % | 27 mars 2025 | Auto-déclaré |
| 36 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 85,5 % | 5 février 2026 | Auto-déclaré |
| 37 | Llama 4 Maverick | Meta | 🟢 Ouvert | 85,5 % | 5 avril 2025 | Auto-déclaré |
| 38 | GPT OSS 20B | OpenAI | 🟢 Ouvert | 85,3 % | 5 août 2025 | Auto-déclaré |
| 39 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,2 % | 22 septembre 2025 | Auto-déclaré |
| 40 | o1-mini | OpenAI | 🔒 Propriétaire | 85,2 % | 12 septembre 2024 | Auto-déclaré |
| 41 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 85,1 % | 6 mars 2026 | Auto-déclaré |
| 42 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,0 % | 22 septembre 2025 | Auto-déclaré |
| 43 | Phi 4 | Microsoft | 🟢 Ouvert | 84,8 % | 12 décembre 2024 | Auto-déclaré |
| 44 | Mistral Large 2 | Mistral AI | 🟢 Ouvert | 84,0 % | 24 juillet 2024 | Auto-déclaré |
| 45 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 83,6 % | 23 juillet 2024 | Auto-déclaré |
| 46 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,3 % | 19 septembre 2024 | Auto-déclaré |
| 47 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,3 % | 23 juillet 2024 | Auto-déclaré |
| 48 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 82,0 % | 18 juillet 2024 | Auto-déclaré |
| 49 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,5 % | 22 septembre 2025 | Auto-déclaré |
| 50 | Grok-1.5 | xAI | 🔒 Propriétaire | 81,3 % | 28 mars 2024 | Auto-déclaré |
| 51 | Jamba 1.5 Large | AI21 Labs | 🟢 Ouvert | 81,2 % | 22 août 2024 | Auto-déclaré |
| 52 | Mistral Small 3.1 24B Base | Mistral AI | 🟢 Ouvert | 81,0 % | 17 mars 2025 | Auto-déclaré |
| 53 | Mistral Small 3 24B Base | Mistral AI | 🟢 Ouvert | 80,7 % | 30 janvier 2025 | Auto-déclaré |
| 54 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,7 % | 22 septembre 2025 | Auto-déclaré |
| 55 | Mistral Small 3.1 24B Instruct | Mistral AI | 🟢 Ouvert | 80,6 % | 17 mars 2025 | Auto-déclaré |
| 56 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 80,5 % | 20 juin 2025 | Auto-déclaré |
| 57 | Nova Lite | Amazon | 🔒 Propriétaire | 80,5 % | 20 novembre 2024 | Auto-déclaré |
| 58 | DeepSeek-V2.5 | DeepSeek | 🟢 Ouvert | 80,4 % | 8 mai 2024 | Auto-déclaré |
| 59 | Llama 3.1 Nemotron 70B Instruct | NVIDIA | 🟢 Ouvert | 80,2 % | 1 octobre 2024 | Auto-déclaré |
| 60 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 80,1 % | 14 avril 2025 | Auto-déclaré |
| 61 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,7 % | 19 septembre 2024 | Auto-déclaré |
| 62 | Llama 4 Scout | Meta | 🟢 Ouvert | 79,6 % | 5 avril 2025 | Auto-déclaré |
| 63 | Ministral 3 (14B Base 2512) | Mistral AI | 🟢 Ouvert | 79,4 % | 4 décembre 2025 | Auto-déclaré |
| 64 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 79,1 % | 15 août 2024 | Auto-déclaré |
| 65 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 79,0 % | 29 février 2024 | Auto-déclaré |
| 66 | Gemini 1.5 Flash | 🔒 Propriétaire | 78,9 % | 1 mai 2024 | Auto-déclaré | |
| 67 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 78,9 % | 23 août 2024 | Auto-déclaré |
| 68 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,4 % | 28 février 2025 | Auto-déclaré |
| 69 | Nova Micro | Amazon | 🔒 Propriétaire | 77,6 % | 20 novembre 2024 | Auto-déclaré |
| 70 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,2 % | 22 septembre 2025 | Auto-déclaré |
| 71 | Ministral 3 (8B Base 2512) | Mistral AI | 🟢 Ouvert | 76,1 % | 4 décembre 2025 | Auto-déclaré |
| 72 | Cohere: Command R (08-2024) | Cohere | 🟢 Ouvert | 75,7 % | 30 août 2024 | Auto-déclaré |
| 73 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 75,2 % | 13 mars 2024 | Auto-déclaré |
| 74 | Gemma 2 27B | 🟢 Ouvert | 75,2 % | 27 juin 2024 | Auto-déclaré | |
| 75 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,1 % | 19 septembre 2024 | Auto-déclaré |
| 76 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 73,0 % | 25 septembre 2024 | Auto-déclaré |
| 77 | Gemini 1.0 Pro | 🔒 Propriétaire | 71,8 % | 15 février 2024 | Auto-déclaré | |
| 78 | Gemma 2 9B | 🟢 Ouvert | 71,3 % | 27 juin 2024 | Auto-déclaré | |
| 79 | Ministral 3 (3B Base 2512) | Mistral AI | 🟢 Ouvert | 70,7 % | 4 décembre 2025 | Auto-déclaré |
| 80 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,5 % | 23 juillet 2024 | Auto-déclaré |
| 81 | GPT-3.5 Turbo | OpenAI | 🔒 Propriétaire | 69,8 % | 21 mars 2023 | n.d. |
| 82 | Jamba 1.5 Mini | AI21 Labs | 🟢 Ouvert | 69,7 % | 22 août 2024 | Auto-déclaré |
| 83 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 69,4 % | 23 juillet 2024 | Auto-déclaré |
| 84 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 69,2 % | 17 septembre 2024 | Auto-déclaré |
| 85 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 69,0 % | 23 août 2024 | Auto-déclaré |
| 86 | Mistral NeMo Instruct | Mistral AI | 🟢 Ouvert | 68,0 % | 18 juillet 2024 | Auto-déclaré |
| 87 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,6 % | 19 septembre 2024 | Auto-déclaré |
| 88 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 67,3 % | 30 avril 2025 | Auto-déclaré |
| 89 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 65,5 % | 16 avril 2025 | Auto-déclaré |
| 90 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 65,0 % | 16 octobre 2024 | Auto-déclaré |
| 91 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 64,9 % | 26 juin 2025 | Auto-déclaré | |
| 92 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 64,9 % | 20 mai 2025 | Auto-déclaré | |
| 93 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 63,9 % | 16 avril 2025 | Auto-déclaré |
| 94 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 63,4 % | 25 septembre 2024 | Auto-déclaré |
| 95 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 60,4 % | 2 mai 2025 | Auto-déclaré |
| 96 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 60,1 % | 26 juin 2025 | Auto-déclaré | |
| 97 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 60,1 % | 20 mai 2025 | Auto-déclaré | |
| 98 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 41,9 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 98 modèles évalués, dont 62 de grands éditeurs. Score médian de l'ensemble : 81,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé à MMLU indique qu’un modèle répond correctement à une large proportion de questions couvrant des sujets divers. Il reflète donc une combinaison de compréhension linguistique, de restitution de connaissances et de raisonnement dans un cadre QCM. La portée reste toutefois circonscrite à ce format, à l’anglais et aux 57 sujets du jeu, sans résumer à elle seule toutes les capacités d’un modèle.
Dans la base, la médiane de 81 % et le meilleur résultat de 92 %, obtenu par GPT-5 d’OpenAI, montrent un niveau globalement élevé parmi les 98 modèles évalués. Ce resserrement vers le haut peut réduire le pouvoir discriminant du benchmark entre les systèmes les plus performants, ce qui constitue un effet de saturation. L’interprétation du classement exige aussi de la prudence sur le plan méthodologique, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le classement révèle néanmoins les écarts de réussite observés sur ce corpus multidomaine, dans les limites précises de son format et de sa couverture.
Sources des scores : llm-stats.