MMMU
Créé par Xiang Yue et ses coauteurs en 2023, MMMU, pour Massive Multi-discipline Multimodal Understanding, est un benchmark consacré à l’évaluation de modèles multimodaux sur des contenus de niveau universitaire.
Créé par Xiang Yue et ses coauteurs en 2023, MMMU, pour Massive Multi-discipline Multimodal Understanding, est un benchmark consacré à l’évaluation de modèles multimodaux sur des contenus de niveau universitaire.
Ses questions associent texte et images afin de mesurer simultanément la compréhension multimodale, les connaissances dans de nombreuses disciplines et le raisonnement délibéré. Issues d’examens, de quiz et de manuels, elles couvrent notamment les sciences, la santé, les sciences humaines, le commerce, les arts et l’ingénierie. MMMU sert ainsi à comparer la capacité des modèles à mobiliser plusieurs formes d’information dans des contextes académiques variés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Xiang Yue et al. |
| Capacités mesurées | généraliste, santé, multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM et questions ouvertes à réponse courte, avec entrées multimodales texte-image |
| Métrique d'évaluation | accuracy |
| Langues | anglais |
| Taille du jeu | environ 11 500 questions |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (61)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 86,0 % | 31 mars 2026 | Auto-déclaré |
| 2 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 85,4 % | 13 novembre 2025 | Auto-déclaré |
| 3 | GPT-5.1 Instant | OpenAI | 🔒 Propriétaire | 85,4 % | 12 novembre 2025 | Auto-déclaré |
| 4 | GPT-5 | OpenAI | 🔒 Propriétaire | 84,2 % | 7 août 2025 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,9 % | 21 avril 2026 | Auto-déclaré |
| 7 | o3 | OpenAI | 🔒 Propriétaire | 82,9 % | 16 avril 2025 | Auto-déclaré |
| 8 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,3 % | 24 février 2026 | Auto-déclaré |
| 9 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 82,0 % | 5 juin 2025 | Auto-déclaré | |
| 10 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,7 % | 16 avril 2026 | Auto-déclaré |
| 11 | o4-mini | OpenAI | 🔒 Propriétaire | 81,6 % | 16 avril 2025 | Auto-déclaré |
| 12 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,4 % | 24 février 2026 | Auto-déclaré |
| 13 | Gemini 2.5 Flash | 🔒 Propriétaire | 79,7 % | 20 mai 2025 | Auto-déclaré | |
| 14 | Gemini 2.5 Pro | 🔒 Propriétaire | 79,6 % | 20 mai 2025 | Auto-déclaré | |
| 15 | Step3-VL-10B | StepFun | 🟢 Ouvert | 78,1 % | 15 janvier 2026 | Auto-déclaré |
| 16 | Grok-3 | xAI | 🔒 Propriétaire | 78,0 % | 17 février 2025 | Auto-déclaré |
| 17 | o1 | OpenAI | 🔒 Propriétaire | 77,6 % | 17 décembre 2024 | Auto-déclaré |
| 18 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 75,2 % | 5 mars 2026 | Auto-déclaré |
| 19 | Command A+ | Cohere | 🟢 Ouvert | 75,1 % | 20 mai 2026 | Auto-déclaré |
| 20 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 75,0 % | 24 février 2025 | Auto-déclaré |
| 21 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 74,8 % | 14 avril 2025 | Auto-déclaré |
| 22 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 74,4 % | 22 mai 2025 | Auto-déclaré |
| 23 | Llama 4 Maverick | Meta | 🟢 Ouvert | 73,4 % | 5 avril 2025 | Auto-déclaré |
| 24 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 72,9 % | 17 juin 2025 | Auto-déclaré | |
| 25 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 72,7 % | 14 avril 2025 | Auto-déclaré |
| 26 | GPT-4o | OpenAI | 🔒 Propriétaire | 72,2 % | 27 mars 2025 | Auto-déclaré |
| 27 | Gemini 2.0 Flash | 🔒 Propriétaire | 70,7 % | 21 janvier 2025 | Auto-déclaré | |
| 28 | QvQ-72B-Preview | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,3 % | 25 décembre 2024 | Auto-déclaré |
| 29 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,2 % | 26 janvier 2025 | Auto-déclaré |
| 30 | Kimi-k1.5 | Moonshot AI | 🔒 Propriétaire | 70,0 % | 20 janvier 2025 | Auto-déclaré |
| 31 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,0 % | 28 février 2025 | Auto-déclaré |
| 32 | Llama 4 Scout | Meta | 🟢 Ouvert | 69,4 % | 5 avril 2025 | Auto-déclaré |
| 33 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 68,3 % | 22 octobre 2024 | Auto-déclaré |
| 34 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 68,0 % | 5 février 2025 | Auto-déclaré | |
| 35 | Grok-2 | xAI | 🔒 Propriétaire | 66,1 % | 13 août 2024 | Auto-déclaré |
| 36 | Gemini 1.5 Pro | 🔒 Propriétaire | 65,9 % | 1 mai 2024 | Auto-déclaré | |
| 37 | Pixtral Large | Mistral AI | 🟢 Ouvert | 64,0 % | 18 novembre 2024 | Auto-déclaré |
| 38 | Grok-2 mini | xAI | 🔒 Propriétaire | 63,2 % | 13 août 2024 | Auto-déclaré |
| 39 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 62,5 % | 20 juin 2025 | Auto-déclaré |
| 40 | Gemini 1.5 Flash | 🔒 Propriétaire | 62,3 % | 1 mai 2024 | Auto-déclaré | |
| 41 | Nova Pro | Amazon | 🔒 Propriétaire | 61,7 % | 20 novembre 2024 | Auto-déclaré |
| 42 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 60,3 % | 25 septembre 2024 | Auto-déclaré |
| 43 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 59,4 % | 18 juillet 2024 | Auto-déclaré |
| 44 | Mistral Small 3.1 24B Base | Mistral AI | 🟢 Ouvert | 59,3 % | 17 mars 2025 | Auto-déclaré |
| 45 | Mistral Small 3.1 24B Instruct | Mistral AI | 🟢 Ouvert | 59,3 % | 17 mars 2025 | Auto-déclaré |
| 46 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,2 % | 27 mars 2025 | Auto-déclaré |
| 47 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,6 % | 26 janvier 2025 | Auto-déclaré |
| 48 | Nova Lite | Amazon | 🔒 Propriétaire | 56,2 % | 20 novembre 2024 | Auto-déclaré |
| 49 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 55,4 % | 14 avril 2025 | Auto-déclaré |
| 50 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 55,1 % | 1 février 2025 | Auto-déclaré |
| 51 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 53,7 % | 15 mars 2024 | Auto-déclaré | |
| 52 | Grok-1.5 | xAI | 🔒 Propriétaire | 53,6 % | 28 mars 2024 | Auto-déclaré |
| 53 | Grok-1.5V | xAI | 🔒 Propriétaire | 53,6 % | 12 avril 2024 | Auto-déclaré |
| 54 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 52,5 % | 17 septembre 2024 | Auto-déclaré |
| 55 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 51,1 % | 13 décembre 2024 | Auto-déclaré |
| 56 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 50,7 % | 25 septembre 2024 | Auto-déclaré |
| 57 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 48,0 % | 13 décembre 2024 | Auto-déclaré |
| 58 | Gemini 1.0 Pro | 🔒 Propriétaire | 47,9 % | 15 février 2024 | n.d. | |
| 59 | Phi-3.5-vision-instruct | Microsoft | 🟢 Ouvert | 43,0 % | 23 août 2024 | Auto-déclaré |
| 60 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 40,7 % | 13 décembre 2024 | Auto-déclaré |
| 61 | GPT-3.5 Turbo | OpenAI | 🔒 Propriétaire | 0,0 % | 21 mars 2023 | n.d. |
Classement établi sur 61 modèles évalués, dont 47 de grands éditeurs. Score médian de l'ensemble : 70,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMMU indique qu’un modèle fournit fréquemment la réponse attendue à des QCM et à des questions ouvertes courtes combinant texte et image. Il reflète donc une performance conjointe en perception multimodale, connaissances universitaires et raisonnement, sans isoler la contribution de chacune de ces capacités. Le classement de 61 modèles montre une dispersion notable entre une médiane de 70 % et le meilleur résultat, 86 % pour Qwen3.6 Plus. Cet écart signale une avance du premier modèle, mais aussi une marge avant une éventuelle saturation du benchmark.
La comparaison demande toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. La provenance des questions, tirées d’examens, de quiz et de manuels, fait également de la contamination des données d’entraînement un point de vigilance. Enfin, la portée du résultat reste celle de MMMU : des contenus en anglais, de niveau universitaire, répartis entre six grandes disciplines. L’accuracy résume la réussite globale, mais ne détaille pas les écarts entre matières, formats de questions ou types de raisonnement.
Sources des scores : llm-stats.