MMMU

Créé par Xiang Yue et ses coauteurs en 2023, MMMU, pour Massive Multi-discipline Multimodal Understanding, est un benchmark consacré à l’évaluation de modèles multimodaux sur des contenus de niveau universitaire.

Créé par Xiang Yue et ses coauteurs en 2023, MMMU, pour Massive Multi-discipline Multimodal Understanding, est un benchmark consacré à l’évaluation de modèles multimodaux sur des contenus de niveau universitaire.

Ses questions associent texte et images afin de mesurer simultanément la compréhension multimodale, les connaissances dans de nombreuses disciplines et le raisonnement délibéré. Issues d’examens, de quiz et de manuels, elles couvrent notamment les sciences, la santé, les sciences humaines, le commerce, les arts et l’ingénierie. MMMU sert ainsi à comparer la capacité des modèles à mobiliser plusieurs formes d’information dans des contextes académiques variés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkXiang Yue et al.
Capacités mesuréesgénéraliste, santé, multimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM et questions ouvertes à réponse courte, avec entrées multimodales texte-image
Métrique d'évaluationaccuracy
Languesanglais
Taille du jeuenviron 11 500 questions
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (61)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire86,0 %31 mars 2026Auto-déclaré
2GPT-5.1OpenAI🔒 Propriétaire85,4 %13 novembre 2025Auto-déclaré
3GPT-5.1 InstantOpenAI🔒 Propriétaire85,4 %12 novembre 2025Auto-déclaré
4GPT-5OpenAI🔒 Propriétaire84,2 %7 août 2025Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %24 février 2026Auto-déclaré
6Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert82,9 %21 avril 2026Auto-déclaré
7o3OpenAI🔒 Propriétaire82,9 %16 avril 2025Auto-déclaré
8Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert82,3 %24 février 2026Auto-déclaré
9Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire82,0 %5 juin 2025Auto-déclaré
10Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert81,7 %16 avril 2026Auto-déclaré
11o4-miniOpenAI🔒 Propriétaire81,6 %16 avril 2025Auto-déclaré
12Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert81,4 %24 février 2026Auto-déclaré
13Gemini 2.5 FlashGoogle🔒 Propriétaire79,7 %20 mai 2025Auto-déclaré
14Gemini 2.5 ProGoogle🔒 Propriétaire79,6 %20 mai 2025Auto-déclaré
15Step3-VL-10BStepFun🟢 Ouvert78,1 %15 janvier 2026Auto-déclaré
16Grok-3xAI🔒 Propriétaire78,0 %17 février 2025Auto-déclaré
17o1OpenAI🔒 Propriétaire77,6 %17 décembre 2024Auto-déclaré
18GPT-4.5OpenAI🔒 Propriétaire75,2 %5 mars 2026Auto-déclaré
19Command A+Cohere🟢 Ouvert75,1 %20 mai 2026Auto-déclaré
20Claude 3.7 SonnetAnthropic🔒 Propriétaire75,0 %24 février 2025Auto-déclaré
21GPT-4.1OpenAI🔒 Propriétaire74,8 %14 avril 2025Auto-déclaré
22Claude Sonnet 4Anthropic🔒 Propriétaire74,4 %22 mai 2025Auto-déclaré
23Llama 4 MaverickMeta🟢 Ouvert73,4 %5 avril 2025Auto-déclaré
24Gemini 2.5 Flash-LiteGoogle🟢 Ouvert72,9 %17 juin 2025Auto-déclaré
25GPT-4.1 miniOpenAI🔒 Propriétaire72,7 %14 avril 2025Auto-déclaré
26GPT-4oOpenAI🔒 Propriétaire72,2 %27 mars 2025Auto-déclaré
27Gemini 2.0 FlashGoogle🔒 Propriétaire70,7 %21 janvier 2025Auto-déclaré
28QvQ-72B-PreviewAlibaba Cloud / Qwen Team🟢 Ouvert70,3 %25 décembre 2024Auto-déclaré
29Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,2 %26 janvier 2025Auto-déclaré
30Kimi-k1.5Moonshot AI🔒 Propriétaire70,0 %20 janvier 2025Auto-déclaré
31Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,0 %28 février 2025Auto-déclaré
32Llama 4 ScoutMeta🟢 Ouvert69,4 %5 avril 2025Auto-déclaré
33Claude 3.5 SonnetAnthropic🔒 Propriétaire68,3 %22 octobre 2024Auto-déclaré
34Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire68,0 %5 février 2025Auto-déclaré
35Grok-2xAI🔒 Propriétaire66,1 %13 août 2024Auto-déclaré
36Gemini 1.5 ProGoogle🔒 Propriétaire65,9 %1 mai 2024Auto-déclaré
37Pixtral LargeMistral AI🟢 Ouvert64,0 %18 novembre 2024Auto-déclaré
38Grok-2 minixAI🔒 Propriétaire63,2 %13 août 2024Auto-déclaré
39Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert62,5 %20 juin 2025Auto-déclaré
40Gemini 1.5 FlashGoogle🔒 Propriétaire62,3 %1 mai 2024Auto-déclaré
41Nova ProAmazon🔒 Propriétaire61,7 %20 novembre 2024Auto-déclaré
42Llama 3.2 90B InstructMeta🟢 Ouvert60,3 %25 septembre 2024Auto-déclaré
43GPT-4o miniOpenAI🔒 Propriétaire59,4 %18 juillet 2024Auto-déclaré
44Mistral Small 3.1 24B BaseMistral AI🟢 Ouvert59,3 %17 mars 2025Auto-déclaré
45Mistral Small 3.1 24B InstructMistral AI🟢 Ouvert59,3 %17 mars 2025Auto-déclaré
46Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert59,2 %27 mars 2025Auto-déclaré
47Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert58,6 %26 janvier 2025Auto-déclaré
48Nova LiteAmazon🔒 Propriétaire56,2 %20 novembre 2024Auto-déclaré
49GPT-4.1 nanoOpenAI🔒 Propriétaire55,4 %14 avril 2025Auto-déclaré
50Phi-4-multimodal-instructMicrosoft🟢 Ouvert55,1 %1 février 2025Auto-déclaré
51Gemini 1.5 Flash 8BGoogle🔒 Propriétaire53,7 %15 mars 2024Auto-déclaré
52Grok-1.5xAI🔒 Propriétaire53,6 %28 mars 2024Auto-déclaré
53Grok-1.5VxAI🔒 Propriétaire53,6 %12 avril 2024Auto-déclaré
54Pixtral-12BMistral AI🟢 Ouvert52,5 %17 septembre 2024Auto-déclaré
55DeepSeek VL2DeepSeek🟢 Ouvert51,1 %13 décembre 2024Auto-déclaré
56Llama 3.2 11B InstructMeta🟢 Ouvert50,7 %25 septembre 2024Auto-déclaré
57DeepSeek VL2 SmallDeepSeek🟢 Ouvert48,0 %13 décembre 2024Auto-déclaré
58Gemini 1.0 ProGoogle🔒 Propriétaire47,9 %15 février 2024n.d.
59Phi-3.5-vision-instructMicrosoft🟢 Ouvert43,0 %23 août 2024Auto-déclaré
60DeepSeek VL2 TinyDeepSeek🟢 Ouvert40,7 %13 décembre 2024Auto-déclaré
61GPT-3.5 TurboOpenAI🔒 Propriétaire0,0 %21 mars 2023n.d.

Classement établi sur 61 modèles évalués, dont 47 de grands éditeurs. Score médian de l'ensemble : 70,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMMU indique qu’un modèle fournit fréquemment la réponse attendue à des QCM et à des questions ouvertes courtes combinant texte et image. Il reflète donc une performance conjointe en perception multimodale, connaissances universitaires et raisonnement, sans isoler la contribution de chacune de ces capacités. Le classement de 61 modèles montre une dispersion notable entre une médiane de 70 % et le meilleur résultat, 86 % pour Qwen3.6 Plus. Cet écart signale une avance du premier modèle, mais aussi une marge avant une éventuelle saturation du benchmark.

La comparaison demande toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. La provenance des questions, tirées d’examens, de quiz et de manuels, fait également de la contamination des données d’entraînement un point de vigilance. Enfin, la portée du résultat reste celle de MMMU : des contenus en anglais, de niveau universitaire, répartis entre six grandes disciplines. L’accuracy résume la réussite globale, mais ne détaille pas les écarts entre matières, formats de questions ou types de raisonnement.


Sources des scores : llm-stats.