MMMU-Pro

MMMU-Pro est un benchmark public conçu en 2024 par l’équipe MMMU, notamment Xiang Yue et Tianyu Zheng. Il évalue la compréhension et le raisonnement multimodaux dans plusieurs disciplines, à partir de contenus combinant texte et image.

MMMU-Pro est un benchmark public conçu en 2024 par l’équipe MMMU, notamment Xiang Yue et Tianyu Zheng. Il évalue la compréhension et le raisonnement multimodaux dans plusieurs disciplines, à partir de contenus combinant texte et image.

Cette version renforce MMMU en écartant les questions pouvant être résolues uniquement par le texte, en augmentant les options proposées et en ajoutant un réglage vision-only, où la question figure dans l’image. Elle vise ainsi une évaluation plus exigeante, proche de scénarios réels, de la capacité des modèles à exploiter effectivement l’information visuelle.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkÉquipe MMMU (Xiang Yue, Tianyu Zheng et al.)
Capacités mesuréesCompréhension et raisonnement multimodaux multidisciplinaires (texte + image), y compris en entrée purement visuelle où la question est intégrée à l'image.
ModalitéMultimodal
Type de questionsQCM à options augmentées + réglage à entrée purement visuelle (vision-only)
Métrique d'évaluationExactitude
AccèsPublic
LanguesAnglais
Taille du jeuenviron 1 730 questions
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (64)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.5 FlashGoogle🔒 Propriétaire83,6 %19 mai 2026Auto-déclaré
2GPT-5.5OpenAI🔒 Propriétaire83,2 %23 avril 2026Auto-déclaré
3GPT-5.6 SolOpenAI🔒 Propriétaire83,0 %9 juillet 2026Auto-déclaré
4Seed 2.1 ProByteDance🔒 Propriétaire82,7 %24 juin 2026Auto-déclaré
5Seed 2.1 TurboByteDance🔒 Propriétaire82,2 %24 juin 2026Auto-déclaré
6Kimi K3Moonshot AI▫ n.d.81,6 %16 juillet 2026Auto-déclaré
7GPT-4.5OpenAI🔒 Propriétaire81,2 %5 mars 2026Auto-déclaré
8Gemini 3 FlashGoogle🔒 Propriétaire81,2 %17 décembre 2025Auto-déclaré
9Gemini 3 ProGoogle🔒 Propriétaire81,0 %18 novembre 2025Auto-déclaré
10GPT-5.6 TerraOpenAI🔒 Propriétaire80,7 %9 juillet 2026Auto-déclaré
11Gemini 3.1 Pro PreviewGoogle▫ n.d.80,5 %19 février 2026Auto-déclaré
12Muse SparkMeta🔒 Propriétaire80,4 %8 avril 2026Auto-déclaré
13Kimi K2.6Moonshot AI🟢 Ouvert80,1 %20 avril 2026Auto-déclaré
14GPT-5.2OpenAI🔒 Propriétaire79,5 %11 décembre 2025Auto-déclaré
15Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire79,0 %31 mai 2026Auto-déclaré
16Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire78,8 %31 mars 2026Auto-déclaré
17Kimi K2.5Moonshot AI🟢 Ouvert78,5 %27 janvier 2026Auto-déclaré
18GPT-5OpenAI🔒 Propriétaire78,4 %7 août 2025Auto-déclaré
19GPT-5.6 LunaOpenAI🔒 Propriétaire78,4 %9 juillet 2026Auto-déclaré
20MiniMax M3MiniMax🟢 Ouvert78,1 %1 juin 2026Auto-déclaré
21MiMo-V2.5Xiaomi🟢 Ouvert77,9 %22 avril 2026Auto-déclaré
22Claude Opus 4.6Anthropic🔒 Propriétaire77,3 %5 février 2026Auto-déclaré
23Gemma 4 31BGoogle🟢 Ouvert76,9 %2 avril 2026Auto-déclaré
24Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert76,9 %24 février 2026Auto-déclaré
25Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire76,8 %3 mars 2026Auto-déclaré
26GPT-5.4 miniOpenAI🔒 Propriétaire76,6 %17 mars 2026Auto-déclaré
27o3OpenAI🔒 Propriétaire76,4 %16 avril 2025Auto-déclaré
28GPT-5.5 InstantOpenAI🔒 Propriétaire76,0 %5 mai 2026Auto-déclaré
29Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert75,8 %21 avril 2026Auto-déclaré
30Claude Sonnet 4.6Anthropic🔒 Propriétaire75,6 %17 février 2026Auto-déclaré
31Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert75,3 %16 avril 2026Auto-déclaré
32Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert75,1 %24 février 2026Auto-déclaré
33Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert75,0 %24 février 2026Auto-déclaré
34Gemma 4 26B-A4BGoogle🟢 Ouvert73,8 %2 avril 2026Auto-déclaré
35Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert69,3 %22 septembre 2025Auto-déclaré
36Gemma 4 12BGoogle🟢 Ouvert69,1 %23 mai 2026Auto-déclaré
37Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert68,1 %22 septembre 2025Auto-déclaré
38Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert68,1 %22 septembre 2025Auto-déclaré
39GPT-5.4 nanoOpenAI🔒 Propriétaire66,1 %17 mars 2026Auto-déclaré
40Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert65,3 %22 septembre 2025Auto-déclaré
41Nova 2 ProAmazon🔒 Propriétaire63,5 %2 décembre 2025Auto-déclaré
42Command A+Cohere🟢 Ouvert63,0 %20 mai 2026Auto-déclaré
43Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert63,0 %22 septembre 2025Auto-déclaré
44Nova 2 LiteAmazon🔒 Propriétaire61,8 %2 décembre 2025Auto-déclaré
45Nova 2 OmniAmazon🔒 Propriétaire61,4 %2 décembre 2025Auto-déclaré
46Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert60,4 %22 septembre 2025Auto-déclaré
47Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert60,4 %22 septembre 2025Auto-déclaré
48Mistral Small 4Mistral AI🟢 Ouvert60,0 %16 mars 2026Auto-déclaré
49GPT-4oOpenAI🔒 Propriétaire59,9 %27 mars 2025Auto-déclaré
50Llama 4 MaverickMeta🟢 Ouvert59,6 %5 avril 2025Auto-déclaré
51Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert57,0 %22 septembre 2025Auto-déclaré
52Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert55,9 %22 septembre 2025Auto-déclaré
53DiffusionGemma 26B-A4BGoogle🟢 Ouvert54,3 %10 juin 2026Auto-déclaré
54Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert53,2 %22 septembre 2025Auto-déclaré
55Gemma 4 E4BGoogle🟢 Ouvert52,6 %2 avril 2026Auto-déclaré
56Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert51,1 %26 janvier 2025Auto-déclaré
57Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert49,5 %28 février 2025Auto-déclaré
58Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert46,2 %29 août 2024Auto-déclaré
59Llama 3.2 90B InstructMeta🟢 Ouvert45,2 %25 septembre 2024Auto-déclaré
60Gemma 4 E2BGoogle🟢 Ouvert44,2 %2 avril 2026Auto-déclaré
61Phi-4-multimodal-instructMicrosoft🟢 Ouvert38,5 %1 février 2025Auto-déclaré
62Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert38,3 %26 janvier 2025Auto-déclaré
63Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert36,6 %27 mars 2025Auto-déclaré
64Llama 3.2 11B InstructMeta🟢 Ouvert33,0 %25 septembre 2024Auto-déclaré

Classement établi sur 64 modèles évalués, dont 34 de grands éditeurs. Score médian de l'ensemble : 75,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMMU-Pro indique qu’un modèle répond correctement à une forte proportion de QCM multidisciplinaires exigeant une compréhension conjointe du texte et de l’image, y compris lorsque toute l’entrée est visuelle. Le filtrage des questions résolubles par le texte seul, l’augmentation des options et le réglage vision-only rendent l’évaluation plus rigoureuse que MMMU. Dans la base, la médiane de 72 % et le meilleur score de 84 %, obtenu par Gemini 3.5 Flash, montrent une hiérarchie encore perceptible parmi 60 modèles, mais aussi un écart relativement resserré en tête, susceptible de réduire progressivement le pouvoir discriminant du benchmark si les scores continuent d’augmenter. L’interprétation du classement doit toutefois rester prudente, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. L’accès public crée également un risque de contamination lors de l’entraînement ou de l’optimisation. Enfin, sa portée reste centrée sur des QCM en anglais et sur les compétences multimodales multidisciplinaires ciblées par ses quelque 1 730 questions.


Sources des scores : llm-stats.