MMMU-Pro
MMMU-Pro est un benchmark public conçu en 2024 par l’équipe MMMU, notamment Xiang Yue et Tianyu Zheng. Il évalue la compréhension et le raisonnement multimodaux dans plusieurs disciplines, à partir de contenus combinant texte et image.
MMMU-Pro est un benchmark public conçu en 2024 par l’équipe MMMU, notamment Xiang Yue et Tianyu Zheng. Il évalue la compréhension et le raisonnement multimodaux dans plusieurs disciplines, à partir de contenus combinant texte et image.
Cette version renforce MMMU en écartant les questions pouvant être résolues uniquement par le texte, en augmentant les options proposées et en ajoutant un réglage vision-only, où la question figure dans l’image. Elle vise ainsi une évaluation plus exigeante, proche de scénarios réels, de la capacité des modèles à exploiter effectivement l’information visuelle.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Équipe MMMU (Xiang Yue, Tianyu Zheng et al.) |
| Capacités mesurées | Compréhension et raisonnement multimodaux multidisciplinaires (texte + image), y compris en entrée purement visuelle où la question est intégrée à l'image. |
| Modalité | Multimodal |
| Type de questions | QCM à options augmentées + réglage à entrée purement visuelle (vision-only) |
| Métrique d'évaluation | Exactitude |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | environ 1 730 questions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (64)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.5 Flash | 🔒 Propriétaire | 83,6 % | 19 mai 2026 | Auto-déclaré | |
| 2 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 83,2 % | 23 avril 2026 | Auto-déclaré |
| 3 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 83,0 % | 9 juillet 2026 | Auto-déclaré |
| 4 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 82,7 % | 24 juin 2026 | Auto-déclaré |
| 5 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 82,2 % | 24 juin 2026 | Auto-déclaré |
| 6 | Kimi K3 | Moonshot AI | ▫ n.d. | 81,6 % | 16 juillet 2026 | Auto-déclaré |
| 7 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 81,2 % | 5 mars 2026 | Auto-déclaré |
| 8 | Gemini 3 Flash | 🔒 Propriétaire | 81,2 % | 17 décembre 2025 | Auto-déclaré | |
| 9 | Gemini 3 Pro | 🔒 Propriétaire | 81,0 % | 18 novembre 2025 | Auto-déclaré | |
| 10 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 80,7 % | 9 juillet 2026 | Auto-déclaré |
| 11 | Gemini 3.1 Pro Preview | ▫ n.d. | 80,5 % | 19 février 2026 | Auto-déclaré | |
| 12 | Muse Spark | Meta | 🔒 Propriétaire | 80,4 % | 8 avril 2026 | Auto-déclaré |
| 13 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 80,1 % | 20 avril 2026 | Auto-déclaré |
| 14 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 79,5 % | 11 décembre 2025 | Auto-déclaré |
| 15 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 79,0 % | 31 mai 2026 | Auto-déclaré |
| 16 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 78,8 % | 31 mars 2026 | Auto-déclaré |
| 17 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 78,5 % | 27 janvier 2026 | Auto-déclaré |
| 18 | GPT-5 | OpenAI | 🔒 Propriétaire | 78,4 % | 7 août 2025 | Auto-déclaré |
| 19 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 78,4 % | 9 juillet 2026 | Auto-déclaré |
| 20 | MiniMax M3 | MiniMax | 🟢 Ouvert | 78,1 % | 1 juin 2026 | Auto-déclaré |
| 21 | MiMo-V2.5 | Xiaomi | 🟢 Ouvert | 77,9 % | 22 avril 2026 | Auto-déclaré |
| 22 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 77,3 % | 5 février 2026 | Auto-déclaré |
| 23 | Gemma 4 31B | 🟢 Ouvert | 76,9 % | 2 avril 2026 | Auto-déclaré | |
| 24 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,9 % | 24 février 2026 | Auto-déclaré |
| 25 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 76,8 % | 3 mars 2026 | Auto-déclaré | |
| 26 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 76,6 % | 17 mars 2026 | Auto-déclaré |
| 27 | o3 | OpenAI | 🔒 Propriétaire | 76,4 % | 16 avril 2025 | Auto-déclaré |
| 28 | GPT-5.5 Instant | OpenAI | 🔒 Propriétaire | 76,0 % | 5 mai 2026 | Auto-déclaré |
| 29 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,8 % | 21 avril 2026 | Auto-déclaré |
| 30 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 75,6 % | 17 février 2026 | Auto-déclaré |
| 31 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,3 % | 16 avril 2026 | Auto-déclaré |
| 32 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,1 % | 24 février 2026 | Auto-déclaré |
| 33 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,0 % | 24 février 2026 | Auto-déclaré |
| 34 | Gemma 4 26B-A4B | 🟢 Ouvert | 73,8 % | 2 avril 2026 | Auto-déclaré | |
| 35 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,3 % | 22 septembre 2025 | Auto-déclaré |
| 36 | Gemma 4 12B | 🟢 Ouvert | 69,1 % | 23 mai 2026 | Auto-déclaré | |
| 37 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,1 % | 22 septembre 2025 | Auto-déclaré |
| 38 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,1 % | 22 septembre 2025 | Auto-déclaré |
| 39 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 66,1 % | 17 mars 2026 | Auto-déclaré |
| 40 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,3 % | 22 septembre 2025 | Auto-déclaré |
| 41 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 63,5 % | 2 décembre 2025 | Auto-déclaré |
| 42 | Command A+ | Cohere | 🟢 Ouvert | 63,0 % | 20 mai 2026 | Auto-déclaré |
| 43 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,0 % | 22 septembre 2025 | Auto-déclaré |
| 44 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 61,8 % | 2 décembre 2025 | Auto-déclaré |
| 45 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 61,4 % | 2 décembre 2025 | Auto-déclaré |
| 46 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,4 % | 22 septembre 2025 | Auto-déclaré |
| 47 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,4 % | 22 septembre 2025 | Auto-déclaré |
| 48 | Mistral Small 4 | Mistral AI | 🟢 Ouvert | 60,0 % | 16 mars 2026 | Auto-déclaré |
| 49 | GPT-4o | OpenAI | 🔒 Propriétaire | 59,9 % | 27 mars 2025 | Auto-déclaré |
| 50 | Llama 4 Maverick | Meta | 🟢 Ouvert | 59,6 % | 5 avril 2025 | Auto-déclaré |
| 51 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,0 % | 22 septembre 2025 | Auto-déclaré |
| 52 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,9 % | 22 septembre 2025 | Auto-déclaré |
| 53 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 54,3 % | 10 juin 2026 | Auto-déclaré | |
| 54 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 53,2 % | 22 septembre 2025 | Auto-déclaré |
| 55 | Gemma 4 E4B | 🟢 Ouvert | 52,6 % | 2 avril 2026 | Auto-déclaré | |
| 56 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,1 % | 26 janvier 2025 | Auto-déclaré |
| 57 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,5 % | 28 février 2025 | Auto-déclaré |
| 58 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,2 % | 29 août 2024 | Auto-déclaré |
| 59 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 45,2 % | 25 septembre 2024 | Auto-déclaré |
| 60 | Gemma 4 E2B | 🟢 Ouvert | 44,2 % | 2 avril 2026 | Auto-déclaré | |
| 61 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 38,5 % | 1 février 2025 | Auto-déclaré |
| 62 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 38,3 % | 26 janvier 2025 | Auto-déclaré |
| 63 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 36,6 % | 27 mars 2025 | Auto-déclaré |
| 64 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 33,0 % | 25 septembre 2024 | Auto-déclaré |
Classement établi sur 64 modèles évalués, dont 34 de grands éditeurs. Score médian de l'ensemble : 75,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMMU-Pro indique qu’un modèle répond correctement à une forte proportion de QCM multidisciplinaires exigeant une compréhension conjointe du texte et de l’image, y compris lorsque toute l’entrée est visuelle. Le filtrage des questions résolubles par le texte seul, l’augmentation des options et le réglage vision-only rendent l’évaluation plus rigoureuse que MMMU. Dans la base, la médiane de 72 % et le meilleur score de 84 %, obtenu par Gemini 3.5 Flash, montrent une hiérarchie encore perceptible parmi 60 modèles, mais aussi un écart relativement resserré en tête, susceptible de réduire progressivement le pouvoir discriminant du benchmark si les scores continuent d’augmenter. L’interprétation du classement doit toutefois rester prudente, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. L’accès public crée également un risque de contamination lors de l’entraînement ou de l’optimisation. Enfin, sa portée reste centrée sur des QCM en anglais et sur les compétences multimodales multidisciplinaires ciblées par ses quelque 1 730 questions.
Sources des scores : llm-stats.