MMMU (val)
MMMU (val), créé par Xiang Yue et ses collaborateurs en 2023, est l’ensemble de validation du benchmark Massive Multi-discipline Multimodal Understanding and Reasoning. Il rassemble des questions de niveau universitaire associant du texte à différents supports visuels, notamment des…
MMMU (val), créé par Xiang Yue et ses collaborateurs en 2023, est l’ensemble de validation du benchmark Massive Multi-discipline Multimodal Understanding and Reasoning. Il rassemble des questions de niveau universitaire associant du texte à différents supports visuels, notamment des diagrammes, tableaux, cartes et graphiques.
Le benchmark mesure la compréhension multimodale et le raisonnement dans un large éventail de disciplines académiques. Ses QCM et questions ouvertes courtes servent à évaluer la capacité des modèles à interpréter conjointement plusieurs formes d’information pour produire une réponse correcte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Xiang Yue et al. |
| Capacités mesurées | généraliste, santé, multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM et questions ouvertes à réponse courte, avec énoncés multimodaux incluant des images, diagrammes, tableaux, cartes ou graphiques |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | CC-BY-NC-4.0 |
| Langues | anglais |
| Taille du jeu | 900 questions de validation; environ 11 500 questions au total |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,1 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,0 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,0 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,2 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,1 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,8 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,6 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,4 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Gemma 3 27B | 🟢 Ouvert | 64,9 % | 12 mars 2025 | Auto-déclaré | |
| 10 | Gemma 3 12B | 🟢 Ouvert | 59,6 % | 12 mars 2025 | Auto-déclaré | |
| 11 | Gemma 3 4B | 🟢 Ouvert | 48,8 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 11 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 70,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMMU (val) traduit une bonne aptitude à combiner compréhension visuelle, lecture d’énoncés et raisonnement universitaire dans les disciplines couvertes. La métrique d’accuracy mesure directement la proportion de réponses correctes, mais ne décrit pas séparément les performances selon les types d’images, les matières ou les formats de questions.
Dans la base, la médiane des 11 modèles atteint 71 %, tandis que Qwen3 VL 32B Thinking arrive en tête à 78 %. Cet écart de sept points montre un avantage du premier modèle, tout en indiquant un classement relativement resserré autour de scores déjà élevés. Le meilleur résultat reste toutefois éloigné d’une accuracy parfaite, ce qui ne correspond pas à une saturation complète du benchmark.
L’interprétation demande plusieurs précautions. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une rigueur moindre qu’une évaluation intégralement mesurée selon un protocole indépendant et uniforme. L’accès public aux questions crée aussi un risque de contamination. Enfin, les résultats portent sur 900 questions de validation, en anglais, et reflètent spécifiquement les disciplines universitaires, sujets et supports visuels couverts par MMMU.
Sources des scores : llm-stats.