MMMU (validation)
MMMU (validation), créé par Xiang Yue et al., est le jeu de validation d’un benchmark consacré à la compréhension et au raisonnement multimodaux de niveau universitaire. Il confronte les modèles à des questions associant texte et images dans un large éventail de disciplines.
MMMU (validation), créé par Xiang Yue et al., est le jeu de validation d’un benchmark consacré à la compréhension et au raisonnement multimodaux de niveau universitaire. Il confronte les modèles à des questions associant texte et images dans un large éventail de disciplines.
Les tâches mobilisent notamment l’interprétation de diagrammes, graphiques, tableaux, cartes et autres supports visuels. MMMU sert ainsi à évaluer la capacité d’un modèle à combiner plusieurs modalités, à comprendre un contexte spécialisé et à produire une réponse correcte, sous forme de QCM ou de réponse courte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Xiang Yue et al. |
| Capacités mesurées | généraliste, santé, multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM et questions ouvertes à réponse courte, avec contexte multimodal texte-image |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 900 questions pour le split validation ; environ 11 500 questions au total |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 80,7 % | 24 novembre 2025 | Auto-déclaré |
| 2 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 77,1 % | 5 août 2025 | Auto-déclaré |
| 3 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 76,5 % | 22 mai 2025 | Auto-déclaré |
| 4 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 73,2 % | 15 octobre 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 76,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMMU (validation) indique une forte capacité à exploiter conjointement des informations textuelles et visuelles dans des problèmes universitaires couvrant de nombreux domaines. L’accuracy mesure directement la proportion de réponses correctes, mais ne décrit pas séparément les performances selon les disciplines, les types d’images ou les formats de questions.
La lecture du classement appelle plusieurs précautions. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité du contrôle par rapport à une évaluation entièrement mesurée de manière indépendante. Le caractère public du benchmark crée aussi un risque de contamination, tandis que la taille limitée du split de validation peut rendre les résultats sensibles à un nombre restreint de réponses. Avec quatre modèles évalués, une médiane de 77 % et Claude Opus 4.5 en tête à 81 %, le classement montre des performances élevées et relativement rapprochées. Cette proximité peut réduire le pouvoir discriminant du benchmark à mesure que les modèles progressent, ce qui constitue un risque de saturation. Sa portée reste centrée sur des questions multimodales universitaires en anglais.
Sources des scores : llm-stats.