MMMU (validation)

MMMU (validation), créé par Xiang Yue et al., est le jeu de validation d’un benchmark consacré à la compréhension et au raisonnement multimodaux de niveau universitaire. Il confronte les modèles à des questions associant texte et images dans un large éventail de disciplines.

MMMU (validation), créé par Xiang Yue et al., est le jeu de validation d’un benchmark consacré à la compréhension et au raisonnement multimodaux de niveau universitaire. Il confronte les modèles à des questions associant texte et images dans un large éventail de disciplines.

Les tâches mobilisent notamment l’interprétation de diagrammes, graphiques, tableaux, cartes et autres supports visuels. MMMU sert ainsi à évaluer la capacité d’un modèle à combiner plusieurs modalités, à comprendre un contexte spécialisé et à produire une réponse correcte, sous forme de QCM ou de réponse courte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkXiang Yue et al.
Capacités mesuréesgénéraliste, santé, multimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM et questions ouvertes à réponse courte, avec contexte multimodal texte-image
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu900 questions pour le split validation ; environ 11 500 questions au total
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 4.5Anthropic🔒 Propriétaire80,7 %24 novembre 2025Auto-déclaré
2Claude Opus 4.1Anthropic🔒 Propriétaire77,1 %5 août 2025Auto-déclaré
3Claude Opus 4Anthropic🔒 Propriétaire76,5 %22 mai 2025Auto-déclaré
4Claude Haiku 4.5Anthropic🔒 Propriétaire73,2 %15 octobre 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 76,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMMU (validation) indique une forte capacité à exploiter conjointement des informations textuelles et visuelles dans des problèmes universitaires couvrant de nombreux domaines. L’accuracy mesure directement la proportion de réponses correctes, mais ne décrit pas séparément les performances selon les disciplines, les types d’images ou les formats de questions.

La lecture du classement appelle plusieurs précautions. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité du contrôle par rapport à une évaluation entièrement mesurée de manière indépendante. Le caractère public du benchmark crée aussi un risque de contamination, tandis que la taille limitée du split de validation peut rendre les résultats sensibles à un nombre restreint de réponses. Avec quatre modèles évalués, une médiane de 77 % et Claude Opus 4.5 en tête à 81 %, le classement montre des performances élevées et relativement rapprochées. Cette proximité peut réduire le pouvoir discriminant du benchmark à mesure que les modèles progressent, ce qui constitue un risque de saturation. Sa portée reste centrée sur des questions multimodales universitaires en anglais.


Sources des scores : llm-stats.