MMMUval

MMMUval est le jeu de validation du benchmark MMMU, créé par Xiang Yue et ses coauteurs en 2023. Il évalue la compréhension multimodale et le raisonnement délibéré à partir de problèmes de niveau universitaire, combinant questions à choix multiple, réponses courtes et entrées multimodales.

MMMUval est le jeu de validation du benchmark MMMU, créé par Xiang Yue et ses coauteurs en 2023. Il évalue la compréhension multimodale et le raisonnement délibéré à partir de problèmes de niveau universitaire, combinant questions à choix multiple, réponses courtes et entrées multimodales.

Sa couverture s’étend notamment aux arts, au commerce, aux sciences, à la santé, aux sciences humaines et sociales, ainsi qu’à l’ingénierie. MMMUval sert ainsi à comparer la capacité des modèles multimodaux à mobiliser des connaissances disciplinaires et à raisonner sur des contenus variés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkXiang Yue et al.
Capacités mesuréesgénéraliste, santé, multimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM et questions ouvertes à réponse courte, avec entrées multimodales
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu900 questions de validation
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1Qwen3 VL 235B A22B ThinkingQwen80,6 %22 septembre 2025Auto-déclaré
2Qwen3 VL 235B A22B InstructQwen78,7 %22 septembre 2025Auto-déclaré
3Claude Sonnet 4.5Anthropic77,8 %29 septembre 2025Auto-déclaré
4Qwen2-VL-72B-InstructQwen64,5 %29 août 2024Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 78,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMMUval indique qu’un modèle fournit fréquemment la réponse attendue face à des problèmes universitaires multimodaux exigeant connaissances et raisonnement délibéré. L’accuracy agrège toutefois des formats différents et ne décrit pas séparément les performances selon les disciplines ou le type de question. Dans la base, Qwen3 VL 235B A22B Thinking arrive en tête à 81 %, contre une médiane de 78 % pour quatre modèles. Cet écart réduit suggère un classement resserré, mais le faible nombre de modèles suivis limite la portée comparative et peut donner une impression de saturation locale sans démontrer une saturation générale du benchmark. La fiabilité doit aussi être appréciée avec prudence, puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun. Enfin, le caractère public du jeu de validation crée un risque d’exposition aux questions, donc de contamination des évaluations. Sa portée reste centrée sur 900 questions en anglais et sur les domaines universitaires couverts par MMMU.


Sources des scores : llm-stats.