MMMUval
MMMUval est le jeu de validation du benchmark MMMU, créé par Xiang Yue et ses coauteurs en 2023. Il évalue la compréhension multimodale et le raisonnement délibéré à partir de problèmes de niveau universitaire, combinant questions à choix multiple, réponses courtes et entrées multimodales.
MMMUval est le jeu de validation du benchmark MMMU, créé par Xiang Yue et ses coauteurs en 2023. Il évalue la compréhension multimodale et le raisonnement délibéré à partir de problèmes de niveau universitaire, combinant questions à choix multiple, réponses courtes et entrées multimodales.
Sa couverture s’étend notamment aux arts, au commerce, aux sciences, à la santé, aux sciences humaines et sociales, ainsi qu’à l’ingénierie. MMMUval sert ainsi à comparer la capacité des modèles multimodaux à mobiliser des connaissances disciplinaires et à raisonner sur des contenus variés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Xiang Yue et al. |
| Capacités mesurées | généraliste, santé, multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM et questions ouvertes à réponse courte, avec entrées multimodales |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 900 questions de validation |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (4)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | Qwen3 VL 235B A22B Thinking | Qwen | 80,6 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 235B A22B Instruct | Qwen | 78,7 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Claude Sonnet 4.5 | Anthropic | 77,8 % | 29 septembre 2025 | Auto-déclaré |
| 4 | Qwen2-VL-72B-Instruct | Qwen | 64,5 % | 29 août 2024 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 78,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMMUval indique qu’un modèle fournit fréquemment la réponse attendue face à des problèmes universitaires multimodaux exigeant connaissances et raisonnement délibéré. L’accuracy agrège toutefois des formats différents et ne décrit pas séparément les performances selon les disciplines ou le type de question. Dans la base, Qwen3 VL 235B A22B Thinking arrive en tête à 81 %, contre une médiane de 78 % pour quatre modèles. Cet écart réduit suggère un classement resserré, mais le faible nombre de modèles suivis limite la portée comparative et peut donner une impression de saturation locale sans démontrer une saturation générale du benchmark. La fiabilité doit aussi être appréciée avec prudence, puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun. Enfin, le caractère public du jeu de validation crée un risque d’exposition aux questions, donc de contamination des évaluations. Sa portée reste centrée sur 900 questions en anglais et sur les domaines universitaires couverts par MMMU.
Sources des scores : llm-stats.