MMT-Bench

MMT-Bench est un benchmark multimodal créé en 2024 par OpenGVLab, au sein du Shanghai AI Laboratory, avec d’autres contributeurs. Il évalue des modèles vision-langage au moyen de questions visuelles à choix unique couvrant de nombreux contextes multimodaux.

MMT-Bench est un benchmark multimodal créé en 2024 par OpenGVLab, au sein du Shanghai AI Laboratory, avec d’autres contributeurs. Il évalue des modèles vision-langage au moyen de questions visuelles à choix unique couvrant de nombreux contextes multimodaux.

Son objectif est de mesurer la compréhension multimodale et le raisonnement visuel à travers un large éventail de tâches et de sous-tâches, notamment dans des scénarios comme la conduite automobile et la navigation incarnée. Cette diversité en fait un outil d’évaluation multitâche des capacités des modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenGVLab (Shanghai AI Laboratory) et al.
Capacités mesuréesgénéraliste, multimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM multimodaux à choix unique
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu31 325 questions visuelles à choix multiple
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1DeepSeek VL2DeepSeek63,6 %13 décembre 2024Auto-déclaré
2Qwen2.5 VL 7B InstructQwen63,6 %26 janvier 2025Auto-déclaré
3DeepSeek VL2 SmallDeepSeek62,9 %13 décembre 2024Auto-déclaré
4DeepSeek VL2 TinyDeepSeek53,2 %13 décembre 2024Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 63,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMT-Bench indique qu’un modèle répond correctement à une forte proportion de QCM visuels portant sur des tâches variées. Il reflète donc une meilleure performance agrégée en compréhension multimodale et en raisonnement visuel dans le cadre précis du benchmark. Il ne doit toutefois pas être interprété au-delà de cette portée : l’évaluation repose sur des questions en anglais, à choix unique, et sur les scénarios et sous-tâches inclus dans le jeu.

La lecture du classement appelle aussi à la prudence. Les scores recensés sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie de comparabilité moins forte qu’une évaluation intégralement mesurée selon un protocole commun. Dans la base, quatre modèles sont évalués. DeepSeek VL2 arrive en tête à 64 %, tandis que la médiane atteint 63 %. Cet écart resserré montre que le classement distingue peu le meilleur résultat du niveau médian observé. Il ne suffit pas, à lui seul, à établir une supériorité générale hors de MMT-Bench. Les résultats restent liés au contenu public du benchmark, à son format et à son périmètre multimodal.


Sources des scores : llm-stats.