MVBench

MVBench est un benchmark public de compréhension vidéo multimodale créé en 2023 par OpenGVLab, le Shanghai AI Laboratory et d’autres contributeurs. Il réunit des tâches vidéo conçues à partir d’annotations existantes selon une méthode de génération allant du statique au dynamique.

MVBench est un benchmark public de compréhension vidéo multimodale créé en 2023 par OpenGVLab, le Shanghai AI Laboratory et d’autres contributeurs. Il réunit des tâches vidéo conçues à partir d’annotations existantes selon une méthode de génération allant du statique au dynamique.

Le benchmark évalue des capacités qui dépassent l’analyse d’une image isolée, notamment la reconnaissance d’actions, les raisonnements temporel, spatial et causal, les interactions entre objets et les transitions de scènes. Il sert ainsi à comparer la faculté des modèles à relier perception et cognition dans des séquences vidéo.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenGVLab / Shanghai AI Laboratory et al.
Capacités mesuréesmultimodal, raisonnement, raisonnement spatial, vidéo, vision
ModalitéMultimodal
Type de questionsQCM de compréhension vidéo multimodale
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu4 000 questions environ (20 tâches × 200)
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (17)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert76,6 %24 février 2026Auto-déclaré
2Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert75,5 %21 avril 2026Auto-déclaré
3Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert74,8 %24 février 2026Auto-déclaré
4Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert74,6 %24 février 2026Auto-déclaré
5Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert74,6 %16 avril 2026Auto-déclaré
6Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert73,6 %29 août 2024Auto-déclaré
7Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert73,2 %22 septembre 2025Auto-déclaré
8Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert72,8 %22 septembre 2025Auto-déclaré
9Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert72,3 %22 septembre 2025Auto-déclaré
10Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert72,0 %22 septembre 2025Auto-déclaré
11Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,4 %26 janvier 2025Auto-déclaré
12Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert70,3 %27 mars 2025Auto-déclaré
13Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert69,6 %26 janvier 2025Auto-déclaré
14Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert69,3 %22 septembre 2025Auto-déclaré
15Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert69,0 %22 septembre 2025Auto-déclaré
16Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert68,9 %22 septembre 2025Auto-déclaré
17Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert68,7 %22 septembre 2025Auto-déclaré

Classement établi sur 17 modèles évalués. Score médian de l'ensemble : 72,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MVBench indique qu’un modèle répond correctement à une large proportion de QCM en anglais portant sur les vingt tâches vidéo couvertes. Il traduit donc une bonne performance agrégée en compréhension temporelle, spatiale et causale, sans constituer une mesure générale de toutes les capacités multimodales. La portée reste circonscrite au format QCM, à l’anglais et aux catégories de tâches intégrées au benchmark.

Dans la base, la médiane atteint 72 %, tandis que Qwen3.5-122B-A10B obtient 77 %. Cet écart limité suggère un classement relativement resserré parmi les modèles évalués et peut signaler un risque de saturation si les performances continuent de progresser. La publicité du jeu crée aussi un risque de contamination lors de l’entraînement ou de l’optimisation des modèles. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison dépend de la fidélité des protocoles appliqués. Le classement renseigne surtout sur les performances rapportées dans ce cadre précis, plutôt que sur une supériorité universelle en compréhension vidéo.


Sources des scores : llm-stats.