MVBench
MVBench est un benchmark public de compréhension vidéo multimodale créé en 2023 par OpenGVLab, le Shanghai AI Laboratory et d’autres contributeurs. Il réunit des tâches vidéo conçues à partir d’annotations existantes selon une méthode de génération allant du statique au dynamique.
MVBench est un benchmark public de compréhension vidéo multimodale créé en 2023 par OpenGVLab, le Shanghai AI Laboratory et d’autres contributeurs. Il réunit des tâches vidéo conçues à partir d’annotations existantes selon une méthode de génération allant du statique au dynamique.
Le benchmark évalue des capacités qui dépassent l’analyse d’une image isolée, notamment la reconnaissance d’actions, les raisonnements temporel, spatial et causal, les interactions entre objets et les transitions de scènes. Il sert ainsi à comparer la faculté des modèles à relier perception et cognition dans des séquences vidéo.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenGVLab / Shanghai AI Laboratory et al. |
| Capacités mesurées | multimodal, raisonnement, raisonnement spatial, vidéo, vision |
| Modalité | Multimodal |
| Type de questions | QCM de compréhension vidéo multimodale |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 4 000 questions environ (20 tâches × 200) |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (17)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,6 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,5 % | 21 avril 2026 | Auto-déclaré |
| 3 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,8 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,6 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,6 % | 16 avril 2026 | Auto-déclaré |
| 6 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,6 % | 29 août 2024 | Auto-déclaré |
| 7 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,2 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,8 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,3 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,0 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,4 % | 26 janvier 2025 | Auto-déclaré |
| 12 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,3 % | 27 mars 2025 | Auto-déclaré |
| 13 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,6 % | 26 janvier 2025 | Auto-déclaré |
| 14 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,3 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,0 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,9 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,7 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 17 modèles évalués. Score médian de l'ensemble : 72,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MVBench indique qu’un modèle répond correctement à une large proportion de QCM en anglais portant sur les vingt tâches vidéo couvertes. Il traduit donc une bonne performance agrégée en compréhension temporelle, spatiale et causale, sans constituer une mesure générale de toutes les capacités multimodales. La portée reste circonscrite au format QCM, à l’anglais et aux catégories de tâches intégrées au benchmark.
Dans la base, la médiane atteint 72 %, tandis que Qwen3.5-122B-A10B obtient 77 %. Cet écart limité suggère un classement relativement resserré parmi les modèles évalués et peut signaler un risque de saturation si les performances continuent de progresser. La publicité du jeu crée aussi un risque de contamination lors de l’entraînement ou de l’optimisation des modèles. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison dépend de la fidélité des protocoles appliqués. Le classement renseigne surtout sur les performances rapportées dans ce cadre précis, plutôt que sur une supériorité universelle en compréhension vidéo.
Sources des scores : llm-stats.