MLVU-M
MLVU-M est un benchmark conçu en 2024 par Junjie Zhou et l’équipe MLVU, affiliée à BAAI et BUPT. Il évalue la compréhension de vidéos longues, allant de quelques minutes à plusieurs heures, au moyen de questions à choix multiples en anglais.
MLVU-M est un benchmark conçu en 2024 par Junjie Zhou et l’équipe MLVU, affiliée à BAAI et BUPT. Il évalue la compréhension de vidéos longues, allant de quelques minutes à plusieurs heures, au moyen de questions à choix multiples en anglais.
Ses neuf tâches couvrent notamment le raisonnement, la reconnaissance et le résumé. MLVU-M sert ainsi à comparer la capacité des modèles à extraire, relier et restituer des informations réparties dans des séquences vidéo de longue durée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Junjie Zhou et al. (equipe MLVU - BAAI / BUPT) |
| Capacités mesurées | Comprehension de longues videos (3 min a 2 h) sur 9 taches : raisonnement, reconnaissance, resume, etc. |
| Modalité | Texte |
| Type de questions | QCM (choix multiples) de comprehension de longues videos |
| Métrique d'évaluation | Exactitude (M-avg, moyenne des taches a choix multiples) |
| Accès | Public |
| Licence | CC BY-NC-SA 4.0 |
| Langues | Anglais |
| Taille du jeu | environ 2 600 questions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,1 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,3 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,9 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,1 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,7 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,3 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,1 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,6 % | 26 janvier 2025 | Auto-déclaré |
Classement établi sur 8 modèles évalués. Score médian de l'ensemble : 76,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MLVU-M indique une forte exactitude moyenne dans les tâches de compréhension proposées. Il traduit une aptitude à traiter différents types de questions sur des vidéos longues, sans pour autant constituer une mesure générale de toutes les capacités vidéo d’un modèle. Dans la base, Qwen3 VL 32B Instruct arrive en tête à 82 %, contre une médiane de 77 % pour les huit modèles évalués. Cet écart relativement limité suggère un classement resserré, où quelques points peuvent modifier sensiblement l’ordre observé et où une progression vers la saturation mérite d’être surveillée.
La lecture comparative doit aussi tenir compte de la provenance des résultats. Les scores étant majoritairement auto-déclarés par les éditeurs, leur rigueur dépend des protocoles appliqués par chaque source plutôt que d’une mesure indépendante uniforme. Le caractère public du jeu impose également de considérer le risque de contamination lors de l’interprétation des performances. Enfin, la portée reste circonscrite aux questions à choix multiples en anglais et aux neuf tâches de MLVU-M. Le classement révèle donc avant tout les différences de réussite dans ce cadre précis.
Sources des scores : llm-stats.