MLVU-M

MLVU-M est un benchmark conçu en 2024 par Junjie Zhou et l’équipe MLVU, affiliée à BAAI et BUPT. Il évalue la compréhension de vidéos longues, allant de quelques minutes à plusieurs heures, au moyen de questions à choix multiples en anglais.

MLVU-M est un benchmark conçu en 2024 par Junjie Zhou et l’équipe MLVU, affiliée à BAAI et BUPT. Il évalue la compréhension de vidéos longues, allant de quelques minutes à plusieurs heures, au moyen de questions à choix multiples en anglais.

Ses neuf tâches couvrent notamment le raisonnement, la reconnaissance et le résumé. MLVU-M sert ainsi à comparer la capacité des modèles à extraire, relier et restituer des informations réparties dans des séquences vidéo de longue durée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkJunjie Zhou et al. (equipe MLVU - BAAI / BUPT)
Capacités mesuréesComprehension de longues videos (3 min a 2 h) sur 9 taches : raisonnement, reconnaissance, resume, etc.
ModalitéTexte
Type de questionsQCM (choix multiples) de comprehension de longues videos
Métrique d'évaluationExactitude (M-avg, moyenne des taches a choix multiples)
AccèsPublic
LicenceCC BY-NC-SA 4.0
LanguesAnglais
Taille du jeuenviron 2 600 questions
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,1 %22 septembre 2025Auto-déclaré
2Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert81,3 %22 septembre 2025Auto-déclaré
3Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert78,9 %22 septembre 2025Auto-déclaré
4Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert78,1 %22 septembre 2025Auto-déclaré
5Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert75,7 %22 septembre 2025Auto-déclaré
6Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert75,3 %22 septembre 2025Auto-déclaré
7Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert75,1 %22 septembre 2025Auto-déclaré
8Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert74,6 %26 janvier 2025Auto-déclaré

Classement établi sur 8 modèles évalués. Score médian de l'ensemble : 76,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MLVU-M indique une forte exactitude moyenne dans les tâches de compréhension proposées. Il traduit une aptitude à traiter différents types de questions sur des vidéos longues, sans pour autant constituer une mesure générale de toutes les capacités vidéo d’un modèle. Dans la base, Qwen3 VL 32B Instruct arrive en tête à 82 %, contre une médiane de 77 % pour les huit modèles évalués. Cet écart relativement limité suggère un classement resserré, où quelques points peuvent modifier sensiblement l’ordre observé et où une progression vers la saturation mérite d’être surveillée.

La lecture comparative doit aussi tenir compte de la provenance des résultats. Les scores étant majoritairement auto-déclarés par les éditeurs, leur rigueur dépend des protocoles appliqués par chaque source plutôt que d’une mesure indépendante uniforme. Le caractère public du jeu impose également de considérer le risque de contamination lors de l’interprétation des performances. Enfin, la portée reste circonscrite aux questions à choix multiples en anglais et aux neuf tâches de MLVU-M. Le classement révèle donc avant tout les différences de réussite dans ce cadre précis.


Sources des scores : llm-stats.