MLVU
MLVU est un benchmark conçu par les auteurs MLVU, associés au dépôt JUNJIE99 de Junjie Zhou. Publié en 2024, il évalue la compréhension multimodale de vidéos longues à travers des contenus et des tâches variés.
MLVU est un benchmark conçu par les auteurs MLVU, associés au dépôt JUNJIE99 de Junjie Zhou. Publié en 2024, il évalue la compréhension multimodale de vidéos longues à travers des contenus et des tâches variés.
Son protocole combine raisonnement, reconnaissance, sous-titrage et résumé, avec des questions à choix multiple et des productions libres. MLVU sert ainsi à comparer la capacité des modèles à extraire, relier et restituer des informations sur des séquences pouvant s’étendre de quelques minutes à plusieurs heures.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs MLVU (depot JUNJIE99 / Junjie Zhou) |
| Capacités mesurées | Comprehension de longues videos : raisonnement, sous-titrage, reconnaissance, resume sur des durees longues |
| Modalité | Multimodal |
| Type de questions | Mixte : QCM (taches a reponse fixe) et generation libre (sous-titrage, resume) |
| Métrique d'évaluation | Précision (M-Avg pour QCM) + notation par modele pour les taches generatives |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 9 taches, videos de 3 minutes a 2 heures, genres varies (films, surveillance, egocentrique, dessins animes, jeux) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 87,4 % | 31 mai 2026 | Auto-déclaré |
| 2 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,3 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 86,7 % | 31 mars 2026 | Auto-déclaré |
| 4 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,6 % | 21 avril 2026 | Auto-déclaré |
| 5 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,2 % | 16 avril 2026 | Auto-déclaré |
| 6 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,9 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,6 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,3 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,8 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,2 % | 26 janvier 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués. Score médian de l'ensemble : 86,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MLVU traduit une bonne performance globale sur les tâches à réponse fixe, synthétisées par M-Avg, ainsi que sur les productions génératives évaluées par un modèle. Cette combinaison couvre plusieurs dimensions de la compréhension vidéo, mais elle associe une mesure de précision directe à une notation automatisée, dont l’interprétation dépend du modèle évaluateur. La fiabilité du classement appelle aussi à la prudence, car les scores disponibles sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant uniforme.
Le faible écart entre la médiane de 86 % et le meilleur résultat, 87 % pour Qwen3.7-Plus, suggère une forte concentration des performances parmi les dix modèles recensés et une possible saturation du classement. L’accès public au jeu invite également à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, la portée reste celle des neuf tâches retenues, de contenus en anglais et des genres couverts. Le classement révèle donc surtout des différences étroites sur ce protocole précis, sans autoriser une généralisation à toute compréhension vidéo.
Sources des scores : llm-stats.