VideoMME w/o sub.
Créé en 2024 par Chaoyou Fu et ses coauteurs, VideoMME w/o sub. est un benchmark consacré à l’évaluation de la compréhension vidéo par les modèles vision-langage. Il repose sur des QCM portant sur des contenus vidéo variés.
Créé en 2024 par Chaoyou Fu et ses coauteurs, VideoMME w/o sub. est un benchmark consacré à l’évaluation de la compréhension vidéo par les modèles vision-langage. Il repose sur des QCM portant sur des contenus vidéo variés.
Il mesure notamment le raisonnement temporel, la perception d’événements et la compréhension de scènes longues. Son format permet de comparer la capacité des modèles à traiter des séquences visuelles et à interpréter un contenu multimodal, avec une évaluation centrée ici sur la configuration sans sous-titres.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Chaoyou Fu et al. |
| Capacités mesurées | multimodal, vidéo, vision |
| Modalité | Multimodal |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | CC-BY-NC-SA-4.0 |
| Langues | anglais |
| Taille du jeu | 900 vidéos et 2 700 questions-réponses |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,8 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,5 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,5 % | 16 avril 2026 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,2 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,0 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,3 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,3 % | 26 janvier 2025 | Auto-déclaré |
| 9 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,5 % | 28 février 2025 | Auto-déclaré |
| 10 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,1 % | 26 janvier 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués. Score médian de l'ensemble : 79,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur VideoMME w/o sub. traduit une forte proportion de réponses correctes et, plus largement, une bonne capacité à extraire et relier les informations nécessaires dans des vidéos de durées et de domaines variés. Le meilleur résultat recensé, obtenu par Qwen3.5-122B-A10B, reste supérieur à la médiane des dix modèles évalués, ce qui révèle un avantage mesurable sans indiquer une domination absolue. Avec un meilleur score de 84 %, le benchmark conserve une marge avant le maximum, même si des performances globalement élevées peuvent progressivement réduire son pouvoir discriminant. L’interprétation du classement exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure commun. Le caractère public du jeu peut en outre accroître le risque de contamination au fil du temps. Enfin, sa portée demeure liée à ses QCM en anglais et aux domaines vidéo couverts, ce qui circonscrit les conclusions sur les capacités générales des modèles.
Sources des scores : llm-stats.