VideoMME w/o sub.

Créé en 2024 par Chaoyou Fu et ses coauteurs, VideoMME w/o sub. est un benchmark consacré à l’évaluation de la compréhension vidéo par les modèles vision-langage. Il repose sur des QCM portant sur des contenus vidéo variés.

Créé en 2024 par Chaoyou Fu et ses coauteurs, VideoMME w/o sub. est un benchmark consacré à l’évaluation de la compréhension vidéo par les modèles vision-langage. Il repose sur des QCM portant sur des contenus vidéo variés.

Il mesure notamment le raisonnement temporel, la perception d’événements et la compréhension de scènes longues. Son format permet de comparer la capacité des modèles à traiter des séquences visuelles et à interpréter un contenu multimodal, avec une évaluation centrée ici sur la configuration sans sous-titres.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkChaoyou Fu et al.
Capacités mesuréesmultimodal, vidéo, vision
ModalitéMultimodal
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
LicenceCC-BY-NC-SA-4.0
Languesanglais
Taille du jeu900 vidéos et 2 700 questions-réponses
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %24 février 2026Auto-déclaré
2Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert82,8 %24 février 2026Auto-déclaré
3Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert82,5 %24 février 2026Auto-déclaré
4Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert82,5 %16 avril 2026Auto-déclaré
5Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert79,2 %22 septembre 2025Auto-déclaré
6Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert79,0 %22 septembre 2025Auto-déclaré
7Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert77,3 %22 septembre 2025Auto-déclaré
8Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert73,3 %26 janvier 2025Auto-déclaré
9Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,5 %28 février 2025Auto-déclaré
10Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert65,1 %26 janvier 2025Auto-déclaré

Classement établi sur 10 modèles évalués. Score médian de l'ensemble : 79,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur VideoMME w/o sub. traduit une forte proportion de réponses correctes et, plus largement, une bonne capacité à extraire et relier les informations nécessaires dans des vidéos de durées et de domaines variés. Le meilleur résultat recensé, obtenu par Qwen3.5-122B-A10B, reste supérieur à la médiane des dix modèles évalués, ce qui révèle un avantage mesurable sans indiquer une domination absolue. Avec un meilleur score de 84 %, le benchmark conserve une marge avant le maximum, même si des performances globalement élevées peuvent progressivement réduire son pouvoir discriminant. L’interprétation du classement exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure commun. Le caractère public du jeu peut en outre accroître le risque de contamination au fil du temps. Enfin, sa portée demeure liée à ses QCM en anglais et aux domaines vidéo couverts, ce qui circonscrit les conclusions sur les capacités générales des modèles.


Sources des scores : llm-stats.