VideoMME w sub.
VideoMME w sub est un benchmark public conçu par Chaoyou Fu et ses coauteurs pour évaluer la compréhension multimodale de vidéos par les modèles d’IA. Il couvre des contenus de durées variées et associe images, sous-titres et audio.
VideoMME w sub est un benchmark public conçu par Chaoyou Fu et ses coauteurs pour évaluer la compréhension multimodale de vidéos par les modèles d’IA. Il couvre des contenus de durées variées et associe images, sous-titres et audio.
Ses QCM sollicitent notamment le raisonnement temporel, la compréhension visuelle et l’exploitation conjointe des différentes modalités. Le benchmark sert ainsi à comparer la capacité des modèles à analyser des séquences vidéo, à relier des informations dispersées dans le temps et à sélectionner une réponse correcte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Chaoyou Fu et al. |
| Capacités mesurées | multimodal, vidéo, vision |
| Modalité | Multimodal |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 900 vidéos, 2 700 questions-réponses |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,7 % | 21 avril 2026 | Auto-déclaré |
| 2 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,3 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,0 % | 24 février 2026 | Auto-déclaré |
| 4 | GPT-5 | OpenAI | 🔒 Propriétaire | 86,7 % | 7 août 2025 | Auto-déclaré |
| 5 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,6 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,6 % | 16 avril 2026 | Auto-déclaré |
| 7 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,9 % | 28 février 2025 | Auto-déclaré |
| 8 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,4 % | 27 mars 2025 | Auto-déclaré |
| 9 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,6 % | 26 janvier 2025 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 86,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur VideoMME w sub indique une forte réussite aux QCM portant sur la compréhension visuelle et temporelle, ainsi qu’une bonne exploitation des sous-titres et de l’audio. Il ne mesure toutefois que l’accuracy dans ce cadre précis, sur des questions en anglais et des domaines couverts par le jeu. La proximité entre le score médian de 87 % et les 88 % de Qwen3.6-27B suggère un classement resserré parmi les neuf modèles recensés. Cette faible amplitude peut traduire une saturation partielle et réduit le pouvoir discriminant du benchmark au sommet du classement. Qwen3.6-27B arrive en tête, mais son avance limitée appelle une lecture prudente des écarts. La rigueur comparative dépend aussi de la provenance des résultats, puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Enfin, l’accès public au benchmark crée un risque de contamination des évaluations si ses contenus sont intégrés aux données d’entraînement. Les résultats caractérisent donc une performance ciblée, sans résumer à eux seuls les capacités vidéo générales d’un modèle.
Sources des scores : llm-stats.