Video-MME

Video-MME est un benchmark public conçu en 2024 par Chaoyou Fu et ses coauteurs pour évaluer la compréhension vidéo des Multi-modal Large Language Models. Il examine notamment leur capacité à raisonner sur les dimensions visuelles et temporelles de vidéos aux formats et durées variés.

Video-MME est un benchmark public conçu en 2024 par Chaoyou Fu et ses coauteurs pour évaluer la compréhension vidéo des Multi-modal Large Language Models. Il examine notamment leur capacité à raisonner sur les dimensions visuelles et temporelles de vidéos aux formats et durées variés.

L’évaluation repose sur des QCM annotés manuellement par des experts et peut combiner images vidéo, sous-titres et audio. Couvrant plusieurs domaines et des contenus multilingues, Video-MME sert à comparer la manière dont les modèles analysent des séquences courtes comme longues.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkChaoyou Fu et al.
Capacités mesuréesmultimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais pour les questions; contenus vidéo multilingues
Taille du jeu900 vidéos, 2 700 paires question-réponse
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (17)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 ProByteDance🔒 Propriétaire89,2 %24 juin 2026Auto-déclaré
2Seed 2.1 TurboByteDance🔒 Propriétaire89,0 %24 juin 2026Auto-déclaré
3Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire88,0 %31 mai 2026Auto-déclaré
4MiMo-V2.5Xiaomi🟢 Ouvert87,7 %22 avril 2026Auto-déclaré
5Kimi K2.5Moonshot AI🟢 Ouvert87,4 %27 janvier 2026Auto-déclaré
6MiniMax M3MiniMax🟢 Ouvert85,4 %1 juin 2026Auto-déclaré
7Gemini 2.5 ProGoogle🔒 Propriétaire84,8 %20 mai 2025Auto-déclaré
8Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire84,2 %31 mars 2026Auto-déclaré
9Gemini 1.5 ProGoogle🔒 Propriétaire78,6 %1 mai 2024Auto-déclaré
10Nova 2 OmniAmazon🔒 Propriétaire77,9 %2 décembre 2025Auto-déclaré
11Gemini 1.5 FlashGoogle🔒 Propriétaire76,1 %1 mai 2024Auto-déclaré
12Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert74,5 %22 septembre 2025Auto-déclaré
13Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert73,3 %22 septembre 2025Auto-déclaré
14Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert71,8 %22 septembre 2025Auto-déclaré
15Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert71,4 %22 septembre 2025Auto-déclaré
16Gemini 1.5 Flash 8BGoogle🔒 Propriétaire66,2 %15 mars 2024Auto-déclaré
17Phi-4-multimodal-instructMicrosoft🟢 Ouvert55,0 %1 février 2025Auto-déclaré

Classement établi sur 17 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 78,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Video-MME indique qu’un modèle répond correctement à une forte proportion de questions portant sur le contenu visuel, le déroulement temporel et, selon la configuration, les sous-titres ou l’audio. L’annotation humaine par des experts renforce la rigueur du jeu d’évaluation. La lecture du classement exige toutefois de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.

Avec une médiane de 79 % parmi les 17 modèles de la base et un meilleur score de 89 % pour Seed 2.1 Pro de ByteDance, le classement montre un niveau globalement élevé et un écart limité entre le centre de la distribution et la tête. Cette concentration peut réduire progressivement le pouvoir discriminant du benchmark à mesure que les performances approchent du haut de l’échelle. Son accès public implique aussi un risque de contamination à considérer lors de l’interprétation. Enfin, l’accuracy sur des QCM mesure une portée précise, la compréhension multimodale de vidéos dans les domaines, durées et modalités couverts, et non les capacités générales d’un modèle.


Sources des scores : llm-stats.