Video-MME
Video-MME est un benchmark public conçu en 2024 par Chaoyou Fu et ses coauteurs pour évaluer la compréhension vidéo des Multi-modal Large Language Models. Il examine notamment leur capacité à raisonner sur les dimensions visuelles et temporelles de vidéos aux formats et durées variés.
Video-MME est un benchmark public conçu en 2024 par Chaoyou Fu et ses coauteurs pour évaluer la compréhension vidéo des Multi-modal Large Language Models. Il examine notamment leur capacité à raisonner sur les dimensions visuelles et temporelles de vidéos aux formats et durées variés.
L’évaluation repose sur des QCM annotés manuellement par des experts et peut combiner images vidéo, sous-titres et audio. Couvrant plusieurs domaines et des contenus multilingues, Video-MME sert à comparer la manière dont les modèles analysent des séquences courtes comme longues.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Chaoyou Fu et al. |
| Capacités mesurées | multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais pour les questions; contenus vidéo multilingues |
| Taille du jeu | 900 vidéos, 2 700 paires question-réponse |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (17)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 89,2 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 89,0 % | 24 juin 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 88,0 % | 31 mai 2026 | Auto-déclaré |
| 4 | MiMo-V2.5 | Xiaomi | 🟢 Ouvert | 87,7 % | 22 avril 2026 | Auto-déclaré |
| 5 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 87,4 % | 27 janvier 2026 | Auto-déclaré |
| 6 | MiniMax M3 | MiniMax | 🟢 Ouvert | 85,4 % | 1 juin 2026 | Auto-déclaré |
| 7 | Gemini 2.5 Pro | 🔒 Propriétaire | 84,8 % | 20 mai 2025 | Auto-déclaré | |
| 8 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 84,2 % | 31 mars 2026 | Auto-déclaré |
| 9 | Gemini 1.5 Pro | 🔒 Propriétaire | 78,6 % | 1 mai 2024 | Auto-déclaré | |
| 10 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 77,9 % | 2 décembre 2025 | Auto-déclaré |
| 11 | Gemini 1.5 Flash | 🔒 Propriétaire | 76,1 % | 1 mai 2024 | Auto-déclaré | |
| 12 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,5 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,3 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,8 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,4 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 66,2 % | 15 mars 2024 | Auto-déclaré | |
| 17 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 55,0 % | 1 février 2025 | Auto-déclaré |
Classement établi sur 17 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 78,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Video-MME indique qu’un modèle répond correctement à une forte proportion de questions portant sur le contenu visuel, le déroulement temporel et, selon la configuration, les sous-titres ou l’audio. L’annotation humaine par des experts renforce la rigueur du jeu d’évaluation. La lecture du classement exige toutefois de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.
Avec une médiane de 79 % parmi les 17 modèles de la base et un meilleur score de 89 % pour Seed 2.1 Pro de ByteDance, le classement montre un niveau globalement élevé et un écart limité entre le centre de la distribution et la tête. Cette concentration peut réduire progressivement le pouvoir discriminant du benchmark à mesure que les performances approchent du haut de l’échelle. Son accès public implique aussi un risque de contamination à considérer lors de l’interprétation. Enfin, l’accuracy sur des QCM mesure une portée précise, la compréhension multimodale de vidéos dans les domaines, durées et modalités couverts, et non les capacités générales d’un modèle.
Sources des scores : llm-stats.