VideoMMMU
VideoMMMU est un benchmark créé en 2025 par EvolvingLMMs-Lab pour évaluer la capacité des grands modèles multimodaux à acquérir des connaissances à partir de vidéos professionnelles de niveau expert.
VideoMMMU est un benchmark créé en 2025 par EvolvingLMMs-Lab pour évaluer la capacité des grands modèles multimodaux à acquérir des connaissances à partir de vidéos professionnelles de niveau expert.
Son protocole organise les questions-réponses selon trois stades cognitifs complémentaires : perception, compréhension et adaptation. Il examine ainsi la faculté d’un modèle à extraire des informations, à en saisir le sens, puis à mobiliser les connaissances acquises dans plusieurs disciplines, plutôt que de mesurer uniquement la reconnaissance de contenus audiovisuels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | EvolvingLMMs-Lab |
| Capacités mesurées | Acquisition de connaissances a partir de videos professionnelles multimodales, des trois stades perception/comprehension/adaptation |
| Modalité | Multimodal |
| Type de questions | questions-reponses sur videos expertes, alignees sur 3 stades cognitifs (perception, comprehension, adaptation) |
| Métrique d'évaluation | exactitude (accuracy) et metrique de gain de connaissance Delta-knowledge |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 300 videos expertes et 900 questions annotees, 6 disciplines (30 sujets) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (26)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3 Pro | 🔒 Propriétaire | 87,6 % | 18 novembre 2025 | Auto-déclaré | |
| 2 | Gemini 3 Flash | 🔒 Propriétaire | 86,9 % | 17 décembre 2025 | Auto-déclaré | |
| 3 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 86,6 % | 27 janvier 2026 | Auto-déclaré |
| 4 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 85,9 % | 11 décembre 2025 | Auto-déclaré |
| 5 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 85,4 % | 31 mai 2026 | Auto-déclaré |
| 6 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 84,8 % | 3 mars 2026 | Auto-déclaré | |
| 7 | GPT-5 | OpenAI | 🔒 Propriétaire | 84,6 % | 7 août 2025 | Auto-déclaré |
| 8 | MiniMax M3 | MiniMax | 🟢 Ouvert | 84,6 % | 1 juin 2026 | Auto-déclaré |
| 9 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,4 % | 21 avril 2026 | Auto-déclaré |
| 10 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 84,0 % | 31 mars 2026 | Auto-déclaré |
| 11 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,7 % | 16 avril 2026 | Auto-déclaré |
| 12 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 83,6 % | 5 juin 2025 | Auto-déclaré | |
| 13 | o3 | OpenAI | 🔒 Propriétaire | 83,3 % | 16 avril 2025 | Auto-déclaré |
| 14 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,3 % | 24 février 2026 | Auto-déclaré |
| 15 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,0 % | 24 février 2026 | Auto-déclaré |
| 16 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,4 % | 24 février 2026 | Auto-déclaré |
| 17 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,0 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,0 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,0 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,7 % | 22 septembre 2025 | Auto-déclaré |
| 21 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,8 % | 22 septembre 2025 | Auto-déclaré |
| 22 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,4 % | 22 septembre 2025 | Auto-déclaré |
| 23 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,7 % | 22 septembre 2025 | Auto-déclaré |
| 24 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,3 % | 22 septembre 2025 | Auto-déclaré |
| 25 | GPT-4o | OpenAI | 🔒 Propriétaire | 61,2 % | 27 mars 2025 | Auto-déclaré |
| 26 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,2 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 26 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 82,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle répond correctement à une large part des questions portant sur des vidéos expertes et maîtrise les trois stades évalués. L’exactitude mesure la réussite aux questions, tandis que Delta-knowledge vise le gain de connaissance associé au visionnage. Le classement montre un niveau global élevé : la médiane atteint 83 %, contre 88 % pour Gemini 3 Pro, premier parmi les 26 modèles recensés. Cet écart limité de cinq points suggère une différenciation relativement resserrée au sommet et un possible effet de saturation.
La portée reste circonscrite à des contenus en anglais, répartis entre six disciplines et trente sujets. Le caractère public du jeu appelle aussi à interpréter les performances avec prudence face au risque de contamination, sans établir qu’une telle contamination a eu lieu. Enfin, la fiabilité comparative est limitée par l’origine des résultats : les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’obtenus dans le cadre d’une mesure indépendante et homogène.
Sources des scores : llm-stats.