VideoMMMU

VideoMMMU est un benchmark créé en 2025 par EvolvingLMMs-Lab pour évaluer la capacité des grands modèles multimodaux à acquérir des connaissances à partir de vidéos professionnelles de niveau expert.

VideoMMMU est un benchmark créé en 2025 par EvolvingLMMs-Lab pour évaluer la capacité des grands modèles multimodaux à acquérir des connaissances à partir de vidéos professionnelles de niveau expert.

Son protocole organise les questions-réponses selon trois stades cognitifs complémentaires : perception, compréhension et adaptation. Il examine ainsi la faculté d’un modèle à extraire des informations, à en saisir le sens, puis à mobiliser les connaissances acquises dans plusieurs disciplines, plutôt que de mesurer uniquement la reconnaissance de contenus audiovisuels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEvolvingLMMs-Lab
Capacités mesuréesAcquisition de connaissances a partir de videos professionnelles multimodales, des trois stades perception/comprehension/adaptation
ModalitéMultimodal
Type de questionsquestions-reponses sur videos expertes, alignees sur 3 stades cognitifs (perception, comprehension, adaptation)
Métrique d'évaluationexactitude (accuracy) et metrique de gain de connaissance Delta-knowledge
AccèsPublic
Languesanglais
Taille du jeu300 videos expertes et 900 questions annotees, 6 disciplines (30 sujets)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (26)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3 ProGoogle🔒 Propriétaire87,6 %18 novembre 2025Auto-déclaré
2Gemini 3 FlashGoogle🔒 Propriétaire86,9 %17 décembre 2025Auto-déclaré
3Kimi K2.5Moonshot AI🟢 Ouvert86,6 %27 janvier 2026Auto-déclaré
4GPT-5.2OpenAI🔒 Propriétaire85,9 %11 décembre 2025Auto-déclaré
5Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire85,4 %31 mai 2026Auto-déclaré
6Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire84,8 %3 mars 2026Auto-déclaré
7GPT-5OpenAI🔒 Propriétaire84,6 %7 août 2025Auto-déclaré
8MiniMax M3MiniMax🟢 Ouvert84,6 %1 juin 2026Auto-déclaré
9Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert84,4 %21 avril 2026Auto-déclaré
10Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire84,0 %31 mars 2026Auto-déclaré
11Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert83,7 %16 avril 2026Auto-déclaré
12Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire83,6 %5 juin 2025Auto-déclaré
13o3OpenAI🔒 Propriétaire83,3 %16 avril 2025Auto-déclaré
14Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert82,3 %24 février 2026Auto-déclaré
15Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert82,0 %24 février 2026Auto-déclaré
16Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert80,4 %24 février 2026Auto-déclaré
17Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert80,0 %22 septembre 2025Auto-déclaré
18Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert79,0 %22 septembre 2025Auto-déclaré
19Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert75,0 %22 septembre 2025Auto-déclaré
20Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert74,7 %22 septembre 2025Auto-déclaré
21Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert72,8 %22 septembre 2025Auto-déclaré
22Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert69,4 %22 septembre 2025Auto-déclaré
23Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert68,7 %22 septembre 2025Auto-déclaré
24Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert65,3 %22 septembre 2025Auto-déclaré
25GPT-4oOpenAI🔒 Propriétaire61,2 %27 mars 2025Auto-déclaré
26Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert56,2 %22 septembre 2025Auto-déclaré

Classement établi sur 26 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 82,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle répond correctement à une large part des questions portant sur des vidéos expertes et maîtrise les trois stades évalués. L’exactitude mesure la réussite aux questions, tandis que Delta-knowledge vise le gain de connaissance associé au visionnage. Le classement montre un niveau global élevé : la médiane atteint 83 %, contre 88 % pour Gemini 3 Pro, premier parmi les 26 modèles recensés. Cet écart limité de cinq points suggère une différenciation relativement resserrée au sommet et un possible effet de saturation.

La portée reste circonscrite à des contenus en anglais, répartis entre six disciplines et trente sujets. Le caractère public du jeu appelle aussi à interpréter les performances avec prudence face au risque de contamination, sans établir qu’une telle contamination a eu lieu. Enfin, la fiabilité comparative est limitée par l’origine des résultats : les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’obtenus dans le cadre d’une mesure indépendante et homogène.


Sources des scores : llm-stats.