EgoSchema

EgoSchema est un benchmark de compréhension vidéo en contexte égocentrique, créé en 2023 par K. Mangalam, R. Akshulakov et J. Malik. Il repose sur des questions à choix multiples élaborées par des humains à partir de séquences issues d’Ego4D.

EgoSchema est un benchmark de compréhension vidéo en contexte égocentrique, créé en 2023 par K. Mangalam, R. Akshulakov et J. Malik. Il repose sur des questions à choix multiples élaborées par des humains à partir de séquences issues d’Ego4D.

Son objectif est d’évaluer la capacité des modèles à interpréter des vidéos longues montrant des activités humaines naturelles. Il sollicite notamment le raisonnement temporel et causal, au-delà de la reconnaissance d’éléments isolés, afin de comparer les systèmes sur leur compréhension globale d’actions et de comportements.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkK. Mangalam, R. Akshulakov et J. Malik
Capacités mesuréescontexte long, raisonnement, vision
ModalitéVidéo
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeu5 031 questions à choix multiples fondées sur des clips vidéo d’environ 3 minutes
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,9 %29 août 2024Auto-déclaré
2Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert76,2 %26 janvier 2025Auto-déclaré
3GPT-4oOpenAI🔒 Propriétaire72,2 %27 mars 2025Auto-déclaré
4Nova ProAmazon🔒 Propriétaire72,1 %20 novembre 2024Auto-déclaré
5Gemini 2.0 FlashGoogle🔒 Propriétaire71,5 %21 janvier 2025Auto-déclaré
6Nova LiteAmazon🔒 Propriétaire71,4 %20 novembre 2024Auto-déclaré
7Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert68,6 %27 mars 2025Auto-déclaré
8Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire67,2 %5 février 2025Auto-déclaré
9Gemini 1.0 ProGoogle🔒 Propriétaire55,7 %15 février 2024Auto-déclaré

Classement établi sur 9 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 71,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur EgoSchema indique qu’un modèle choisit fréquemment la bonne réponse après avoir interprété une séquence égocentrique longue, ses relations temporelles et ses enchaînements causaux. L’accuracy fournit une mesure directe, mais le QCM évalue la sélection d’une réponse plutôt qu’une explication libre. Le test privé, dont les réponses ne sont pas divulguées, réduit l’exposition directe des solutions et contribue à limiter la contamination par les réponses de référence. La fiabilité comparative doit toutefois être nuancée, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant unique.

Parmi les neuf modèles suivis, Qwen2-VL-72B-Instruct atteint 78 %, contre une médiane de 72 %. Cet écart montre une avance du meilleur système, mais aussi des performances déjà regroupées à un niveau élevé, ce qui peut annoncer un risque de saturation si les scores continuent de converger. La portée reste circonscrite à des QCM en anglais fondés sur des clips égocentriques d’environ trois minutes. Le classement renseigne donc spécifiquement sur cette forme de compréhension vidéo, sans constituer une mesure générale de toutes les capacités multimodales.


Sources des scores : llm-stats.