EgoSchema
EgoSchema est un benchmark de compréhension vidéo en contexte égocentrique, créé en 2023 par K. Mangalam, R. Akshulakov et J. Malik. Il repose sur des questions à choix multiples élaborées par des humains à partir de séquences issues d’Ego4D.
EgoSchema est un benchmark de compréhension vidéo en contexte égocentrique, créé en 2023 par K. Mangalam, R. Akshulakov et J. Malik. Il repose sur des questions à choix multiples élaborées par des humains à partir de séquences issues d’Ego4D.
Son objectif est d’évaluer la capacité des modèles à interpréter des vidéos longues montrant des activités humaines naturelles. Il sollicite notamment le raisonnement temporel et causal, au-delà de la reconnaissance d’éléments isolés, afin de comparer les systèmes sur leur compréhension globale d’actions et de comportements.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | K. Mangalam, R. Akshulakov et J. Malik |
| Capacités mesurées | contexte long, raisonnement, vision |
| Modalité | Vidéo |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | 5 031 questions à choix multiples fondées sur des clips vidéo d’environ 3 minutes |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,9 % | 29 août 2024 | Auto-déclaré |
| 2 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,2 % | 26 janvier 2025 | Auto-déclaré |
| 3 | GPT-4o | OpenAI | 🔒 Propriétaire | 72,2 % | 27 mars 2025 | Auto-déclaré |
| 4 | Nova Pro | Amazon | 🔒 Propriétaire | 72,1 % | 20 novembre 2024 | Auto-déclaré |
| 5 | Gemini 2.0 Flash | 🔒 Propriétaire | 71,5 % | 21 janvier 2025 | Auto-déclaré | |
| 6 | Nova Lite | Amazon | 🔒 Propriétaire | 71,4 % | 20 novembre 2024 | Auto-déclaré |
| 7 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,6 % | 27 mars 2025 | Auto-déclaré |
| 8 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 67,2 % | 5 février 2025 | Auto-déclaré | |
| 9 | Gemini 1.0 Pro | 🔒 Propriétaire | 55,7 % | 15 février 2024 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 71,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur EgoSchema indique qu’un modèle choisit fréquemment la bonne réponse après avoir interprété une séquence égocentrique longue, ses relations temporelles et ses enchaînements causaux. L’accuracy fournit une mesure directe, mais le QCM évalue la sélection d’une réponse plutôt qu’une explication libre. Le test privé, dont les réponses ne sont pas divulguées, réduit l’exposition directe des solutions et contribue à limiter la contamination par les réponses de référence. La fiabilité comparative doit toutefois être nuancée, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant unique.
Parmi les neuf modèles suivis, Qwen2-VL-72B-Instruct atteint 78 %, contre une médiane de 72 %. Cet écart montre une avance du meilleur système, mais aussi des performances déjà regroupées à un niveau élevé, ce qui peut annoncer un risque de saturation si les scores continuent de converger. La portée reste circonscrite à des QCM en anglais fondés sur des clips égocentriques d’environ trois minutes. Le classement renseigne donc spécifiquement sur cette forme de compréhension vidéo, sans constituer une mesure générale de toutes les capacités multimodales.
Sources des scores : llm-stats.