CharadesSTA
CharadesSTA est un benchmark de localisation temporelle d’activités dans des vidéos à partir de requêtes en langage naturel. Créé par Jiyang Gao, Chen Sun, Zhenheng Yang et Ram Nevatia, il étend Charades avec des annotations reliant des phrases descriptives à des segments vidéo…
CharadesSTA est un benchmark de localisation temporelle d’activités dans des vidéos à partir de requêtes en langage naturel. Créé par Jiyang Gao, Chen Sun, Zhenheng Yang et Ram Nevatia, il étend Charades avec des annotations reliant des phrases descriptives à des segments vidéo précisément délimités.
Il mesure la capacité d’un modèle à comprendre une description textuelle, puis à retrouver le passage vidéo correspondant. CharadesSTA sert ainsi à évaluer conjointement la compréhension du langage, l’interprétation du contenu vidéo et la précision de l’alignement temporel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Jiyang Gao, Chen Sun, Zhenheng Yang et Ram Nevatia |
| Capacités mesurées | langage, multimodal, vidéo, vision |
| Modalité | Multimodal |
| Type de questions | requêtes en langage naturel associées à des segments vidéo à localiser temporellement |
| Métrique d'évaluation | Recall@K à différents seuils d’IoU |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 16 128 paires segment-phrase, dont 12 408 en entraînement et 3 720 en test |
| Année de publication | 2017 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,8 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,5 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,5 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,8 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,7 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,2 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,9 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,0 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,0 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,5 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,2 % | 28 février 2025 | Auto-déclaré |
| 12 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,6 % | 26 janvier 2025 | Auto-déclaré |
Classement établi sur 12 modèles évalués. Score médian de l'ensemble : 60,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle retrouve fréquemment le segment pertinent parmi ses prédictions, avec un chevauchement temporel conforme aux seuils d’IoU retenus. L’évaluation par Recall@K combine donc qualité de localisation et présence de la bonne réponse dans les K résultats. La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun.
Parmi les 12 modèles évalués, Qwen3 VL 235B A22B Instruct atteint 65 %, contre une médiane de 61 %. Cet écart resserré suggère une différenciation limitée au sommet de cette sélection et un possible début de saturation, sans signifier que la tâche est résolue. L’accès public au jeu crée aussi un risque potentiel de contamination si ses exemples ont été exposés pendant l’entraînement. Enfin, la portée du résultat reste ciblée sur des requêtes en anglais et sur la localisation temporelle d’activités dans les vidéos de CharadesSTA. Le classement renseigne donc sur cette aptitude précise, plutôt que sur les performances générales d’un modèle multimodal.
Sources des scores : llm-stats.