V* V* est un benchmark de raisonnement visuel créé par Penghao Wu et Saining Xie, chercheurs à l’UC San Diego et à la New York University. Publié en 2023, il soumet les modèles multimodaux à des images haute résolution et visuellement denses.
RefCOCO-avg RefCOCO-avg est un benchmark d’ancrage visuel qui évalue la capacité d’un modèle à relier une expression en anglais à un objet dans une image, puis à le localiser au moyen d’une boîte englobante.
DynaMath DynaMath est un benchmark de raisonnement mathématique multimodal créé par l’University of Illinois Urbana-Champaign. Il repose sur des problèmes visuels dont plusieurs variantes sont générées par programme, notamment en modifiant des valeurs numériques, des éléments textuels ou des…
MLVU-M MLVU-M est un benchmark conçu en 2024 par Junjie Zhou et l’équipe MLVU, affiliée à BAAI et BUPT. Il évalue la compréhension de vidéos longues, allant de quelques minutes à plusieurs heures, au moyen de questions à choix multiples en anglais.
EmbSpatialBench EmbSpatialBench est un benchmark conçu en 2024 par Mengfei Du et al., de l’Université Fudan. Il évalue la compréhension et le raisonnement spatial incarné des grands modèles vision-langage, à partir de relations spatiales observées selon une perspective égocentrique.
AndroidWorld_SR AndroidWorld_SR est un benchmark conçu par Google Research pour évaluer des agents autonomes multimodaux dans un environnement Android dynamique. Il confronte les systèmes à des tâches agentiques inspirées d’usages réels, telles que l’envoi de messages, la création d’événements ou la…
WideSearch WideSearch est un benchmark de recherche agentique créé par ByteDance Seed. Il évalue la capacité des modèles à mener des recherches larges et parallèles dans plusieurs sources, afin de recueillir de manière exhaustive des informations atomiques et vérifiables.