EmbSpatialBench

EmbSpatialBench est un benchmark conçu en 2024 par Mengfei Du et al., de l’Université Fudan. Il évalue la compréhension et le raisonnement spatial incarné des grands modèles vision-langage, à partir de relations spatiales observées selon une perspective égocentrique.

EmbSpatialBench est un benchmark conçu en 2024 par Mengfei Du et al., de l’Université Fudan. Il évalue la compréhension et le raisonnement spatial incarné des grands modèles vision-langage, à partir de relations spatiales observées selon une perspective égocentrique.

Les modèles répondent en anglais à des questions à choix multiples portant sur six relations spatiales. EmbSpatialBench sert ainsi à comparer leur capacité à interpréter une scène depuis le point de vue d’un agent et à raisonner correctement sur les positions relatives des éléments.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkUniversité Fudan (Mengfei Du et al.)
Capacités mesuréesCompréhension et raisonnement spatial incarné (embodied) pour grands modèles vision-langage, 6 relations spatiales en perspective égocentrique
ModalitéImage
Type de questionsquestions à choix multiples (QCM) sur relations spatiales
Métrique d'évaluationexactitude (accuracy) sur QCM
AccèsPublic
Languesanglais
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert84,6 %21 avril 2026Auto-déclaré
2Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert84,5 %24 février 2026Auto-déclaré
3Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert84,3 %22 septembre 2025Auto-déclaré
4Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert84,3 %16 avril 2026Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %24 février 2026Auto-déclaré
6Seed 2.1 ProByteDance🔒 Propriétaire83,4 %24 juin 2026Auto-déclaré
7Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert83,1 %24 février 2026Auto-déclaré
8Seed 2.1 TurboByteDance🔒 Propriétaire82,5 %24 juin 2026Auto-déclaré

Classement établi sur 8 modèles évalués. Score médian de l'ensemble : 84,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique une forte proportion de réponses correctes aux QCM et, dans le cadre précis d’EmbSpatialBench, une bonne maîtrise des six relations spatiales en perspective égocentrique. Il ne résume toutefois pas l’ensemble des capacités spatiales ou multimodales d’un modèle, puisque l’évaluation reste circonscrite à ce format, à cette perspective et à l’anglais.

Le classement apparaît très resserré : la médiane des huit modèles atteint 84 %, tandis que Qwen3.6-27B arrive en tête à 85 %. Cet écart limité suggère une différenciation faible au sommet et un possible effet de saturation, ce qui réduit la portée comparative de petites variations de score. La majorité des résultats étant auto-déclarés par les éditeurs, leur lecture exige davantage de prudence qu’une mesure indépendante appliquée dans un protocole commun. Enfin, l’accès public au benchmark expose à un risque de contamination des données d’entraînement ou d’ajustement. Le classement montre donc surtout une forte proximité entre les modèles évalués sur cette tâche ciblée, plutôt qu’une hiérarchie nettement tranchée.


Sources des scores : llm-stats.