EmbSpatialBench
EmbSpatialBench est un benchmark conçu en 2024 par Mengfei Du et al., de l’Université Fudan. Il évalue la compréhension et le raisonnement spatial incarné des grands modèles vision-langage, à partir de relations spatiales observées selon une perspective égocentrique.
EmbSpatialBench est un benchmark conçu en 2024 par Mengfei Du et al., de l’Université Fudan. Il évalue la compréhension et le raisonnement spatial incarné des grands modèles vision-langage, à partir de relations spatiales observées selon une perspective égocentrique.
Les modèles répondent en anglais à des questions à choix multiples portant sur six relations spatiales. EmbSpatialBench sert ainsi à comparer leur capacité à interpréter une scène depuis le point de vue d’un agent et à raisonner correctement sur les positions relatives des éléments.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Université Fudan (Mengfei Du et al.) |
| Capacités mesurées | Compréhension et raisonnement spatial incarné (embodied) pour grands modèles vision-langage, 6 relations spatiales en perspective égocentrique |
| Modalité | Image |
| Type de questions | questions à choix multiples (QCM) sur relations spatiales |
| Métrique d'évaluation | exactitude (accuracy) sur QCM |
| Accès | Public |
| Langues | anglais |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,6 % | 21 avril 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,5 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,3 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,3 % | 16 avril 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 24 février 2026 | Auto-déclaré |
| 6 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 83,4 % | 24 juin 2026 | Auto-déclaré |
| 7 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,1 % | 24 février 2026 | Auto-déclaré |
| 8 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 82,5 % | 24 juin 2026 | Auto-déclaré |
Classement établi sur 8 modèles évalués. Score médian de l'ensemble : 84,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique une forte proportion de réponses correctes aux QCM et, dans le cadre précis d’EmbSpatialBench, une bonne maîtrise des six relations spatiales en perspective égocentrique. Il ne résume toutefois pas l’ensemble des capacités spatiales ou multimodales d’un modèle, puisque l’évaluation reste circonscrite à ce format, à cette perspective et à l’anglais.
Le classement apparaît très resserré : la médiane des huit modèles atteint 84 %, tandis que Qwen3.6-27B arrive en tête à 85 %. Cet écart limité suggère une différenciation faible au sommet et un possible effet de saturation, ce qui réduit la portée comparative de petites variations de score. La majorité des résultats étant auto-déclarés par les éditeurs, leur lecture exige davantage de prudence qu’une mesure indépendante appliquée dans un protocole commun. Enfin, l’accès public au benchmark expose à un risque de contamination des données d’entraînement ou d’ajustement. Le classement montre donc surtout une forte proximité entre les modèles évalués sur cette tâche ciblée, plutôt qu’une hiérarchie nettement tranchée.
Sources des scores : llm-stats.