RefSpatialBench

RefSpatialBench est un benchmark créé par la Beijing Academy of Artificial Intelligence (BAAI) pour évaluer la compréhension des références spatiales et leur ancrage dans des scènes réelles.

RefSpatialBench est un benchmark créé par la Beijing Academy of Artificial Intelligence (BAAI) pour évaluer la compréhension des références spatiales et leur ancrage dans des scènes réelles.

Il mesure la capacité des modèles à suivre un raisonnement spatial en plusieurs étapes, puis à désigner une cible sous la forme d’un point ou d’un masque à partir d’une instruction en anglais. Cette approche permet d’estimer des aptitudes utiles à la robotique, où l’interprétation précise des relations spatiales conditionne l’action.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBAAI (Beijing Academy of Artificial Intelligence)
Capacités mesuréesCompréhension et raisonnement spatial multi-étapes, ancrage (grounding) référentiel pour la robotique
ModalitéImage
Type de questionsréférence spatiale / pointage (prédiction d'un point ou d'un masque cible à partir d'une instruction)
Métrique d'évaluationtaux de succès / précision (success rate)
AccèsPublic
Languesanglais
Taille du jeu200 images réelles
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert70,0 %21 avril 2026Auto-déclaré
2Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert69,9 %22 septembre 2025Auto-déclaré
3Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert69,3 %24 février 2026Auto-déclaré
4Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert67,7 %24 février 2026Auto-déclaré
5Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert64,3 %16 avril 2026Auto-déclaré
6Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert63,5 %24 février 2026Auto-déclaré

Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 68,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle parvient fréquemment à interpréter correctement une instruction spatiale et à localiser la cible attendue. Cette mesure combine donc compréhension référentielle, raisonnement spatial multi-étapes et précision du pointage. La lecture des résultats demande toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre entièrement indépendant.

La portée reste circonscrite à 200 images réelles et à des instructions en anglais. Le caractère public du benchmark impose aussi une vigilance méthodologique face au risque de contamination, sans établir qu’une telle contamination a eu lieu. Les résultats ne signalent pas une saturation complète, le meilleur score atteignant 70 %. Le classement montre surtout une faible avance de Qwen3.6-27B sur la médiane des six modèles évalués, fixée à 68 %. Cet écart resserré suggère que le benchmark différencie peu le premier modèle de la performance centrale de l’ensemble, tout en laissant une marge de progression substantielle vers un taux de succès maximal.


Sources des scores : llm-stats.