SUNRGBD

SUNRGBD est un benchmark public consacré à la compréhension de scènes intérieures à partir d’images RGB-D. Publié en 2015 par Shuran Song, Samuel P. Lichtenberg et Jianxiong Xiao, de Princeton University, il associe informations visuelles et données de profondeur afin d’évaluer…

SUNRGBD est un benchmark public consacré à la compréhension de scènes intérieures à partir d’images RGB-D. Publié en 2015 par Shuran Song, Samuel P. Lichtenberg et Jianxiong Xiao, de Princeton University, il associe informations visuelles et données de profondeur afin d’évaluer l’interprétation tridimensionnelle d’un environnement.

Ses annotations servent à mesurer la perception 3D, le raisonnement spatial, la localisation, la détection et la segmentation d’objets, ainsi que l’estimation de la disposition d’une scène. SUNRGBD permet ainsi de comparer les capacités de modèles confrontés à plusieurs dimensions complémentaires de la compréhension spatiale.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkShuran Song, Samuel P. Lichtenberg et Jianxiong Xiao (Princeton University)
Capacités mesurées3D, raisonnement spatial, vision
ModalitéImage
Type de questionsimages RGB-D annotées pour des tâches de compréhension de scène, détection/segmentation d’objets et localisation 3D
Métrique d'évaluationvariable selon la tâche, notamment AP/mAP pour la détection 2D/3D et métriques de segmentation
AccèsPublic
Languesanglais (noms de catégories et annotations)
Taille du jeu10 335 images RGB-D
Année de publication2015
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1Qwen3.5-122B-A10BQwen36,2 %24 février 2026Auto-déclaré
2Qwen3.5-27BQwen35,4 %24 février 2026Auto-déclaré
3Qwen3 VL 235B A22B ThinkingQwen34,9 %22 septembre 2025Auto-déclaré
4Qwen3.5-35B-A3BQwen33,4 %24 février 2026Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 35,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur SUNRGBD traduit une meilleure capacité à identifier et segmenter les objets, à les localiser en trois dimensions et à restituer l’organisation spatiale d’une scène intérieure. Son interprétation dépend toutefois de la tâche évaluée, puisque les résultats peuvent reposer sur l’AP, la mAP ou des métriques de segmentation. La comparaison exige donc de tenir compte du protocole et de la métrique employés.

Dans la base, quatre modèles sont évalués et les résultats sont très resserrés autour du score médian de 35 %. Qwen3.5-122B-A10B arrive en tête à 36 %, soit un écart limité avec la médiane. Ce classement ne révèle donc pas de domination nette et reste peu discriminant sur cet échantillon. Les niveaux observés ne suggèrent pas une saturation proche du maximum, mais la proximité des scores réduit la portée des écarts. La fiabilité est également à nuancer, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante uniforme. Enfin, SUNRGBD reste centré sur les scènes intérieures RGB-D, avec des catégories et annotations en anglais. Son accès public appelle aussi à la prudence quant au risque d’exposition préalable des modèles aux données.


Sources des scores : llm-stats.