Hypersim

Hypersim est un benchmark de vision créé par Apple en 2021 pour évaluer la compréhension holistique de scènes intérieures synthétiques photoréalistes. Il soumet les modèles à des tâches portant sur la profondeur, la géométrie 3D, la segmentation d’instances et le grounding spatial.

Hypersim est un benchmark de vision créé par Apple en 2021 pour évaluer la compréhension holistique de scènes intérieures synthétiques photoréalistes. Il soumet les modèles à des tâches portant sur la profondeur, la géométrie 3D, la segmentation d’instances et le grounding spatial.

Les évaluations s’effectuent notamment au niveau du pixel, à l’aide de métriques adaptées à la profondeur ou à la segmentation sémantique. Hypersim sert ainsi à mesurer la capacité d’un modèle à relier apparence visuelle, structure spatiale et organisation des objets dans un environnement intérieur contrôlé.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkApple
Capacités mesuréesCompréhension holistique de scènes intérieures synthétiques photoréalistes : profondeur, géométrie 3D, segmentation d'instances, grounding spatial
ModalitéImage
Type de questionstâche de vision (profondeur, segmentation, géométrie 3D par pixel)
Métrique d'évaluationmétriques de profondeur / segmentation sémantique (selon la tâche)
AccèsPublic
LanguesN/A (vision)
Taille du jeu77 400 images, 461 scènes intérieures
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1Qwen3.5-35B-A3BQwen13,1 %24 février 2026Auto-déclaré
2Qwen3.5-27BQwen13,0 %24 février 2026Auto-déclaré
3Qwen3.5-122B-A10BQwen12,7 %24 février 2026Auto-déclaré
4Qwen3 VL 235B A22B ThinkingQwen11,0 %22 septembre 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 12,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Hypersim traduit une meilleure performance selon les métriques propres à chaque tâche, notamment pour l’estimation de profondeur et la segmentation. Il indique une capacité accrue à interpréter la géométrie et l’organisation spatiale de scènes intérieures synthétiques, sans constituer une mesure générale des compétences visuelles dans d’autres environnements. La portée du benchmark reste centrée sur des images photoréalistes synthétiques et sur des analyses par pixel.

Dans la base, les scores sont majoritairement auto-déclarés par les éditeurs. Leur comparaison doit donc être considérée avec davantage de prudence qu’une évaluation intégralement mesurée selon un protocole indépendant et uniforme. L’accès public au jeu appelle aussi à la vigilance quant à une éventuelle exposition préalable des modèles, susceptible d’influencer les résultats.

Le classement couvre quatre modèles. Qwen3.5-35B-A3B atteint 13 %, soit également le score médian de l’ensemble. Ce niveau ne suggère pas une saturation élevée du benchmark. La proximité entre le meilleur résultat et la médiane limite toutefois le pouvoir discriminant du classement observé entre les modèles les mieux placés.


Sources des scores : llm-stats.