Hypersim
Hypersim est un benchmark de vision créé par Apple en 2021 pour évaluer la compréhension holistique de scènes intérieures synthétiques photoréalistes. Il soumet les modèles à des tâches portant sur la profondeur, la géométrie 3D, la segmentation d’instances et le grounding spatial.
Hypersim est un benchmark de vision créé par Apple en 2021 pour évaluer la compréhension holistique de scènes intérieures synthétiques photoréalistes. Il soumet les modèles à des tâches portant sur la profondeur, la géométrie 3D, la segmentation d’instances et le grounding spatial.
Les évaluations s’effectuent notamment au niveau du pixel, à l’aide de métriques adaptées à la profondeur ou à la segmentation sémantique. Hypersim sert ainsi à mesurer la capacité d’un modèle à relier apparence visuelle, structure spatiale et organisation des objets dans un environnement intérieur contrôlé.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Apple |
| Capacités mesurées | Compréhension holistique de scènes intérieures synthétiques photoréalistes : profondeur, géométrie 3D, segmentation d'instances, grounding spatial |
| Modalité | Image |
| Type de questions | tâche de vision (profondeur, segmentation, géométrie 3D par pixel) |
| Métrique d'évaluation | métriques de profondeur / segmentation sémantique (selon la tâche) |
| Accès | Public |
| Langues | N/A (vision) |
| Taille du jeu | 77 400 images, 461 scènes intérieures |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | Qwen3.5-35B-A3B | Qwen | 13,1 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Qwen | 13,0 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-122B-A10B | Qwen | 12,7 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3 VL 235B A22B Thinking | Qwen | 11,0 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 12,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Hypersim traduit une meilleure performance selon les métriques propres à chaque tâche, notamment pour l’estimation de profondeur et la segmentation. Il indique une capacité accrue à interpréter la géométrie et l’organisation spatiale de scènes intérieures synthétiques, sans constituer une mesure générale des compétences visuelles dans d’autres environnements. La portée du benchmark reste centrée sur des images photoréalistes synthétiques et sur des analyses par pixel.
Dans la base, les scores sont majoritairement auto-déclarés par les éditeurs. Leur comparaison doit donc être considérée avec davantage de prudence qu’une évaluation intégralement mesurée selon un protocole indépendant et uniforme. L’accès public au jeu appelle aussi à la vigilance quant à une éventuelle exposition préalable des modèles, susceptible d’influencer les résultats.
Le classement couvre quatre modèles. Qwen3.5-35B-A3B atteint 13 %, soit également le score médian de l’ensemble. Ce niveau ne suggère pas une saturation élevée du benchmark. La proximité entre le meilleur résultat et la médiane limite toutefois le pouvoir discriminant du classement observé entre les modèles les mieux placés.
Sources des scores : llm-stats.