ScreenSpot
Créé par Kanzhi Cheng et al. en 2024, ScreenSpot est un benchmark de grounding visuel consacré aux interfaces graphiques. Il évalue la capacité d’un modèle multimodal ou d’un agent visuel à comprendre une capture d’écran et à localiser précisément l’élément désigné par une instruction en…
Créé par Kanzhi Cheng et al. en 2024, ScreenSpot est un benchmark de grounding visuel consacré aux interfaces graphiques. Il évalue la capacité d’un modèle multimodal ou d’un agent visuel à comprendre une capture d’écran et à localiser précisément l’élément désigné par une instruction en langage naturel.
Son jeu couvre des environnements mobiles, de bureau et web, issus notamment d’iOS, Android, macOS et Windows. Les éléments annotés comprennent du texte ainsi que des icônes ou widgets, afin de tester la compréhension visuelle d’interfaces réalistes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Kanzhi Cheng et al. |
| Capacités mesurées | ancrage factuel, multimodal, raisonnement spatial, vision |
| Modalité | Multimodal |
| Type de questions | tâches de grounding visuel d'interface graphique : localiser un élément à l'écran à partir d'une instruction en langage naturel |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 1 272 instructions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (16)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,8 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,7 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,4 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,4 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,7 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,7 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,4 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,0 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,6 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,9 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,5 % | 28 février 2025 | Auto-déclaré |
| 12 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 88,1 % | 2 décembre 2025 | Auto-déclaré |
| 13 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,1 % | 26 janvier 2025 | Auto-déclaré |
| 14 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 85,4 % | 2 décembre 2025 | Auto-déclaré |
| 15 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,7 % | 26 janvier 2025 | Auto-déclaré |
| 16 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 83,3 % | 2 décembre 2025 | Auto-déclaré |
Classement établi sur 16 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 93,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur ScreenSpot indique qu’un modèle localise correctement, dans une forte proportion des cas, l’élément demandé en anglais sur une capture d’écran. Cette performance reflète une aptitude au grounding visuel dans plusieurs familles d’interfaces, mais pas une évaluation générale de toutes les capacités d’un agent.
Le classement apparaît très resserré : la médiane des 16 modèles atteint 94 %, tandis que Qwen3 VL 32B Instruct arrive en tête à 96 %. Cet écart réduit suggère une saturation du benchmark parmi les modèles recensés et limite sa capacité à les départager finement. Le caractère public du jeu implique aussi de considérer un risque d’exposition préalable lors de l’interprétation des résultats, sans qu’il puisse être déduit des scores eux-mêmes. Enfin, la portée reste circonscrite à environ 1 272 instructions de localisation en anglais, couvrant des éléments textuels et des icônes ou widgets. La plupart des scores étant auto-déclarés par les éditeurs, leur comparaison offre une indication utile, mais une rigueur moins homogène qu’une mesure indépendante appliquée selon un protocole commun.
Sources des scores : llm-stats.