ScreenSpot Pro
ScreenSpot Pro est un benchmark créé en 2025 par les auteurs ScreenSpot-Pro, Kaixin Li et al. Il évalue l’ancrage visuel dans des interfaces graphiques professionnelles en haute résolution, caractérisées par des éléments minuscules, nombreux et denses.
ScreenSpot Pro est un benchmark créé en 2025 par les auteurs ScreenSpot-Pro, Kaixin Li et al. Il évalue l’ancrage visuel dans des interfaces graphiques professionnelles en haute résolution, caractérisées par des éléments minuscules, nombreux et denses.
À partir d’une instruction en anglais et d’une capture d’écran authentique, un modèle doit localiser l’élément demandé. ScreenSpot Pro sert ainsi à mesurer la capacité des modèles multimodaux à percevoir et cibler précisément des composants d’interface dans des logiciels professionnels complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs ScreenSpot-Pro (Kaixin Li et al.) |
| Capacités mesurées | Ancrage visuel d'interfaces GUI professionnelles haute resolution avec des elements minuscules et denses |
| Modalité | Multimodal |
| Type de questions | ancrage GUI : prediction de la localisation d'un element a partir d'une instruction sur captures haute resolution |
| Métrique d'évaluation | exactitude d'ancrage (clic/point correct dans la bounding box cible) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 1 581 paires capture-instruction annotees par experts, 23 applications, 5 industries, 3 OS |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (23)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 87,9 % | 28 mai 2026 | Auto-déclaré |
| 2 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 86,3 % | 11 décembre 2025 | Auto-déclaré |
| 3 | Muse Spark | Meta | 🔒 Propriétaire | 84,1 % | 8 avril 2026 | Auto-déclaré |
| 4 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 79,0 % | 31 mai 2026 | Auto-déclaré |
| 5 | Gemini 3 Pro | 🔒 Propriétaire | 72,7 % | 18 novembre 2025 | Auto-déclaré | |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,4 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,3 % | 24 février 2026 | Auto-déclaré |
| 8 | Gemini 3 Flash | 🔒 Propriétaire | 69,1 % | 17 décembre 2025 | Auto-déclaré | |
| 9 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,6 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 68,2 % | 31 mars 2026 | Auto-déclaré |
| 11 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,0 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,8 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,5 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,5 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,9 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,3 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,1 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,6 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,2 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,6 % | 22 septembre 2025 | Auto-déclaré |
| 21 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,6 % | 26 janvier 2025 | Auto-déclaré |
| 22 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 39,4 % | 28 février 2025 | Auto-déclaré |
| 23 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 29,0 % | 26 janvier 2025 | Auto-déclaré |
Classement établi sur 23 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 61,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique que le modèle place fréquemment son clic, ou son point prédit, à l’intérieur de la boîte englobante de l’élément cible. Cette mesure évalue directement la précision de l’ancrage, mais pas l’exécution complète d’une tâche au-delà de cette localisation. Les annotations réalisées par des experts et les captures authentiques issues de plusieurs environnements professionnels renforcent la rigueur du jeu. En revanche, les scores recensés sont majoritairement auto-déclarés par les éditeurs, ce qui appelle à la prudence lors des comparaisons. Avec une médiane de 62 % parmi les 23 modèles évalués et un meilleur résultat de 88 % pour Claude Opus 4.8, le classement révèle un écart net entre la performance centrale et la tête, ainsi qu’une marge avant saturation. La portée reste circonscrite à l’ancrage GUI sur des instructions en anglais, dans les applications, industries et systèmes couverts. Enfin, l’accès public au benchmark rend pertinente une vigilance générale quant à une éventuelle exposition des modèles aux données d’évaluation.
Sources des scores : llm-stats.