ScreenSpot Pro

ScreenSpot Pro est un benchmark créé en 2025 par les auteurs ScreenSpot-Pro, Kaixin Li et al. Il évalue l’ancrage visuel dans des interfaces graphiques professionnelles en haute résolution, caractérisées par des éléments minuscules, nombreux et denses.

ScreenSpot Pro est un benchmark créé en 2025 par les auteurs ScreenSpot-Pro, Kaixin Li et al. Il évalue l’ancrage visuel dans des interfaces graphiques professionnelles en haute résolution, caractérisées par des éléments minuscules, nombreux et denses.

À partir d’une instruction en anglais et d’une capture d’écran authentique, un modèle doit localiser l’élément demandé. ScreenSpot Pro sert ainsi à mesurer la capacité des modèles multimodaux à percevoir et cibler précisément des composants d’interface dans des logiciels professionnels complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs ScreenSpot-Pro (Kaixin Li et al.)
Capacités mesuréesAncrage visuel d'interfaces GUI professionnelles haute resolution avec des elements minuscules et denses
ModalitéMultimodal
Type de questionsancrage GUI : prediction de la localisation d'un element a partir d'une instruction sur captures haute resolution
Métrique d'évaluationexactitude d'ancrage (clic/point correct dans la bounding box cible)
AccèsPublic
Languesanglais
Taille du jeu1 581 paires capture-instruction annotees par experts, 23 applications, 5 industries, 3 OS
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (23)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 4.8Anthropic🔒 Propriétaire87,9 %28 mai 2026Auto-déclaré
2GPT-5.2OpenAI🔒 Propriétaire86,3 %11 décembre 2025Auto-déclaré
3Muse SparkMeta🔒 Propriétaire84,1 %8 avril 2026Auto-déclaré
4Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire79,0 %31 mai 2026Auto-déclaré
5Gemini 3 ProGoogle🔒 Propriétaire72,7 %18 novembre 2025Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert70,4 %24 février 2026Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert70,3 %24 février 2026Auto-déclaré
8Gemini 3 FlashGoogle🔒 Propriétaire69,1 %17 décembre 2025Auto-déclaré
9Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert68,6 %24 février 2026Auto-déclaré
10Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire68,2 %31 mars 2026Auto-déclaré
11Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert62,0 %22 septembre 2025Auto-déclaré
12Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert61,8 %22 septembre 2025Auto-déclaré
13Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert60,5 %22 septembre 2025Auto-déclaré
14Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert59,5 %22 septembre 2025Auto-déclaré
15Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,9 %22 septembre 2025Auto-déclaré
16Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert57,3 %22 septembre 2025Auto-déclaré
17Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert57,1 %22 septembre 2025Auto-déclaré
18Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert54,6 %22 septembre 2025Auto-déclaré
19Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert49,2 %22 septembre 2025Auto-déclaré
20Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert46,6 %22 septembre 2025Auto-déclaré
21Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert43,6 %26 janvier 2025Auto-déclaré
22Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert39,4 %28 février 2025Auto-déclaré
23Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert29,0 %26 janvier 2025Auto-déclaré

Classement établi sur 23 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 61,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique que le modèle place fréquemment son clic, ou son point prédit, à l’intérieur de la boîte englobante de l’élément cible. Cette mesure évalue directement la précision de l’ancrage, mais pas l’exécution complète d’une tâche au-delà de cette localisation. Les annotations réalisées par des experts et les captures authentiques issues de plusieurs environnements professionnels renforcent la rigueur du jeu. En revanche, les scores recensés sont majoritairement auto-déclarés par les éditeurs, ce qui appelle à la prudence lors des comparaisons. Avec une médiane de 62 % parmi les 23 modèles évalués et un meilleur résultat de 88 % pour Claude Opus 4.8, le classement révèle un écart net entre la performance centrale et la tête, ainsi qu’une marge avant saturation. La portée reste circonscrite à l’ancrage GUI sur des instructions en anglais, dans les applications, industries et systèmes couverts. Enfin, l’accès public au benchmark rend pertinente une vigilance générale quant à une éventuelle exposition des modèles aux données d’évaluation.


Sources des scores : llm-stats.