BLINK

Créé par Zeyi Fu et ses coauteurs en 2024, BLINK est un benchmark consacré aux capacités fondamentales de perception visuelle des modèles multimodaux. Il transforme des tâches classiques de vision par ordinateur en QCM associés à une ou plusieurs images, parfois accompagnées…

Créé par Zeyi Fu et ses coauteurs en 2024, BLINK est un benchmark consacré aux capacités fondamentales de perception visuelle des modèles multimodaux. Il transforme des tâches classiques de vision par ordinateur en QCM associés à une ou plusieurs images, parfois accompagnées d’incitations visuelles.

Son évaluation couvre notamment la profondeur relative, les correspondances visuelles, la localisation, le comptage, le raisonnement spatial et multi-vues, ainsi que la détection forensique. BLINK sert ainsi à distinguer la simple lecture d’images d’une perception visuelle suffisamment précise pour résoudre des problèmes intuitifs pour les humains.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkZeyi Fu et al.
Capacités mesurées3D, multimodal, raisonnement, raisonnement spatial, vision
ModalitéMultimodal
Type de questionsQCM multimodaux avec une ou plusieurs images
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu3 807 questions
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 ProByteDance🔒 Propriétaire81,4 %24 juin 2026Auto-déclaré
2Seed 2.1 TurboByteDance🔒 Propriétaire79,4 %24 juin 2026Auto-déclaré
3Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,7 %22 septembre 2025Auto-déclaré
4Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert69,1 %22 septembre 2025Auto-déclaré
5Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert68,7 %22 septembre 2025Auto-déclaré
6Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert68,5 %22 septembre 2025Auto-déclaré
7Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,7 %22 septembre 2025Auto-déclaré
8Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,3 %22 septembre 2025Auto-déclaré
9Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert67,1 %22 septembre 2025Auto-déclaré
10Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert65,8 %22 septembre 2025Auto-déclaré
11Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert65,4 %22 septembre 2025Auto-déclaré
12Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert63,4 %22 septembre 2025Auto-déclaré
13Phi-4-multimodal-instructMicrosoft🟢 Ouvert61,3 %1 février 2025Auto-déclaré

Classement établi sur 13 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 67,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BLINK indique qu’un modèle répond correctement à une large part de questions portant sur plusieurs dimensions centrales de la perception visuelle. Il traduit donc une aptitude à exploiter les images pour comparer des profondeurs, repérer ou compter des objets, établir des correspondances et raisonner dans l’espace ou entre plusieurs vues. L’accuracy fournit une mesure directe, mais les résultats de la base sont majoritairement auto-déclarés par les éditeurs. Leur comparaison offre ainsi moins de garanties qu’une évaluation entièrement reproduite selon un protocole indépendant.

Avec une médiane de 68 % sur treize modèles et un meilleur résultat de 81 % pour Seed 2.1 Pro, le classement montre un écart notable entre le niveau central et la tête, sans indiquer une saturation complète du benchmark. Son accès public impose néanmoins de considérer le risque d’exposition préalable aux questions lors de l’interprétation des scores. Sa portée reste ciblée sur des QCM multimodaux en anglais et sur les capacités visuelles couvertes par ses tâches. Le classement renseigne donc sur ce périmètre précis, plutôt que sur l’ensemble des compétences d’un modèle multimodal.


Sources des scores : llm-stats.