BLINK
Créé par Zeyi Fu et ses coauteurs en 2024, BLINK est un benchmark consacré aux capacités fondamentales de perception visuelle des modèles multimodaux. Il transforme des tâches classiques de vision par ordinateur en QCM associés à une ou plusieurs images, parfois accompagnées…
Créé par Zeyi Fu et ses coauteurs en 2024, BLINK est un benchmark consacré aux capacités fondamentales de perception visuelle des modèles multimodaux. Il transforme des tâches classiques de vision par ordinateur en QCM associés à une ou plusieurs images, parfois accompagnées d’incitations visuelles.
Son évaluation couvre notamment la profondeur relative, les correspondances visuelles, la localisation, le comptage, le raisonnement spatial et multi-vues, ainsi que la détection forensique. BLINK sert ainsi à distinguer la simple lecture d’images d’une perception visuelle suffisamment précise pour résoudre des problèmes intuitifs pour les humains.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Zeyi Fu et al. |
| Capacités mesurées | 3D, multimodal, raisonnement, raisonnement spatial, vision |
| Modalité | Multimodal |
| Type de questions | QCM multimodaux avec une ou plusieurs images |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 3 807 questions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 81,4 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 79,4 % | 24 juin 2026 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,7 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,1 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,7 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,5 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,7 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,3 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,1 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,8 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,4 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,4 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 61,3 % | 1 février 2025 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 67,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BLINK indique qu’un modèle répond correctement à une large part de questions portant sur plusieurs dimensions centrales de la perception visuelle. Il traduit donc une aptitude à exploiter les images pour comparer des profondeurs, repérer ou compter des objets, établir des correspondances et raisonner dans l’espace ou entre plusieurs vues. L’accuracy fournit une mesure directe, mais les résultats de la base sont majoritairement auto-déclarés par les éditeurs. Leur comparaison offre ainsi moins de garanties qu’une évaluation entièrement reproduite selon un protocole indépendant.
Avec une médiane de 68 % sur treize modèles et un meilleur résultat de 81 % pour Seed 2.1 Pro, le classement montre un écart notable entre le niveau central et la tête, sans indiquer une saturation complète du benchmark. Son accès public impose néanmoins de considérer le risque d’exposition préalable aux questions lors de l’interprétation des scores. Sa portée reste ciblée sur des QCM multimodaux en anglais et sur les capacités visuelles couvertes par ses tâches. Le classement renseigne donc sur ce périmètre précis, plutôt que sur l’ensemble des compétences d’un modèle multimodal.
Sources des scores : llm-stats.