VLMsAreBlind

VLMsAreBlind est un benchmark multimodal créé en 2024 par Anh Totti Nguyen et ses collaborateurs à Auburn University et à l’University of Alberta. Il examine les angles morts des modèles vision-langage au moyen de questions visuelles simples appelant des réponses courtes.

VLMsAreBlind est un benchmark multimodal créé en 2024 par Anh Totti Nguyen et ses collaborateurs à Auburn University et à l’University of Alberta. Il examine les angles morts des modèles vision-langage au moyen de questions visuelles simples appelant des réponses courtes.

La suite BlindTest regroupe des tâches géométriques triviales pour l’humain, comme reconnaître des cercles qui se chevauchent, des lignes qui se croisent, une lettre entourée ou compter des cercles. Elle sert à révéler la fragilité du raisonnement visuel derrière des scènes volontairement élémentaires.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuburn University et University of Alberta (Anh Totti Nguyen et al.)
Capacités mesuréesDétection des angles morts des VLM : tâches géométriques triviales pour l'humain (cercles qui se chevauchent, lignes qui se croisent, lettre entourée, comptage de cercles)
ModalitéMultimodal
Type de questionsquestions visuelles simples (réponse courte)
Métrique d'évaluationexactitude (accuracy)
AccèsPublic
Languesanglais (multimodal)
Taille du jeu7 tâches (suite BlindTest)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1Qwen3.5-35B-A3BQwen97,0 %24 février 2026Auto-déclaré
2Qwen3.6-27BQwen97,0 %21 avril 2026Auto-déclaré
3Qwen3.5-27BQwen96,9 %24 février 2026Auto-déclaré
4Qwen3.5-122B-A10BQwen96,7 %24 février 2026Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 97,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur VLMsAreBlind indique qu’un modèle répond correctement à des problèmes visuels élémentaires et évite les angles morts ciblés par la suite. Dans la base, la médiane atteint 97 %, soit également le score du meilleur modèle, Qwen3.5-35B-A3B. Cette concentration au sommet suggère une saturation du benchmark pour les modèles recensés et limite la capacité du classement à les départager finement. Le résultat met surtout en évidence la maîtrise de ces tâches précises, plutôt qu’une compétence visuelle générale.

L’interprétation doit aussi tenir compte de la fiabilité des résultats. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui leur confère une rigueur différente de mesures produites selon une évaluation indépendante et uniforme. L’accès public au benchmark crée par ailleurs un risque de contamination, susceptible de réduire la portée comparative des scores. Enfin, les sept tâches couvrent un périmètre volontairement étroit, centré sur quelques configurations géométriques simples. Le classement révèle donc principalement quels modèles résistent le mieux à ces tests ciblés, avec un faible pouvoir discriminant au niveau atteint.


Sources des scores : llm-stats.