V*

V* est un benchmark de raisonnement visuel créé par Penghao Wu et Saining Xie, chercheurs à l’UC San Diego et à la New York University. Publié en 2023, il soumet les modèles multimodaux à des images haute résolution et visuellement denses.

V* est un benchmark de raisonnement visuel créé par Penghao Wu et Saining Xie, chercheurs à l’UC San Diego et à la New York University. Publié en 2023, il soumet les modèles multimodaux à des images haute résolution et visuellement denses.

Ses questions évaluent la reconnaissance d’attributs, la recherche visuelle guidée, la perception de détails fins et le raisonnement sur des relations spatiales. V* sert ainsi à mesurer la capacité d’un modèle à produire une réponse exacte en reliant des éléments visuels précis au sein de scènes complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkPenghao Wu et Saining Xie (UC San Diego et New York University)
Capacités mesuréesRaisonnement visuel sur images haute resolution et visuellement denses, recherche visuelle guidee et perception de details fins.
ModalitéMultimodal
Type de questionsQA visuel (reconnaissance d'attributs et raisonnement sur relations spatiales)
Métrique d'évaluationExactitude (accuracy)
AccèsPublic
LanguesAnglais
Taille du jeu191 images haute resolution (115 reconnaissance d'attributs + 76 raisonnement spatial)
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.6Moonshot AI🟢 Ouvert96,9 %20 avril 2026Auto-déclaré
2Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire96,9 %31 mars 2026Auto-déclaré
3Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert94,7 %21 avril 2026Auto-déclaré
4Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert93,7 %24 février 2026Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert93,2 %24 février 2026Auto-déclaré
6Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert92,7 %24 février 2026Auto-déclaré
7GLM-5V-TurboZhipu AI🔒 Propriétaire89,0 %2 avril 2026Auto-déclaré

Classement établi sur 7 modèles évalués. Score médian de l'ensemble : 93,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur V* indique qu’un modèle répond correctement à une forte proportion de questions portant sur des attributs visuels ou des relations spatiales. Il reflète donc une bonne efficacité sur ces tâches ciblées, sans constituer une mesure générale de toutes les capacités multimodales. Le classement présente un niveau central déjà très élevé, avec une médiane de 94 %, tandis que Kimi K2.6 atteint 97 %. Cet écart réduit entre la médiane et le meilleur résultat suggère une saturation du benchmark parmi les sept modèles évalués, ce qui limite sa capacité à départager finement les systèmes les plus performants. La métrique d’exactitude offre un critère clair, mais la rigueur comparative dépend aussi de la provenance des résultats, ici majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un protocole indépendant commun. Le caractère public du jeu implique également un risque d’exposition préalable ou de contamination à prendre en compte. Enfin, sa portée reste circonscrite à 191 images, à des questions en anglais et à deux familles précises de raisonnement visuel.


Sources des scores : llm-stats.