V*
V* est un benchmark de raisonnement visuel créé par Penghao Wu et Saining Xie, chercheurs à l’UC San Diego et à la New York University. Publié en 2023, il soumet les modèles multimodaux à des images haute résolution et visuellement denses.
V* est un benchmark de raisonnement visuel créé par Penghao Wu et Saining Xie, chercheurs à l’UC San Diego et à la New York University. Publié en 2023, il soumet les modèles multimodaux à des images haute résolution et visuellement denses.
Ses questions évaluent la reconnaissance d’attributs, la recherche visuelle guidée, la perception de détails fins et le raisonnement sur des relations spatiales. V* sert ainsi à mesurer la capacité d’un modèle à produire une réponse exacte en reliant des éléments visuels précis au sein de scènes complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Penghao Wu et Saining Xie (UC San Diego et New York University) |
| Capacités mesurées | Raisonnement visuel sur images haute resolution et visuellement denses, recherche visuelle guidee et perception de details fins. |
| Modalité | Multimodal |
| Type de questions | QA visuel (reconnaissance d'attributs et raisonnement sur relations spatiales) |
| Métrique d'évaluation | Exactitude (accuracy) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 191 images haute resolution (115 reconnaissance d'attributs + 76 raisonnement spatial) |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 96,9 % | 20 avril 2026 | Auto-déclaré |
| 2 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 96,9 % | 31 mars 2026 | Auto-déclaré |
| 3 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,7 % | 21 avril 2026 | Auto-déclaré |
| 4 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,7 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,2 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,7 % | 24 février 2026 | Auto-déclaré |
| 7 | GLM-5V-Turbo | Zhipu AI | 🔒 Propriétaire | 89,0 % | 2 avril 2026 | Auto-déclaré |
Classement établi sur 7 modèles évalués. Score médian de l'ensemble : 93,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur V* indique qu’un modèle répond correctement à une forte proportion de questions portant sur des attributs visuels ou des relations spatiales. Il reflète donc une bonne efficacité sur ces tâches ciblées, sans constituer une mesure générale de toutes les capacités multimodales. Le classement présente un niveau central déjà très élevé, avec une médiane de 94 %, tandis que Kimi K2.6 atteint 97 %. Cet écart réduit entre la médiane et le meilleur résultat suggère une saturation du benchmark parmi les sept modèles évalués, ce qui limite sa capacité à départager finement les systèmes les plus performants. La métrique d’exactitude offre un critère clair, mais la rigueur comparative dépend aussi de la provenance des résultats, ici majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un protocole indépendant commun. Le caractère public du jeu implique également un risque d’exposition préalable ou de contamination à prendre en compte. Enfin, sa portée reste circonscrite à 191 images, à des questions en anglais et à deux familles précises de raisonnement visuel.
Sources des scores : llm-stats.