SimpleVQA

SimpleVQA est un benchmark de questions-réponses visuelles créé par Xianfu Cheng et ses coauteurs en 2025. Il se concentre sur des requêtes simples, courtes et ancrées dans des connaissances factuelles, auxquelles les modèles doivent fournir une réponse ouverte concise.

SimpleVQA est un benchmark de questions-réponses visuelles créé par Xianfu Cheng et ses coauteurs en 2025. Il se concentre sur des requêtes simples, courtes et ancrées dans des connaissances factuelles, auxquelles les modèles doivent fournir une réponse ouverte concise.

Son objectif est d’évaluer la factualité multimodale, c’est-à-dire la capacité à interpréter une image, à mobiliser les connaissances pertinentes et à limiter les hallucinations. SimpleVQA sert ainsi à comparer les modèles sur une tâche ciblée, distincte des évaluations visuelles fondées sur des réponses longues ou des raisonnements complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkXianfu Cheng et al. (auteurs du papier SimpleVQA)
Capacités mesuréesFactualite multimodale : repondre a de courtes questions visuelles ancrees dans des connaissances factuelles, en limitant les hallucinations
ModalitéMultimodal
Type de questionsQuestions visuelles courtes a reponse factuelle (reponse ouverte courte)
Métrique d'évaluationLLM-as-judge (exactitude)
AccèsPublic
Taille du jeu~2 025 paires image-question-reponse, 9 categories de taches
Année de publication2025
RessourcesArticle scientifique

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire81,7 %31 mai 2026Auto-déclaré
2GLM-5V-TurboZhipu AI🔒 Propriétaire78,2 %2 avril 2026Auto-déclaré
3Seed 2.1 ProByteDance🔒 Propriétaire74,5 %24 juin 2026Auto-déclaré
4Muse SparkMeta🔒 Propriétaire71,3 %8 avril 2026Auto-déclaré
5Kimi K2.5Moonshot AI🟢 Ouvert71,2 %27 janvier 2026Auto-déclaré
6Seed 2.1 TurboByteDance🔒 Propriétaire71,1 %24 juin 2026Auto-déclaré
7Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire67,3 %31 mars 2026Auto-déclaré
8Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert61,7 %24 février 2026Auto-déclaré
9Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert61,3 %22 septembre 2025Auto-déclaré
10Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert58,9 %16 avril 2026Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert58,3 %24 février 2026Auto-déclaré
12Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert56,1 %21 avril 2026Auto-déclaré
13Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert56,0 %24 février 2026Auto-déclaré

Classement établi sur 13 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 67,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur SimpleVQA indique qu’un modèle répond correctement à une forte proportion de questions visuelles factuelles selon une évaluation LLM-as-judge. Il traduit donc une bonne maîtrise de requêtes multimodales simples et une capacité à éviter des réponses factuellement erronées dans ce cadre précis. La rigueur comparative doit toutefois être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt qu’obtenus dans une procédure indépendante uniforme.

Le classement montre un écart notable entre la médiane de 67 % et les 82 % de Qwen3.7-Plus, meilleur modèle recensé. Ce résultat suggère une marge de progression et ne correspond pas à une saturation complète du benchmark. La portée reste néanmoins circonscrite à de courtes réponses factuelles réparties entre neuf catégories, sans représenter l’ensemble des aptitudes multimodales. Enfin, l’accès public au jeu crée un risque de contamination ou d’exposition préalable lors de l’entraînement. Les écarts observés doivent donc être interprétés comme des performances sur SimpleVQA, et non comme une mesure générale de l’intelligence visuelle.


Sources des scores : llm-stats.