SimpleVQA
SimpleVQA est un benchmark de questions-réponses visuelles créé par Xianfu Cheng et ses coauteurs en 2025. Il se concentre sur des requêtes simples, courtes et ancrées dans des connaissances factuelles, auxquelles les modèles doivent fournir une réponse ouverte concise.
SimpleVQA est un benchmark de questions-réponses visuelles créé par Xianfu Cheng et ses coauteurs en 2025. Il se concentre sur des requêtes simples, courtes et ancrées dans des connaissances factuelles, auxquelles les modèles doivent fournir une réponse ouverte concise.
Son objectif est d’évaluer la factualité multimodale, c’est-à-dire la capacité à interpréter une image, à mobiliser les connaissances pertinentes et à limiter les hallucinations. SimpleVQA sert ainsi à comparer les modèles sur une tâche ciblée, distincte des évaluations visuelles fondées sur des réponses longues ou des raisonnements complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Xianfu Cheng et al. (auteurs du papier SimpleVQA) |
| Capacités mesurées | Factualite multimodale : repondre a de courtes questions visuelles ancrees dans des connaissances factuelles, en limitant les hallucinations |
| Modalité | Multimodal |
| Type de questions | Questions visuelles courtes a reponse factuelle (reponse ouverte courte) |
| Métrique d'évaluation | LLM-as-judge (exactitude) |
| Accès | Public |
| Taille du jeu | ~2 025 paires image-question-reponse, 9 categories de taches |
| Année de publication | 2025 |
| Ressources | Article scientifique |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 81,7 % | 31 mai 2026 | Auto-déclaré |
| 2 | GLM-5V-Turbo | Zhipu AI | 🔒 Propriétaire | 78,2 % | 2 avril 2026 | Auto-déclaré |
| 3 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 74,5 % | 24 juin 2026 | Auto-déclaré |
| 4 | Muse Spark | Meta | 🔒 Propriétaire | 71,3 % | 8 avril 2026 | Auto-déclaré |
| 5 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 71,2 % | 27 janvier 2026 | Auto-déclaré |
| 6 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 71,1 % | 24 juin 2026 | Auto-déclaré |
| 7 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 67,3 % | 31 mars 2026 | Auto-déclaré |
| 8 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,7 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,3 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,9 % | 16 avril 2026 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,3 % | 24 février 2026 | Auto-déclaré |
| 12 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,1 % | 21 avril 2026 | Auto-déclaré |
| 13 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,0 % | 24 février 2026 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 67,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur SimpleVQA indique qu’un modèle répond correctement à une forte proportion de questions visuelles factuelles selon une évaluation LLM-as-judge. Il traduit donc une bonne maîtrise de requêtes multimodales simples et une capacité à éviter des réponses factuellement erronées dans ce cadre précis. La rigueur comparative doit toutefois être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt qu’obtenus dans une procédure indépendante uniforme.
Le classement montre un écart notable entre la médiane de 67 % et les 82 % de Qwen3.7-Plus, meilleur modèle recensé. Ce résultat suggère une marge de progression et ne correspond pas à une saturation complète du benchmark. La portée reste néanmoins circonscrite à de courtes réponses factuelles réparties entre neuf catégories, sans représenter l’ensemble des aptitudes multimodales. Enfin, l’accès public au jeu crée un risque de contamination ou d’exposition préalable lors de l’entraînement. Les écarts observés doivent donc être interprétés comme des performances sur SimpleVQA, et non comme une mesure générale de l’intelligence visuelle.
Sources des scores : llm-stats.