InfoVQAtest
InfoVQAtest est un benchmark conçu en 2021 par Minesh Mathew et ses coauteurs du CVIT à l’IIIT Hyderabad et du CVC-UAB. Il repose sur des questions ouvertes à réponse courte associées à des images d’infographies en anglais.
InfoVQAtest est un benchmark conçu en 2021 par Minesh Mathew et ses coauteurs du CVIT à l’IIIT Hyderabad et du CVC-UAB. Il repose sur des questions ouvertes à réponse courte associées à des images d’infographies en anglais.
Il évalue la capacité des modèles à combiner compréhension de la mise en page, lecture de contenus textuels, interprétation d’éléments graphiques et de visualisations de données. Certaines réponses exigent aussi un raisonnement élémentaire ou un calcul simple, ce qui en fait un test conjoint de perception documentaire, d’extraction et de raisonnement.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Minesh Mathew et al. (CVIT, IIIT Hyderabad; CVC-UAB) |
| Capacités mesurées | multimodal, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes à réponse courte sur images d’infographies |
| Métrique d'évaluation | ANLS (Average Normalized Levenshtein Similarity) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 3 288 questions de test sur 579 infographies; 30 035 questions-réponses au total |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 92,6 % | 27 janvier 2026 | Auto-déclaré |
| 2 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,5 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,2 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,2 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,0 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,0 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,0 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,5 % | 29 août 2024 | Auto-déclaré |
| 9 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,1 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,0 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,0 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,3 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 12 modèles évalués. Score médian de l'ensemble : 86,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score ANLS élevé indique que les réponses produites sont, en moyenne, très proches des réponses attendues selon une similarité de Levenshtein normalisée. Il traduit donc une bonne restitution d’informations issues des textes, diagrammes et données visuelles, ainsi qu’une capacité à effectuer les raisonnements courts requis. Il ne mesure toutefois que cette tâche ciblée, sur des infographies en anglais et des réponses courtes.
Les douze modèles recensés atteignent collectivement un niveau élevé, avec une médiane de 86 %. Kimi K2.5, développé par Moonshot AI, prend la tête à 93 %. Cet écart limité entre la médiane et le meilleur résultat suggère une différenciation relativement resserrée et un possible début de saturation pour les modèles les plus performants. Le caractère public du jeu appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, la comparaison doit rester prudente puisque les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que tous obtenus dans un protocole de mesure indépendant et homogène.
Sources des scores : llm-stats.