InfoVQAtest

InfoVQAtest est un benchmark conçu en 2021 par Minesh Mathew et ses coauteurs du CVIT à l’IIIT Hyderabad et du CVC-UAB. Il repose sur des questions ouvertes à réponse courte associées à des images d’infographies en anglais.

InfoVQAtest est un benchmark conçu en 2021 par Minesh Mathew et ses coauteurs du CVIT à l’IIIT Hyderabad et du CVC-UAB. Il repose sur des questions ouvertes à réponse courte associées à des images d’infographies en anglais.

Il évalue la capacité des modèles à combiner compréhension de la mise en page, lecture de contenus textuels, interprétation d’éléments graphiques et de visualisations de données. Certaines réponses exigent aussi un raisonnement élémentaire ou un calcul simple, ce qui en fait un test conjoint de perception documentaire, d’extraction et de raisonnement.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMinesh Mathew et al. (CVIT, IIIT Hyderabad; CVC-UAB)
Capacités mesuréesmultimodal, vision
ModalitéMultimodal
Type de questionsquestions ouvertes à réponse courte sur images d’infographies
Métrique d'évaluationANLS (Average Normalized Levenshtein Similarity)
AccèsPublic
Languesanglais
Taille du jeuenviron 3 288 questions de test sur 579 infographies; 30 035 questions-réponses au total
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (12)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.5Moonshot AI🟢 Ouvert92,6 %27 janvier 2026Auto-déclaré
2Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert89,5 %22 septembre 2025Auto-déclaré
3Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,2 %22 septembre 2025Auto-déclaré
4Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert89,2 %22 septembre 2025Auto-déclaré
5Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert87,0 %22 septembre 2025Auto-déclaré
6Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert86,0 %22 septembre 2025Auto-déclaré
7Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert86,0 %22 septembre 2025Auto-déclaré
8Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,5 %29 août 2024Auto-déclaré
9Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,1 %22 septembre 2025Auto-déclaré
10Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert83,0 %22 septembre 2025Auto-déclaré
11Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,0 %22 septembre 2025Auto-déclaré
12Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,3 %22 septembre 2025Auto-déclaré

Classement établi sur 12 modèles évalués. Score médian de l'ensemble : 86,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score ANLS élevé indique que les réponses produites sont, en moyenne, très proches des réponses attendues selon une similarité de Levenshtein normalisée. Il traduit donc une bonne restitution d’informations issues des textes, diagrammes et données visuelles, ainsi qu’une capacité à effectuer les raisonnements courts requis. Il ne mesure toutefois que cette tâche ciblée, sur des infographies en anglais et des réponses courtes.

Les douze modèles recensés atteignent collectivement un niveau élevé, avec une médiane de 86 %. Kimi K2.5, développé par Moonshot AI, prend la tête à 93 %. Cet écart limité entre la médiane et le meilleur résultat suggère une différenciation relativement resserrée et un possible début de saturation pour les modèles les plus performants. Le caractère public du jeu appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, la comparaison doit rester prudente puisque les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que tous obtenus dans un protocole de mesure indépendant et homogène.


Sources des scores : llm-stats.