InfoVQA

Créé par Minesh Mathew et al. en 2021, InfoVQA est un benchmark consacré à la compréhension d’infographies en anglais. Il repose sur des questions ouvertes à réponse courte associées à des images combinant textes, graphiques, données et organisation visuelle.

Créé par Minesh Mathew et al. en 2021, InfoVQA est un benchmark consacré à la compréhension d’infographies en anglais. Il repose sur des questions ouvertes à réponse courte associées à des images combinant textes, graphiques, données et organisation visuelle.

L’évaluation sollicite conjointement la lecture de texte, l’interprétation d’éléments graphiques, le raisonnement sur la mise en page et des calculs élémentaires. InfoVQA sert ainsi à mesurer la capacité des modèles à extraire et relier plusieurs formes d’information au sein de documents visuels complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMinesh Mathew et al.
Capacités mesuréesmultimodal, vision
ModalitéMultimodal
Type de questionsquestions ouvertes à réponse courte sur des images d'infographies
Métrique d'évaluationANLS
AccèsPublic
Languesanglais
Taille du jeuenviron 30 000 questions sur environ 5 000 images d'infographies
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,4 %28 février 2025Auto-déclaré
2Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,6 %26 janvier 2025Auto-déclaré
3DeepSeek VL2DeepSeek🟢 Ouvert78,1 %13 décembre 2024Auto-déclaré
4DeepSeek VL2 SmallDeepSeek🟢 Ouvert75,8 %13 décembre 2024Auto-déclaré
5Phi-4-multimodal-instructMicrosoft🟢 Ouvert72,7 %1 février 2025Auto-déclaré
6Gemma 3 27BGoogle🟢 Ouvert70,6 %12 mars 2025Auto-déclaré
7DeepSeek VL2 TinyDeepSeek🟢 Ouvert66,1 %13 décembre 2024Auto-déclaré
8Gemma 3 12BGoogle🟢 Ouvert64,9 %12 mars 2025Auto-déclaré
9Gemma 3 4BGoogle🟢 Ouvert50,0 %12 mars 2025Auto-déclaré

Classement établi sur 9 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 72,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score ANLS élevé indique qu’un modèle produit des réponses courtes proches des réponses attendues après avoir correctement combiné contenu textuel, structure du document, graphiques et données chiffrées. Il reflète donc une bonne performance sur les compétences conjointes ciblées par InfoVQA, sans constituer une mesure générale de toutes les capacités visuelles ou linguistiques d’un modèle.

Dans la base, neuf modèles atteignent un score médian de 73 %, tandis que Qwen2.5 VL 32B Instruct arrive en tête à 83 %. Cet écart montre que le benchmark conserve un pouvoir discriminant au sein de cet ensemble et ne paraît pas totalement saturé. Le classement met notamment en évidence l’avantage du modèle de Qwen sur les autres systèmes recensés pour ce type de compréhension documentaire.

La lecture comparative doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs. Leur rigueur dépend donc des conditions d’évaluation appliquées par chaque source. La portée du résultat reste en outre circonscrite aux infographies en anglais, aux réponses courtes et aux formes de raisonnement élémentaire couvertes par le jeu.


Sources des scores : llm-stats.