InfoVQA
Créé par Minesh Mathew et al. en 2021, InfoVQA est un benchmark consacré à la compréhension d’infographies en anglais. Il repose sur des questions ouvertes à réponse courte associées à des images combinant textes, graphiques, données et organisation visuelle.
Créé par Minesh Mathew et al. en 2021, InfoVQA est un benchmark consacré à la compréhension d’infographies en anglais. Il repose sur des questions ouvertes à réponse courte associées à des images combinant textes, graphiques, données et organisation visuelle.
L’évaluation sollicite conjointement la lecture de texte, l’interprétation d’éléments graphiques, le raisonnement sur la mise en page et des calculs élémentaires. InfoVQA sert ainsi à mesurer la capacité des modèles à extraire et relier plusieurs formes d’information au sein de documents visuels complexes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Minesh Mathew et al. |
| Capacités mesurées | multimodal, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes à réponse courte sur des images d'infographies |
| Métrique d'évaluation | ANLS |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 30 000 questions sur environ 5 000 images d'infographies |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,4 % | 28 février 2025 | Auto-déclaré |
| 2 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,6 % | 26 janvier 2025 | Auto-déclaré |
| 3 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 78,1 % | 13 décembre 2024 | Auto-déclaré |
| 4 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 75,8 % | 13 décembre 2024 | Auto-déclaré |
| 5 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 72,7 % | 1 février 2025 | Auto-déclaré |
| 6 | Gemma 3 27B | 🟢 Ouvert | 70,6 % | 12 mars 2025 | Auto-déclaré | |
| 7 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 66,1 % | 13 décembre 2024 | Auto-déclaré |
| 8 | Gemma 3 12B | 🟢 Ouvert | 64,9 % | 12 mars 2025 | Auto-déclaré | |
| 9 | Gemma 3 4B | 🟢 Ouvert | 50,0 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 72,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score ANLS élevé indique qu’un modèle produit des réponses courtes proches des réponses attendues après avoir correctement combiné contenu textuel, structure du document, graphiques et données chiffrées. Il reflète donc une bonne performance sur les compétences conjointes ciblées par InfoVQA, sans constituer une mesure générale de toutes les capacités visuelles ou linguistiques d’un modèle.
Dans la base, neuf modèles atteignent un score médian de 73 %, tandis que Qwen2.5 VL 32B Instruct arrive en tête à 83 %. Cet écart montre que le benchmark conserve un pouvoir discriminant au sein de cet ensemble et ne paraît pas totalement saturé. Le classement met notamment en évidence l’avantage du modèle de Qwen sur les autres systèmes recensés pour ce type de compréhension documentaire.
La lecture comparative doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs. Leur rigueur dépend donc des conditions d’évaluation appliquées par chaque source. La portée du résultat reste en outre circonscrite aux infographies en anglais, aux réponses courtes et aux formes de raisonnement élémentaire couvertes par le jeu.
Sources des scores : llm-stats.