DocVQAtest
DocVQAtest est un benchmark de Visual Question Answering appliqué aux images de documents. Publié en 2020 par Minesh Mathew, Dimosthenis Karatzas et C. V. Jawahar, il repose sur des questions ouvertes en anglais appelant des réponses courtes.
DocVQAtest est un benchmark de Visual Question Answering appliqué aux images de documents. Publié en 2020 par Minesh Mathew, Dimosthenis Karatzas et C. V. Jawahar, il repose sur des questions ouvertes en anglais appelant des réponses courtes.
Il évalue la capacité des modèles à lire et localiser du texte, puis à comprendre le contenu et la structure visuelle de documents scannés. Lettres, mémos, notes et rapports issus de l’UCSF Industry Documents Library servent ainsi à tester conjointement perception documentaire et compréhension du langage.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Minesh Mathew, Dimosthenis Karatzas et C. V. Jawahar |
| Capacités mesurées | multimodal, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes à réponse courte sur images de documents |
| Métrique d'évaluation | ANLS (Average Normalized Levenshtein Similarity) |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | environ 5 188 questions dans le split test ; environ 50 000 questions au total sur plus de 12 000 images de documents |
| Année de publication | 2020 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 97,1 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 96,9 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 96,5 % | 29 août 2024 | Auto-déclaré |
| 4 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 96,5 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 96,1 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 96,1 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,3 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,3 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,0 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,0 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,2 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 96,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score ANLS élevé indique que les réponses produites sont très proches des réponses attendues selon une similarité de Levenshtein normalisée. Il traduit donc une bonne aptitude à extraire une réponse courte tout en reliant texte, mise en page et question. Le caractère privé du jeu de test, dont les réponses ne sont pas divulguées, renforce la rigueur du protocole. La lecture du classement reste toutefois prudente, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique indépendant.
Avec une médiane de 96 % parmi les onze modèles évalués et un meilleur résultat de 97 % pour Qwen3 VL 235B A22B Instruct, le classement apparaît fortement resserré. Cette proximité signale une saturation parmi les modèles présents dans la base et réduit le pouvoir discriminant du benchmark à ce niveau de performance. Sa portée demeure centrée sur des questions en anglais portant sur des documents scannés issus d’une collection et de catégories documentaires précises. DocVQAtest renseigne donc spécifiquement sur la compréhension visuelle de documents, sans résumer à lui seul les capacités générales d’un modèle.
Sources des scores : llm-stats.