DocVQAtest

DocVQAtest est un benchmark de Visual Question Answering appliqué aux images de documents. Publié en 2020 par Minesh Mathew, Dimosthenis Karatzas et C. V. Jawahar, il repose sur des questions ouvertes en anglais appelant des réponses courtes.

DocVQAtest est un benchmark de Visual Question Answering appliqué aux images de documents. Publié en 2020 par Minesh Mathew, Dimosthenis Karatzas et C. V. Jawahar, il repose sur des questions ouvertes en anglais appelant des réponses courtes.

Il évalue la capacité des modèles à lire et localiser du texte, puis à comprendre le contenu et la structure visuelle de documents scannés. Lettres, mémos, notes et rapports issus de l’UCSF Industry Documents Library servent ainsi à tester conjointement perception documentaire et compréhension du langage.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMinesh Mathew, Dimosthenis Karatzas et C. V. Jawahar
Capacités mesuréesmultimodal, vision
ModalitéMultimodal
Type de questionsquestions ouvertes à réponse courte sur images de documents
Métrique d'évaluationANLS (Average Normalized Levenshtein Similarity)
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeuenviron 5 188 questions dans le split test ; environ 50 000 questions au total sur plus de 12 000 images de documents
Année de publication2020
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert97,1 %22 septembre 2025Auto-déclaré
2Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert96,9 %22 septembre 2025Auto-déclaré
3Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert96,5 %29 août 2024Auto-déclaré
4Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert96,5 %22 septembre 2025Auto-déclaré
5Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert96,1 %22 septembre 2025Auto-déclaré
6Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert96,1 %22 septembre 2025Auto-déclaré
7Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert95,3 %22 septembre 2025Auto-déclaré
8Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert95,3 %22 septembre 2025Auto-déclaré
9Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert95,0 %22 septembre 2025Auto-déclaré
10Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert95,0 %22 septembre 2025Auto-déclaré
11Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert94,2 %22 septembre 2025Auto-déclaré

Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 96,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score ANLS élevé indique que les réponses produites sont très proches des réponses attendues selon une similarité de Levenshtein normalisée. Il traduit donc une bonne aptitude à extraire une réponse courte tout en reliant texte, mise en page et question. Le caractère privé du jeu de test, dont les réponses ne sont pas divulguées, renforce la rigueur du protocole. La lecture du classement reste toutefois prudente, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique indépendant.

Avec une médiane de 96 % parmi les onze modèles évalués et un meilleur résultat de 97 % pour Qwen3 VL 235B A22B Instruct, le classement apparaît fortement resserré. Cette proximité signale une saturation parmi les modèles présents dans la base et réduit le pouvoir discriminant du benchmark à ce niveau de performance. Sa portée demeure centrée sur des questions en anglais portant sur des documents scannés issus d’une collection et de catégories documentaires précises. DocVQAtest renseigne donc spécifiquement sur la compréhension visuelle de documents, sans résumer à lui seul les capacités générales d’un modèle.


Sources des scores : llm-stats.