DocVQA

DocVQA est un benchmark de questions-réponses visuelles consacré aux images de documents. Créé par M. Mathew, D. Karatzas et R. Manmatha en 2020, il évalue la capacité des modèles à lire un document, à en comprendre le contenu et à repérer les informations utiles.

DocVQA est un benchmark de questions-réponses visuelles consacré aux images de documents. Créé par M. Mathew, D. Karatzas et R. Manmatha en 2020, il évalue la capacité des modèles à lire un document, à en comprendre le contenu et à repérer les informations utiles.

Son intérêt tient aussi à la prise en compte de la structure visuelle. Les modèles doivent exploiter la mise en page et effectuer une recherche d’information afin de produire des réponses courtes à des questions ouvertes. DocVQA sert ainsi à comparer les systèmes de compréhension documentaire multimodale.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkM. Mathew, D. Karatzas et R. Manmatha
Capacités mesuréesimage vers texte, multimodal, vision
ModalitéMultimodal
Type de questionsquestions ouvertes à réponse courte sur images de documents
Métrique d'évaluationANLS
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeuenviron 50 000 questions sur plus de 12 000 images de documents
Année de publication2020
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (26)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert96,4 %26 janvier 2025Auto-déclaré
2Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert95,7 %26 janvier 2025Auto-déclaré
3Claude 3.5 SonnetAnthropic🔒 Propriétaire95,2 %22 octobre 2024Auto-déclaré
4Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert95,2 %27 mars 2025Auto-déclaré
5Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert94,9 %20 juin 2025Auto-déclaré
6Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert94,8 %28 février 2025Auto-déclaré
7Llama 4 MaverickMeta🟢 Ouvert94,4 %5 avril 2025Auto-déclaré
8Llama 4 ScoutMeta🟢 Ouvert94,4 %5 avril 2025Auto-déclaré
9Grok-2xAI🔒 Propriétaire93,6 %13 août 2024Auto-déclaré
10Nova ProAmazon🔒 Propriétaire93,5 %20 novembre 2024Auto-déclaré
11DeepSeek VL2DeepSeek🟢 Ouvert93,3 %13 décembre 2024Auto-déclaré
12Pixtral LargeMistral AI🟢 Ouvert93,3 %18 novembre 2024Auto-déclaré
13Grok-2 minixAI🔒 Propriétaire93,2 %13 août 2024Auto-déclaré
14Phi-4-multimodal-instructMicrosoft🟢 Ouvert93,2 %1 février 2025Auto-déclaré
15GPT-4oOpenAI🔒 Propriétaire92,8 %27 mars 2025Auto-déclaré
16Nova LiteAmazon🔒 Propriétaire92,4 %20 novembre 2024Auto-déclaré
17DeepSeek VL2 SmallDeepSeek🟢 Ouvert92,3 %13 décembre 2024Auto-déclaré
18Pixtral-12BMistral AI🟢 Ouvert90,7 %17 septembre 2024Auto-déclaré
19Llama 3.2 90B InstructMeta🟢 Ouvert90,1 %25 septembre 2024Auto-déclaré
20DeepSeek VL2 TinyDeepSeek🟢 Ouvert88,9 %13 décembre 2024Auto-déclaré
21Llama 3.2 11B InstructMeta🟢 Ouvert88,4 %25 septembre 2024Auto-déclaré
22Gemma 3 12BGoogle🟢 Ouvert87,1 %12 mars 2025Auto-déclaré
23Gemma 3 27BGoogle🟢 Ouvert86,6 %12 mars 2025Auto-déclaré
24Grok-1.5xAI🔒 Propriétaire85,6 %28 mars 2024Auto-déclaré
25Grok-1.5VxAI🔒 Propriétaire85,6 %12 avril 2024Auto-déclaré
26Gemma 3 4BGoogle🟢 Ouvert75,8 %12 mars 2025Auto-déclaré

Classement établi sur 26 modèles évalués, dont 22 de grands éditeurs. Score médian de l'ensemble : 93,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score ANLS élevé indique qu’un modèle restitue avec précision les réponses attendues à partir du contenu et de l’organisation visuelle des documents. Dans la base, la médiane de 93 % et le meilleur résultat de 96 %, obtenu par Qwen2.5 VL 72B Instruct, montrent un classement très resserré parmi les 26 modèles évalués. Cet écart limité suggère une forme de saturation au sommet et réduit le pouvoir discriminant du benchmark entre les systèmes les plus performants. La rigueur de la comparaison doit toutefois être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le jeu de test privé, dont les réponses ne sont pas divulguées, limite l’exposition directe des résultats attendus et donc une forme de contamination. La portée reste ciblée sur des questions ouvertes à réponse courte, en anglais, portant sur des images de documents. Le classement reflète donc avant tout la lecture, l’exploitation de la mise en page et l’extraction d’informations dans ce cadre précis.


Sources des scores : llm-stats.