DocVQA
DocVQA est un benchmark de questions-réponses visuelles consacré aux images de documents. Créé par M. Mathew, D. Karatzas et R. Manmatha en 2020, il évalue la capacité des modèles à lire un document, à en comprendre le contenu et à repérer les informations utiles.
DocVQA est un benchmark de questions-réponses visuelles consacré aux images de documents. Créé par M. Mathew, D. Karatzas et R. Manmatha en 2020, il évalue la capacité des modèles à lire un document, à en comprendre le contenu et à repérer les informations utiles.
Son intérêt tient aussi à la prise en compte de la structure visuelle. Les modèles doivent exploiter la mise en page et effectuer une recherche d’information afin de produire des réponses courtes à des questions ouvertes. DocVQA sert ainsi à comparer les systèmes de compréhension documentaire multimodale.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | M. Mathew, D. Karatzas et R. Manmatha |
| Capacités mesurées | image vers texte, multimodal, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes à réponse courte sur images de documents |
| Métrique d'évaluation | ANLS |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | environ 50 000 questions sur plus de 12 000 images de documents |
| Année de publication | 2020 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (26)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 96,4 % | 26 janvier 2025 | Auto-déclaré |
| 2 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,7 % | 26 janvier 2025 | Auto-déclaré |
| 3 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 95,2 % | 22 octobre 2024 | Auto-déclaré |
| 4 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,2 % | 27 mars 2025 | Auto-déclaré |
| 5 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 94,9 % | 20 juin 2025 | Auto-déclaré |
| 6 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,8 % | 28 février 2025 | Auto-déclaré |
| 7 | Llama 4 Maverick | Meta | 🟢 Ouvert | 94,4 % | 5 avril 2025 | Auto-déclaré |
| 8 | Llama 4 Scout | Meta | 🟢 Ouvert | 94,4 % | 5 avril 2025 | Auto-déclaré |
| 9 | Grok-2 | xAI | 🔒 Propriétaire | 93,6 % | 13 août 2024 | Auto-déclaré |
| 10 | Nova Pro | Amazon | 🔒 Propriétaire | 93,5 % | 20 novembre 2024 | Auto-déclaré |
| 11 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 93,3 % | 13 décembre 2024 | Auto-déclaré |
| 12 | Pixtral Large | Mistral AI | 🟢 Ouvert | 93,3 % | 18 novembre 2024 | Auto-déclaré |
| 13 | Grok-2 mini | xAI | 🔒 Propriétaire | 93,2 % | 13 août 2024 | Auto-déclaré |
| 14 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 93,2 % | 1 février 2025 | Auto-déclaré |
| 15 | GPT-4o | OpenAI | 🔒 Propriétaire | 92,8 % | 27 mars 2025 | Auto-déclaré |
| 16 | Nova Lite | Amazon | 🔒 Propriétaire | 92,4 % | 20 novembre 2024 | Auto-déclaré |
| 17 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 92,3 % | 13 décembre 2024 | Auto-déclaré |
| 18 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 90,7 % | 17 septembre 2024 | Auto-déclaré |
| 19 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 90,1 % | 25 septembre 2024 | Auto-déclaré |
| 20 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 88,9 % | 13 décembre 2024 | Auto-déclaré |
| 21 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 88,4 % | 25 septembre 2024 | Auto-déclaré |
| 22 | Gemma 3 12B | 🟢 Ouvert | 87,1 % | 12 mars 2025 | Auto-déclaré | |
| 23 | Gemma 3 27B | 🟢 Ouvert | 86,6 % | 12 mars 2025 | Auto-déclaré | |
| 24 | Grok-1.5 | xAI | 🔒 Propriétaire | 85,6 % | 28 mars 2024 | Auto-déclaré |
| 25 | Grok-1.5V | xAI | 🔒 Propriétaire | 85,6 % | 12 avril 2024 | Auto-déclaré |
| 26 | Gemma 3 4B | 🟢 Ouvert | 75,8 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 26 modèles évalués, dont 22 de grands éditeurs. Score médian de l'ensemble : 93,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score ANLS élevé indique qu’un modèle restitue avec précision les réponses attendues à partir du contenu et de l’organisation visuelle des documents. Dans la base, la médiane de 93 % et le meilleur résultat de 96 %, obtenu par Qwen2.5 VL 72B Instruct, montrent un classement très resserré parmi les 26 modèles évalués. Cet écart limité suggère une forme de saturation au sommet et réduit le pouvoir discriminant du benchmark entre les systèmes les plus performants. La rigueur de la comparaison doit toutefois être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le jeu de test privé, dont les réponses ne sont pas divulguées, limite l’exposition directe des résultats attendus et donc une forme de contamination. La portée reste ciblée sur des questions ouvertes à réponse courte, en anglais, portant sur des images de documents. Le classement reflète donc avant tout la lecture, l’exploitation de la mise en page et l’extraction d’informations dans ce cadre précis.
Sources des scores : llm-stats.