TextVQA
TextVQA est un benchmark conçu en 2019 par Amanpreet Singh et ses coauteurs, issus de Facebook AI Research et de Georgia Tech. Il évalue la capacité des modèles multimodaux à lire le texte visible dans une image, puis à raisonner sur ce contenu afin de répondre à une question visuelle.
TextVQA est un benchmark conçu en 2019 par Amanpreet Singh et ses coauteurs, issus de Facebook AI Research et de Georgia Tech. Il évalue la capacité des modèles multimodaux à lire le texte visible dans une image, puis à raisonner sur ce contenu afin de répondre à une question visuelle.
Le benchmark cible des questions ouvertes à réponse courte en anglais. Il comble le manque de questions fondées sur du texte dans les précédents jeux VQA et sert notamment à évaluer des systèmes destinés aux technologies d’assistance pour les personnes malvoyantes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Amanpreet Singh et al. (Facebook AI Research, Georgia Tech) |
| Capacités mesurées | image vers texte, multimodal, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes à réponse courte sur des images |
| Métrique d'évaluation | VQA accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | 45 336 questions sur 28 408 images |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,5 % | 29 août 2024 | Auto-déclaré |
| 2 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,9 % | 26 janvier 2025 | Auto-déclaré |
| 3 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,4 % | 27 mars 2025 | Auto-déclaré |
| 4 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 84,2 % | 13 décembre 2024 | Auto-déclaré |
| 5 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 83,4 % | 13 décembre 2024 | Auto-déclaré |
| 6 | Nova Pro | Amazon | 🔒 Propriétaire | 81,5 % | 20 novembre 2024 | Auto-déclaré |
| 7 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 80,7 % | 13 décembre 2024 | Auto-déclaré |
| 8 | Nova Lite | Amazon | 🔒 Propriétaire | 80,2 % | 20 novembre 2024 | Auto-déclaré |
| 9 | Grok-1.5V | xAI | 🔒 Propriétaire | 78,1 % | 12 avril 2024 | Auto-déclaré |
| 10 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 75,6 % | 1 février 2025 | Auto-déclaré |
| 11 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 73,5 % | 25 septembre 2024 | Auto-déclaré |
| 12 | Phi-3.5-vision-instruct | Microsoft | 🟢 Ouvert | 72,0 % | 23 août 2024 | Auto-déclaré |
| 13 | Gemma 3 12B | 🟢 Ouvert | 67,7 % | 12 mars 2025 | Auto-déclaré | |
| 14 | Gemma 3 27B | 🟢 Ouvert | 65,1 % | 12 mars 2025 | Auto-déclaré | |
| 15 | Gemma 3 4B | 🟢 Ouvert | 57,8 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 15 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 80,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur TextVQA indique qu’un modèle parvient fréquemment à combiner reconnaissance du texte dans l’image, compréhension de la question et raisonnement pour produire une réponse courte correcte. La VQA accuracy fournit une mesure commune, tandis que le caractère privé des réponses du jeu de test limite l’accès direct aux solutions attendues. La rigueur comparative reste toutefois à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant unique.
Parmi les 15 modèles évalués dans la base, Qwen2-VL-72B-Instruct arrive en tête avec 86 %, contre une médiane de 80 %. Cet écart relativement réduit suggère un classement déjà resserré dans sa partie haute et un risque de saturation progressive, qui peut rendre les différences moins discriminantes. Le test privé réduit le risque d’exposition directe aux réponses, sans suffire à écarter toute contamination liée au benchmark. Enfin, TextVQA mesure une compétence ciblée, sur des images et des questions courtes en anglais. Ses résultats ne résument donc pas l’ensemble des capacités multimodales d’un modèle.
Sources des scores : llm-stats.