TextVQA

TextVQA est un benchmark conçu en 2019 par Amanpreet Singh et ses coauteurs, issus de Facebook AI Research et de Georgia Tech. Il évalue la capacité des modèles multimodaux à lire le texte visible dans une image, puis à raisonner sur ce contenu afin de répondre à une question visuelle.

TextVQA est un benchmark conçu en 2019 par Amanpreet Singh et ses coauteurs, issus de Facebook AI Research et de Georgia Tech. Il évalue la capacité des modèles multimodaux à lire le texte visible dans une image, puis à raisonner sur ce contenu afin de répondre à une question visuelle.

Le benchmark cible des questions ouvertes à réponse courte en anglais. Il comble le manque de questions fondées sur du texte dans les précédents jeux VQA et sert notamment à évaluer des systèmes destinés aux technologies d’assistance pour les personnes malvoyantes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAmanpreet Singh et al. (Facebook AI Research, Georgia Tech)
Capacités mesuréesimage vers texte, multimodal, vision
ModalitéMultimodal
Type de questionsquestions ouvertes à réponse courte sur des images
Métrique d'évaluationVQA accuracy
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeu45 336 questions sur 28 408 images
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (15)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,5 %29 août 2024Auto-déclaré
2Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,9 %26 janvier 2025Auto-déclaré
3Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert84,4 %27 mars 2025Auto-déclaré
4DeepSeek VL2DeepSeek🟢 Ouvert84,2 %13 décembre 2024Auto-déclaré
5DeepSeek VL2 SmallDeepSeek🟢 Ouvert83,4 %13 décembre 2024Auto-déclaré
6Nova ProAmazon🔒 Propriétaire81,5 %20 novembre 2024Auto-déclaré
7DeepSeek VL2 TinyDeepSeek🟢 Ouvert80,7 %13 décembre 2024Auto-déclaré
8Nova LiteAmazon🔒 Propriétaire80,2 %20 novembre 2024Auto-déclaré
9Grok-1.5VxAI🔒 Propriétaire78,1 %12 avril 2024Auto-déclaré
10Phi-4-multimodal-instructMicrosoft🟢 Ouvert75,6 %1 février 2025Auto-déclaré
11Llama 3.2 90B InstructMeta🟢 Ouvert73,5 %25 septembre 2024Auto-déclaré
12Phi-3.5-vision-instructMicrosoft🟢 Ouvert72,0 %23 août 2024Auto-déclaré
13Gemma 3 12BGoogle🟢 Ouvert67,7 %12 mars 2025Auto-déclaré
14Gemma 3 27BGoogle🟢 Ouvert65,1 %12 mars 2025Auto-déclaré
15Gemma 3 4BGoogle🟢 Ouvert57,8 %12 mars 2025Auto-déclaré

Classement établi sur 15 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 80,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur TextVQA indique qu’un modèle parvient fréquemment à combiner reconnaissance du texte dans l’image, compréhension de la question et raisonnement pour produire une réponse courte correcte. La VQA accuracy fournit une mesure commune, tandis que le caractère privé des réponses du jeu de test limite l’accès direct aux solutions attendues. La rigueur comparative reste toutefois à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant unique.

Parmi les 15 modèles évalués dans la base, Qwen2-VL-72B-Instruct arrive en tête avec 86 %, contre une médiane de 80 %. Cet écart relativement réduit suggère un classement déjà resserré dans sa partie haute et un risque de saturation progressive, qui peut rendre les différences moins discriminantes. Le test privé réduit le risque d’exposition directe aux réponses, sans suffire à écarter toute contamination liée au benchmark. Enfin, TextVQA mesure une compétence ciblée, sur des images et des questions courtes en anglais. Ses résultats ne résument donc pas l’ensemble des capacités multimodales d’un modèle.


Sources des scores : llm-stats.