ChartQA

ChartQA est un benchmark créé par Ahmed Masry et ses coauteurs en 2022 pour évaluer la compréhension de graphiques par les modèles d’intelligence artificielle. Il repose sur des questions ouvertes à réponse courte, formulées en anglais, dont les réponses peuvent être textuelles ou…

ChartQA est un benchmark créé par Ahmed Masry et ses coauteurs en 2022 pour évaluer la compréhension de graphiques par les modèles d’intelligence artificielle. Il repose sur des questions ouvertes à réponse courte, formulées en anglais, dont les réponses peuvent être textuelles ou numériques.

Le benchmark mesure conjointement le raisonnement visuel, numérique et logique nécessaire pour extraire et interpréter les informations présentées dans un graphique. Il sert ainsi à comparer la capacité des modèles à relier perception visuelle et production d’une réponse précise.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAhmed Masry et al.
Capacités mesuréesmultimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsquestions ouvertes à réponse courte sur des graphiques, avec réponses textuelles ou numériques
Métrique d'évaluationrelaxed accuracy / exact match avec tolérance pour les réponses numériques
AccèsPublic
Languesanglais
Taille du jeuenviron 32,7K questions-réponses, dont 9,6K questions rédigées par des humains et 23,1K générées à partir de résumés de graphiques
Année de publication2022
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (24)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude 3.5 SonnetAnthropic🔒 Propriétaire90,8 %22 octobre 2024Auto-déclaré
2Llama 4 MaverickMeta🟢 Ouvert90,0 %5 avril 2025Auto-déclaré
3Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,5 %26 janvier 2025Auto-déclaré
4Nova ProAmazon🔒 Propriétaire89,2 %20 novembre 2024Auto-déclaré
5Llama 4 ScoutMeta🟢 Ouvert88,8 %5 avril 2025Auto-déclaré
6Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,3 %29 août 2024Auto-déclaré
7Pixtral LargeMistral AI🟢 Ouvert88,1 %18 novembre 2024Auto-déclaré
8Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert87,4 %20 juin 2025Auto-déclaré
9Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert87,3 %26 janvier 2025Auto-déclaré
10Nova LiteAmazon🔒 Propriétaire86,8 %20 novembre 2024Auto-déclaré
11DeepSeek VL2DeepSeek🟢 Ouvert86,0 %13 décembre 2024Auto-déclaré
12GPT-4oOpenAI🔒 Propriétaire85,7 %27 mars 2025Auto-déclaré
13Llama 3.2 90B InstructMeta🟢 Ouvert85,5 %25 septembre 2024Auto-déclaré
14Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert85,3 %27 mars 2025Auto-déclaré
15DeepSeek VL2 SmallDeepSeek🟢 Ouvert84,5 %13 décembre 2024Auto-déclaré
16Llama 3.2 11B InstructMeta🟢 Ouvert83,4 %25 septembre 2024Auto-déclaré
17Phi-3.5-vision-instructMicrosoft🟢 Ouvert81,8 %23 août 2024Auto-déclaré
18Pixtral-12BMistral AI🟢 Ouvert81,8 %17 septembre 2024Auto-déclaré
19Phi-4-multimodal-instructMicrosoft🟢 Ouvert81,4 %1 février 2025Auto-déclaré
20DeepSeek VL2 TinyDeepSeek🟢 Ouvert81,0 %13 décembre 2024Auto-déclaré
21Gemma 3 27BGoogle🟢 Ouvert78,0 %12 mars 2025Auto-déclaré
22Grok-1.5VxAI🔒 Propriétaire76,1 %12 avril 2024Auto-déclaré
23Gemma 3 12BGoogle🟢 Ouvert75,7 %12 mars 2025Auto-déclaré
24Gemma 3 4BGoogle🟢 Ouvert68,8 %12 mars 2025Auto-déclaré

Classement établi sur 24 modèles évalués, dont 20 de grands éditeurs. Score médian de l'ensemble : 85,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur ChartQA indique qu’un modèle répond correctement à une forte proportion de questions portant sur des graphiques, y compris lorsque la résolution exige des opérations numériques ou un raisonnement logique. La métrique combine exact match et relaxed accuracy, avec une tolérance pour les réponses numériques, ce qui limite la pénalisation de petits écarts de formulation ou de valeur. La lecture du classement appelle toutefois à la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. Avec une médiane de 86 % parmi 24 modèles et un meilleur résultat de 91 % pour Claude 3.5 Sonnet, l’écart entre le niveau central et la tête reste réduit. Cette concentration suggère une capacité de différenciation limitée parmi les modèles les plus performants, compatible avec un effet de saturation. L’accès public peut aussi créer un risque de contamination lors de l’entraînement. Enfin, la portée demeure ciblée sur des graphiques, des questions courtes et l’anglais, sans représenter l’ensemble des aptitudes de raisonnement d’un modèle.


Sources des scores : llm-stats.