ChartQA
ChartQA est un benchmark créé par Ahmed Masry et ses coauteurs en 2022 pour évaluer la compréhension de graphiques par les modèles d’intelligence artificielle. Il repose sur des questions ouvertes à réponse courte, formulées en anglais, dont les réponses peuvent être textuelles ou…
ChartQA est un benchmark créé par Ahmed Masry et ses coauteurs en 2022 pour évaluer la compréhension de graphiques par les modèles d’intelligence artificielle. Il repose sur des questions ouvertes à réponse courte, formulées en anglais, dont les réponses peuvent être textuelles ou numériques.
Le benchmark mesure conjointement le raisonnement visuel, numérique et logique nécessaire pour extraire et interpréter les informations présentées dans un graphique. Il sert ainsi à comparer la capacité des modèles à relier perception visuelle et production d’une réponse précise.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Ahmed Masry et al. |
| Capacités mesurées | multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes à réponse courte sur des graphiques, avec réponses textuelles ou numériques |
| Métrique d'évaluation | relaxed accuracy / exact match avec tolérance pour les réponses numériques |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 32,7K questions-réponses, dont 9,6K questions rédigées par des humains et 23,1K générées à partir de résumés de graphiques |
| Année de publication | 2022 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (24)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 90,8 % | 22 octobre 2024 | Auto-déclaré |
| 2 | Llama 4 Maverick | Meta | 🟢 Ouvert | 90,0 % | 5 avril 2025 | Auto-déclaré |
| 3 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,5 % | 26 janvier 2025 | Auto-déclaré |
| 4 | Nova Pro | Amazon | 🔒 Propriétaire | 89,2 % | 20 novembre 2024 | Auto-déclaré |
| 5 | Llama 4 Scout | Meta | 🟢 Ouvert | 88,8 % | 5 avril 2025 | Auto-déclaré |
| 6 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,3 % | 29 août 2024 | Auto-déclaré |
| 7 | Pixtral Large | Mistral AI | 🟢 Ouvert | 88,1 % | 18 novembre 2024 | Auto-déclaré |
| 8 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 87,4 % | 20 juin 2025 | Auto-déclaré |
| 9 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,3 % | 26 janvier 2025 | Auto-déclaré |
| 10 | Nova Lite | Amazon | 🔒 Propriétaire | 86,8 % | 20 novembre 2024 | Auto-déclaré |
| 11 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 86,0 % | 13 décembre 2024 | Auto-déclaré |
| 12 | GPT-4o | OpenAI | 🔒 Propriétaire | 85,7 % | 27 mars 2025 | Auto-déclaré |
| 13 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 85,5 % | 25 septembre 2024 | Auto-déclaré |
| 14 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,3 % | 27 mars 2025 | Auto-déclaré |
| 15 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 84,5 % | 13 décembre 2024 | Auto-déclaré |
| 16 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 83,4 % | 25 septembre 2024 | Auto-déclaré |
| 17 | Phi-3.5-vision-instruct | Microsoft | 🟢 Ouvert | 81,8 % | 23 août 2024 | Auto-déclaré |
| 18 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 81,8 % | 17 septembre 2024 | Auto-déclaré |
| 19 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 81,4 % | 1 février 2025 | Auto-déclaré |
| 20 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 81,0 % | 13 décembre 2024 | Auto-déclaré |
| 21 | Gemma 3 27B | 🟢 Ouvert | 78,0 % | 12 mars 2025 | Auto-déclaré | |
| 22 | Grok-1.5V | xAI | 🔒 Propriétaire | 76,1 % | 12 avril 2024 | Auto-déclaré |
| 23 | Gemma 3 12B | 🟢 Ouvert | 75,7 % | 12 mars 2025 | Auto-déclaré | |
| 24 | Gemma 3 4B | 🟢 Ouvert | 68,8 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 24 modèles évalués, dont 20 de grands éditeurs. Score médian de l'ensemble : 85,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur ChartQA indique qu’un modèle répond correctement à une forte proportion de questions portant sur des graphiques, y compris lorsque la résolution exige des opérations numériques ou un raisonnement logique. La métrique combine exact match et relaxed accuracy, avec une tolérance pour les réponses numériques, ce qui limite la pénalisation de petits écarts de formulation ou de valeur. La lecture du classement appelle toutefois à la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. Avec une médiane de 86 % parmi 24 modèles et un meilleur résultat de 91 % pour Claude 3.5 Sonnet, l’écart entre le niveau central et la tête reste réduit. Cette concentration suggère une capacité de différenciation limitée parmi les modèles les plus performants, compatible avec un effet de saturation. L’accès public peut aussi créer un risque de contamination lors de l’entraînement. Enfin, la portée demeure ciblée sur des graphiques, des questions courtes et l’anglais, sans représenter l’ensemble des aptitudes de raisonnement d’un modèle.
Sources des scores : llm-stats.