CharXiv-D

CharXiv-D est le sous-ensemble descriptif de CharXiv, un benchmark publié en 2024 par Princeton Language and Intelligence, UW-Madison et l’University of Hong Kong. Il repose sur des graphiques scientifiques réels et diversifiés provenant d’articles arXiv, avec des questions élaborées et…

CharXiv-D est le sous-ensemble descriptif de CharXiv, un benchmark publié en 2024 par Princeton Language and Intelligence, UW-Madison et l’University of Hong Kong. Il repose sur des graphiques scientifiques réels et diversifiés provenant d’articles arXiv, avec des questions élaborées et vérifiées par des experts humains.

Le benchmark évalue la capacité des modèles multimodaux à extraire des informations élémentaires d’un graphique. Les tâches couvrent notamment l’extraction, l’énumération, la reconnaissance de motifs et le comptage. CharXiv-D sert ainsi à comparer la lecture descriptive de visualisations scientifiques, plutôt que des capacités générales de raisonnement.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkPrinceton Language and Intelligence (Princeton University) + UW-Madison + University of Hong Kong
Capacités mesuréesExtraction d'informations de base sur les éléments de graphiques scientifiques réels et diversifiés par les modèles multimodaux.
ModalitéMultimodal
Type de questionsQuestions descriptives sur graphiques scientifiques (sous-ensemble descriptif de CharXiv)
Métrique d'évaluationExactitude (réponses notées par GPT-4o)
AccèsPublic
LicenceCC BY-SA 4.0 (données) ; Apache-2.0 (code)
Languesanglais
Taille du jeuCharXiv = 2323 graphiques issus d'arXiv ; sous-ensemble descriptif (~plusieurs questions descriptives par graphique)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (16)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 ProByteDance🔒 Propriétaire95,5 %24 juin 2026Auto-déclaré
2Seed 2.1 TurboByteDance🔒 Propriétaire94,6 %24 juin 2026Auto-déclaré
3Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert90,5 %22 septembre 2025Auto-déclaré
4Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert90,2 %22 septembre 2025Auto-déclaré
5GPT-4.5OpenAI🔒 Propriétaire90,0 %5 mars 2026Auto-déclaré
6GPT-4.1 miniOpenAI🔒 Propriétaire88,4 %14 avril 2025Auto-déclaré
7Command A+Cohere🟢 Ouvert88,0 %20 mai 2026Auto-déclaré
8GPT-4.1OpenAI🔒 Propriétaire87,9 %14 avril 2025Auto-déclaré
9Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert86,9 %22 septembre 2025Auto-déclaré
10Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert85,9 %22 septembre 2025Auto-déclaré
11Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,5 %22 septembre 2025Auto-déclaré
12GPT-4oOpenAI🔒 Propriétaire85,3 %27 mars 2025Auto-déclaré
13Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %22 septembre 2025Auto-déclaré
14Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,0 %22 septembre 2025Auto-déclaré
15Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert76,2 %22 septembre 2025Auto-déclaré
16GPT-4.1 nanoOpenAI🔒 Propriétaire73,9 %14 avril 2025Auto-déclaré

Classement établi sur 16 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 87,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur CharXiv-D indique qu’un modèle répond correctement à une large part des questions descriptives en anglais portant sur les graphiques, selon une notation réalisée par GPT-4o. La curation et la vérification humaines des questions renforcent la rigueur du jeu, mais l’interprétation du classement doit rester prudente, car les scores recensés sont majoritairement auto-déclarés par les éditeurs. Parmi les 16 modèles évalués, une médiane de 87 % et un meilleur résultat de 96 % pour Seed 2.1 Pro montrent un niveau global déjà élevé. Cette concentration vers le haut suggère une saturation partielle : les écarts restants deviennent plus réduits et potentiellement moins discriminants. L’accès public aux données invite aussi à considérer un risque de contamination lors de comparaisons entre modèles. Enfin, la portée demeure ciblée sur l’extraction d’informations de base, l’énumération, les motifs et le comptage dans des graphiques scientifiques. Le classement renseigne donc précisément sur cette compétence descriptive multimodale, sans représenter à lui seul l’ensemble des aptitudes d’un modèle.


Sources des scores : llm-stats.