CharXiv-D
CharXiv-D est le sous-ensemble descriptif de CharXiv, un benchmark publié en 2024 par Princeton Language and Intelligence, UW-Madison et l’University of Hong Kong. Il repose sur des graphiques scientifiques réels et diversifiés provenant d’articles arXiv, avec des questions élaborées et…
CharXiv-D est le sous-ensemble descriptif de CharXiv, un benchmark publié en 2024 par Princeton Language and Intelligence, UW-Madison et l’University of Hong Kong. Il repose sur des graphiques scientifiques réels et diversifiés provenant d’articles arXiv, avec des questions élaborées et vérifiées par des experts humains.
Le benchmark évalue la capacité des modèles multimodaux à extraire des informations élémentaires d’un graphique. Les tâches couvrent notamment l’extraction, l’énumération, la reconnaissance de motifs et le comptage. CharXiv-D sert ainsi à comparer la lecture descriptive de visualisations scientifiques, plutôt que des capacités générales de raisonnement.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Princeton Language and Intelligence (Princeton University) + UW-Madison + University of Hong Kong |
| Capacités mesurées | Extraction d'informations de base sur les éléments de graphiques scientifiques réels et diversifiés par les modèles multimodaux. |
| Modalité | Multimodal |
| Type de questions | Questions descriptives sur graphiques scientifiques (sous-ensemble descriptif de CharXiv) |
| Métrique d'évaluation | Exactitude (réponses notées par GPT-4o) |
| Accès | Public |
| Licence | CC BY-SA 4.0 (données) ; Apache-2.0 (code) |
| Langues | anglais |
| Taille du jeu | CharXiv = 2323 graphiques issus d'arXiv ; sous-ensemble descriptif (~plusieurs questions descriptives par graphique) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (16)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 95,5 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 94,6 % | 24 juin 2026 | Auto-déclaré |
| 3 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,5 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,2 % | 22 septembre 2025 | Auto-déclaré |
| 5 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 90,0 % | 5 mars 2026 | Auto-déclaré |
| 6 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 88,4 % | 14 avril 2025 | Auto-déclaré |
| 7 | Command A+ | Cohere | 🟢 Ouvert | 88,0 % | 20 mai 2026 | Auto-déclaré |
| 8 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 87,9 % | 14 avril 2025 | Auto-déclaré |
| 9 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,9 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,9 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,5 % | 22 septembre 2025 | Auto-déclaré |
| 12 | GPT-4o | OpenAI | 🔒 Propriétaire | 85,3 % | 27 mars 2025 | Auto-déclaré |
| 13 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,0 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,2 % | 22 septembre 2025 | Auto-déclaré |
| 16 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 73,9 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 16 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 87,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur CharXiv-D indique qu’un modèle répond correctement à une large part des questions descriptives en anglais portant sur les graphiques, selon une notation réalisée par GPT-4o. La curation et la vérification humaines des questions renforcent la rigueur du jeu, mais l’interprétation du classement doit rester prudente, car les scores recensés sont majoritairement auto-déclarés par les éditeurs. Parmi les 16 modèles évalués, une médiane de 87 % et un meilleur résultat de 96 % pour Seed 2.1 Pro montrent un niveau global déjà élevé. Cette concentration vers le haut suggère une saturation partielle : les écarts restants deviennent plus réduits et potentiellement moins discriminants. L’accès public aux données invite aussi à considérer un risque de contamination lors de comparaisons entre modèles. Enfin, la portée demeure ciblée sur l’extraction d’informations de base, l’énumération, les motifs et le comptage dans des graphiques scientifiques. Le classement renseigne donc précisément sur cette compétence descriptive multimodale, sans représenter à lui seul l’ensemble des aptitudes d’un modèle.
Sources des scores : llm-stats.