CharXiv-R
CharXiv-R est le volet consacré au raisonnement du benchmark CharXiv, créé en 2024 par Zirui Wang, Danqi Chen, Sanjeev Arora et d’autres chercheurs de Princeton University. Il repose sur des graphiques scientifiques réels issus d’articles arXiv et sur des questions ouvertes en anglais.
CharXiv-R est le volet consacré au raisonnement du benchmark CharXiv, créé en 2024 par Zirui Wang, Danqi Chen, Sanjeev Arora et d’autres chercheurs de Princeton University. Il repose sur des graphiques scientifiques réels issus d’articles arXiv et sur des questions ouvertes en anglais.
Le benchmark mesure la capacité des modèles multimodaux à comprendre des graphiques complexes et à synthétiser des informations réparties entre plusieurs éléments visuels. Il sert ainsi à comparer leur aptitude au raisonnement scientifique visuel, au-delà de la simple reconnaissance d’objets ou de textes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Princeton University (Zirui Wang, Danqi Chen, Sanjeev Arora et al.) |
| Capacités mesurées | Raisonnement multimodal sur graphiques scientifiques : synthèse d'informations à travers des éléments visuels complexes d'un graphique. |
| Modalité | Multimodal |
| Type de questions | Questions de raisonnement ouvertes sur graphiques scientifiques |
| Métrique d'évaluation | Exactitude (questions de raisonnement) |
| Accès | Public |
| Licence | CC BY-SA 4.0 |
| Langues | Anglais |
| Taille du jeu | CharXiv : 2 323 graphiques réels d'articles arXiv (1 question de raisonnement par graphique) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (45)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 93,2 % | — | Auto-déclaré |
| 2 | Kimi K3 | Moonshot AI | ▫ n.d. | 91,3 % | 16 juillet 2026 | Auto-déclaré |
| 3 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 91,0 % | 16 avril 2026 | Auto-déclaré |
| 4 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 89,9 % | 28 mai 2026 | Auto-déclaré |
| 5 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 88,4 % | 9 juillet 2026 | Auto-déclaré |
| 6 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 88,3 % | 30 juin 2026 | Auto-déclaré |
| 7 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 86,7 % | 20 avril 2026 | Auto-déclaré |
| 8 | Muse Spark | Meta | 🔒 Propriétaire | 86,4 % | 8 avril 2026 | Auto-déclaré |
| 9 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 86,4 % | 24 juin 2026 | Auto-déclaré |
| 10 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 85,9 % | 31 mai 2026 | Auto-déclaré |
| 11 | Gemini 3.5 Flash | 🔒 Propriétaire | 84,2 % | 19 mai 2026 | Auto-déclaré | |
| 12 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 83,6 % | 24 juin 2026 | Auto-déclaré |
| 13 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 82,1 % | 11 décembre 2025 | Auto-déclaré |
| 14 | GPT-5.5 Instant | OpenAI | 🔒 Propriétaire | 81,6 % | 5 mai 2026 | Auto-déclaré |
| 15 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 81,5 % | 31 mars 2026 | Auto-déclaré |
| 16 | Gemini 3 Pro | 🔒 Propriétaire | 81,4 % | 18 novembre 2025 | Auto-déclaré | |
| 17 | GPT-5 | OpenAI | 🔒 Propriétaire | 81,1 % | 7 août 2025 | Auto-déclaré |
| 18 | MiMo-V2.5 | Xiaomi | 🟢 Ouvert | 81,0 % | 22 avril 2026 | Auto-déclaré |
| 19 | Gemini 3 Flash | 🔒 Propriétaire | 80,3 % | 17 décembre 2025 | Auto-déclaré | |
| 20 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,5 % | 24 février 2026 | Auto-déclaré |
| 21 | o3 | OpenAI | 🔒 Propriétaire | 78,6 % | 16 avril 2025 | Auto-déclaré |
| 22 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,4 % | 21 avril 2026 | Auto-déclaré |
| 23 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,0 % | 16 avril 2026 | Auto-déclaré |
| 24 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 77,5 % | 27 janvier 2026 | Auto-déclaré |
| 25 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,5 % | 24 février 2026 | Auto-déclaré |
| 26 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 77,4 % | 5 février 2026 | Auto-déclaré |
| 27 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,2 % | 24 février 2026 | Auto-déclaré |
| 28 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 73,2 % | 3 mars 2026 | Auto-déclaré | |
| 29 | o4-mini | OpenAI | 🔒 Propriétaire | 72,0 % | 16 avril 2025 | Auto-déclaré |
| 30 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,1 % | 22 septembre 2025 | Auto-déclaré |
| 31 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,2 % | 22 septembre 2025 | Auto-déclaré |
| 32 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,8 % | 22 septembre 2025 | Auto-déclaré |
| 33 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,1 % | 22 septembre 2025 | Auto-déclaré |
| 34 | GPT-4o | OpenAI | 🔒 Propriétaire | 58,8 % | 27 mars 2025 | Auto-déclaré |
| 35 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 56,8 % | 14 avril 2025 | Auto-déclaré |
| 36 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 56,7 % | 14 avril 2025 | Auto-déclaré |
| 37 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,6 % | 22 septembre 2025 | Auto-déclaré |
| 38 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 55,4 % | 5 mars 2026 | Auto-déclaré |
| 39 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 53,0 % | 22 septembre 2025 | Auto-déclaré |
| 40 | Command A+ | Cohere | 🟢 Ouvert | 52,7 % | 20 mai 2026 | Auto-déclaré |
| 41 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,3 % | 22 septembre 2025 | Auto-déclaré |
| 42 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 48,9 % | 22 septembre 2025 | Auto-déclaré |
| 43 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,4 % | 22 septembre 2025 | Auto-déclaré |
| 44 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 40,5 % | 14 avril 2025 | Auto-déclaré |
| 45 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 39,7 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 45 modèles évalués, dont 21 de grands éditeurs. Score médian de l'ensemble : 78,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur CharXiv-R indique qu’un modèle répond correctement à une grande part des questions de raisonnement associées aux graphiques. Il traduit une capacité à relier plusieurs éléments visuels et à en produire une interprétation cohérente. Le classement montre un niveau global déjà élevé parmi les 43 modèles recensés, avec une médiane de 78 %, tandis que Claude Mythos Preview atteint 93 %. Cet écart met en évidence une avance du meilleur modèle, mais aussi une possible saturation progressive de la métrique à l’approche du maximum, susceptible de réduire son pouvoir discriminant entre les systèmes les plus performants.
La lecture comparative exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. La portée reste ciblée sur des questions ouvertes en anglais, appliquées à des graphiques scientifiques d’arXiv, avec une question de raisonnement par graphique. Le caractère public du jeu impose également de considérer le risque de contamination lors de l’interprétation des performances.
Sources des scores : llm-stats.