CharXiv-R

CharXiv-R est le volet consacré au raisonnement du benchmark CharXiv, créé en 2024 par Zirui Wang, Danqi Chen, Sanjeev Arora et d’autres chercheurs de Princeton University. Il repose sur des graphiques scientifiques réels issus d’articles arXiv et sur des questions ouvertes en anglais.

CharXiv-R est le volet consacré au raisonnement du benchmark CharXiv, créé en 2024 par Zirui Wang, Danqi Chen, Sanjeev Arora et d’autres chercheurs de Princeton University. Il repose sur des graphiques scientifiques réels issus d’articles arXiv et sur des questions ouvertes en anglais.

Le benchmark mesure la capacité des modèles multimodaux à comprendre des graphiques complexes et à synthétiser des informations réparties entre plusieurs éléments visuels. Il sert ainsi à comparer leur aptitude au raisonnement scientifique visuel, au-delà de la simple reconnaissance d’objets ou de textes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkPrinceton University (Zirui Wang, Danqi Chen, Sanjeev Arora et al.)
Capacités mesuréesRaisonnement multimodal sur graphiques scientifiques : synthèse d'informations à travers des éléments visuels complexes d'un graphique.
ModalitéMultimodal
Type de questionsQuestions de raisonnement ouvertes sur graphiques scientifiques
Métrique d'évaluationExactitude (questions de raisonnement)
AccèsPublic
LicenceCC BY-SA 4.0
LanguesAnglais
Taille du jeuCharXiv : 2 323 graphiques réels d'articles arXiv (1 question de raisonnement par graphique)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (45)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Mythos PreviewAnthropic🔒 Propriétaire93,2 %Auto-déclaré
2Kimi K3Moonshot AI▫ n.d.91,3 %16 juillet 2026Auto-déclaré
3Claude Opus 4.7Anthropic🔒 Propriétaire91,0 %16 avril 2026Auto-déclaré
4Claude Opus 4.8Anthropic🔒 Propriétaire89,9 %28 mai 2026Auto-déclaré
5Muse Spark 1.1Meta🔒 Propriétaire88,4 %9 juillet 2026Auto-déclaré
6Claude Sonnet 5Anthropic🔒 Propriétaire88,3 %30 juin 2026Auto-déclaré
7Kimi K2.6Moonshot AI🟢 Ouvert86,7 %20 avril 2026Auto-déclaré
8Muse SparkMeta🔒 Propriétaire86,4 %8 avril 2026Auto-déclaré
9Seed 2.1 ProByteDance🔒 Propriétaire86,4 %24 juin 2026Auto-déclaré
10Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire85,9 %31 mai 2026Auto-déclaré
11Gemini 3.5 FlashGoogle🔒 Propriétaire84,2 %19 mai 2026Auto-déclaré
12Seed 2.1 TurboByteDance🔒 Propriétaire83,6 %24 juin 2026Auto-déclaré
13GPT-5.2OpenAI🔒 Propriétaire82,1 %11 décembre 2025Auto-déclaré
14GPT-5.5 InstantOpenAI🔒 Propriétaire81,6 %5 mai 2026Auto-déclaré
15Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire81,5 %31 mars 2026Auto-déclaré
16Gemini 3 ProGoogle🔒 Propriétaire81,4 %18 novembre 2025Auto-déclaré
17GPT-5OpenAI🔒 Propriétaire81,1 %7 août 2025Auto-déclaré
18MiMo-V2.5Xiaomi🟢 Ouvert81,0 %22 avril 2026Auto-déclaré
19Gemini 3 FlashGoogle🔒 Propriétaire80,3 %17 décembre 2025Auto-déclaré
20Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert79,5 %24 février 2026Auto-déclaré
21o3OpenAI🔒 Propriétaire78,6 %16 avril 2025Auto-déclaré
22Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert78,4 %21 avril 2026Auto-déclaré
23Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert78,0 %16 avril 2026Auto-déclaré
24Kimi K2.5Moonshot AI🟢 Ouvert77,5 %27 janvier 2026Auto-déclaré
25Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert77,5 %24 février 2026Auto-déclaré
26Claude Opus 4.6Anthropic🔒 Propriétaire77,4 %5 février 2026Auto-déclaré
27Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert77,2 %24 février 2026Auto-déclaré
28Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire73,2 %3 mars 2026Auto-déclaré
29o4-miniOpenAI🔒 Propriétaire72,0 %16 avril 2025Auto-déclaré
30Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert66,1 %22 septembre 2025Auto-déclaré
31Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert65,2 %22 septembre 2025Auto-déclaré
32Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert62,8 %22 septembre 2025Auto-déclaré
33Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert62,1 %22 septembre 2025Auto-déclaré
34GPT-4oOpenAI🔒 Propriétaire58,8 %27 mars 2025Auto-déclaré
35GPT-4.1 miniOpenAI🔒 Propriétaire56,8 %14 avril 2025Auto-déclaré
36GPT-4.1OpenAI🔒 Propriétaire56,7 %14 avril 2025Auto-déclaré
37Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert56,6 %22 septembre 2025Auto-déclaré
38GPT-4.5OpenAI🔒 Propriétaire55,4 %5 mars 2026Auto-déclaré
39Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert53,0 %22 septembre 2025Auto-déclaré
40Command A+Cohere🟢 Ouvert52,7 %20 mai 2026Auto-déclaré
41Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert50,3 %22 septembre 2025Auto-déclaré
42Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert48,9 %22 septembre 2025Auto-déclaré
43Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert46,4 %22 septembre 2025Auto-déclaré
44GPT-4.1 nanoOpenAI🔒 Propriétaire40,5 %14 avril 2025Auto-déclaré
45Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert39,7 %22 septembre 2025Auto-déclaré

Classement établi sur 45 modèles évalués, dont 21 de grands éditeurs. Score médian de l'ensemble : 78,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur CharXiv-R indique qu’un modèle répond correctement à une grande part des questions de raisonnement associées aux graphiques. Il traduit une capacité à relier plusieurs éléments visuels et à en produire une interprétation cohérente. Le classement montre un niveau global déjà élevé parmi les 43 modèles recensés, avec une médiane de 78 %, tandis que Claude Mythos Preview atteint 93 %. Cet écart met en évidence une avance du meilleur modèle, mais aussi une possible saturation progressive de la métrique à l’approche du maximum, susceptible de réduire son pouvoir discriminant entre les systèmes les plus performants.

La lecture comparative exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. La portée reste ciblée sur des questions ouvertes en anglais, appliquées à des graphiques scientifiques d’arXiv, avec une question de raisonnement par graphique. Le caractère public du jeu impose également de considérer le risque de contamination lors de l’interprétation des performances.


Sources des scores : llm-stats.