PolyMATH

PolyMATH est un benchmark de raisonnement mathématique multimodal publié en 2024 par H. Gupta et ses coauteurs, au sein du groupe de Chitta Baral à l’Arizona State University. Il rassemble des défis cognitifs en anglais associant contenus textuels et visuels sous forme de QCM.

PolyMATH est un benchmark de raisonnement mathématique multimodal publié en 2024 par H. Gupta et ses coauteurs, au sein du groupe de Chitta Baral à l’Arizona State University. Il rassemble des défis cognitifs en anglais associant contenus textuels et visuels sous forme de QCM.

Ses problèmes couvrent notamment la reconnaissance de motifs, le raisonnement spatial et le raisonnement relatif. PolyMATH sert ainsi à comparer la capacité des modèles multimodaux à mobiliser plusieurs formes de raisonnement face à des situations variées.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs academiques (H. Gupta et al., groupe de Chitta Baral, Arizona State University)
Capacités mesuréesRaisonnement cognitif multimodal : reconnaissance de motifs, raisonnement spatial et relatif
ModalitéMultimodal
Type de questionsdefis cognitifs textuels et visuels (QCM) repartis en 10 categories
Métrique d'évaluationexactitude (accuracy)
AccèsPublic
Languesanglais
Taille du jeu5 000 images/problemes manuellement collectes, 10 categories
Année de publication2024
RessourcesArticle scientifique

Classement des modèles (23)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire86,5 %19 mai 2026Auto-déclaré
2Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire84,0 %31 mai 2026Auto-déclaré
3Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire77,4 %31 mars 2026Auto-déclaré
4Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert73,3 %16 février 2026Auto-déclaré
5Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert71,2 %24 février 2026Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert68,9 %24 février 2026Auto-déclaré
7Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert64,4 %24 février 2026Auto-déclaré
8Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert60,1 %25 juillet 2025Auto-déclaré
9Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert57,3 %2 mars 2026Auto-déclaré
10Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert56,3 %10 septembre 2025Auto-déclaré
11Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert52,0 %22 septembre 2025Auto-déclaré
12Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert51,7 %22 septembre 2025Auto-déclaré
13Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert51,1 %2 mars 2026Auto-déclaré
14Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert50,2 %22 juillet 2025Auto-déclaré
15Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert47,5 %22 septembre 2025Auto-déclaré
16Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert45,9 %10 septembre 2025Auto-déclaré
17Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert44,6 %22 septembre 2025Auto-déclaré
18Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert44,3 %22 septembre 2025Auto-déclaré
19Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert40,5 %22 septembre 2025Auto-déclaré
20Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert30,4 %22 septembre 2025Auto-déclaré
21Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert28,8 %22 septembre 2025Auto-déclaré
22Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert26,1 %2 mars 2026Auto-déclaré
23Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert8,2 %2 mars 2026Auto-déclaré

Classement établi sur 23 modèles évalués. Score médian de l'ensemble : 51,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur PolyMATH indique qu’un modèle répond correctement à une large part de ces défis cognitifs multimodaux. L’exactitude fournit une mesure simple et comparable, tandis que la collecte manuelle des problèmes contribue à la structuration de l’évaluation. La lecture du classement demande néanmoins de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. L’accès public au benchmark facilite son utilisation, mais crée aussi un risque d’exposition des problèmes aux modèles, ce qui invite à considérer une éventuelle contamination lors de l’interprétation. Sa portée reste centrée sur des QCM en anglais et sur dix catégories de raisonnement cognitif textuel et visuel. Le classement montre un écart important entre la médiane et le meilleur résultat, obtenu par Qwen3.7 Max. Comme ce premier score demeure inférieur à l’exactitude parfaite, l’ensemble ne paraît pas totalement saturé parmi les 23 modèles évalués.


Sources des scores : llm-stats.