PolyMATH
PolyMATH est un benchmark de raisonnement mathématique multimodal publié en 2024 par H. Gupta et ses coauteurs, au sein du groupe de Chitta Baral à l’Arizona State University. Il rassemble des défis cognitifs en anglais associant contenus textuels et visuels sous forme de QCM.
PolyMATH est un benchmark de raisonnement mathématique multimodal publié en 2024 par H. Gupta et ses coauteurs, au sein du groupe de Chitta Baral à l’Arizona State University. Il rassemble des défis cognitifs en anglais associant contenus textuels et visuels sous forme de QCM.
Ses problèmes couvrent notamment la reconnaissance de motifs, le raisonnement spatial et le raisonnement relatif. PolyMATH sert ainsi à comparer la capacité des modèles multimodaux à mobiliser plusieurs formes de raisonnement face à des situations variées.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs academiques (H. Gupta et al., groupe de Chitta Baral, Arizona State University) |
| Capacités mesurées | Raisonnement cognitif multimodal : reconnaissance de motifs, raisonnement spatial et relatif |
| Modalité | Multimodal |
| Type de questions | defis cognitifs textuels et visuels (QCM) repartis en 10 categories |
| Métrique d'évaluation | exactitude (accuracy) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 5 000 images/problemes manuellement collectes, 10 categories |
| Année de publication | 2024 |
| Ressources | Article scientifique |
Classement des modèles (23)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 86,5 % | 19 mai 2026 | Auto-déclaré |
| 2 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 84,0 % | 31 mai 2026 | Auto-déclaré |
| 3 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 77,4 % | 31 mars 2026 | Auto-déclaré |
| 4 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,3 % | 16 février 2026 | Auto-déclaré |
| 5 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,2 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,9 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,4 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,1 % | 25 juillet 2025 | Auto-déclaré |
| 9 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,3 % | 2 mars 2026 | Auto-déclaré |
| 10 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,3 % | 10 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,0 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,7 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,1 % | 2 mars 2026 | Auto-déclaré |
| 14 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,2 % | 22 juillet 2025 | Auto-déclaré |
| 15 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 47,5 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 45,9 % | 10 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,6 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,3 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 40,5 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 30,4 % | 22 septembre 2025 | Auto-déclaré |
| 21 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 28,8 % | 22 septembre 2025 | Auto-déclaré |
| 22 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 26,1 % | 2 mars 2026 | Auto-déclaré |
| 23 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 8,2 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 23 modèles évalués. Score médian de l'ensemble : 51,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur PolyMATH indique qu’un modèle répond correctement à une large part de ces défis cognitifs multimodaux. L’exactitude fournit une mesure simple et comparable, tandis que la collecte manuelle des problèmes contribue à la structuration de l’évaluation. La lecture du classement demande néanmoins de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. L’accès public au benchmark facilite son utilisation, mais crée aussi un risque d’exposition des problèmes aux modèles, ce qui invite à considérer une éventuelle contamination lors de l’interprétation. Sa portée reste centrée sur des QCM en anglais et sur dix catégories de raisonnement cognitif textuel et visuel. Le classement montre un écart important entre la médiane et le meilleur résultat, obtenu par Qwen3.7 Max. Comme ce premier score demeure inférieur à l’exactitude parfaite, l’ensemble ne paraît pas totalement saturé parmi les 23 modèles évalués.
Sources des scores : llm-stats.