MathVision
MathVision est un benchmark créé en 2024 par l’équipe MATH-Vision (mathllm) pour évaluer le raisonnement mathématique multimodal. Il réunit des problèmes dont la résolution exige de combiner la compréhension d’éléments visuels avec des opérations de raisonnement mathématique.
MathVision est un benchmark créé en 2024 par l’équipe MATH-Vision (mathllm) pour évaluer le raisonnement mathématique multimodal. Il réunit des problèmes dont la résolution exige de combiner la compréhension d’éléments visuels avec des opérations de raisonnement mathématique.
Avec des questions à choix multiples et à réponse ouverte, MathVision sert à comparer la capacité des modèles à relier les domaines visuel et mathématique. Son éventail de disciplines et de niveaux de difficulté permet d’examiner cette compétence sur des problèmes variés, au moyen d’une mesure fondée sur l’exactitude des réponses.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Equipe MATH-Vision (mathllm) |
| Capacités mesurées | Raisonnement mathematique multimodal combinant comprehension visuelle et resolution mathematique |
| Modalité | Multimodal |
| Type de questions | problemes mathematiques avec contexte visuel (QCM et reponse ouverte) |
| Métrique d'évaluation | exactitude (accuracy) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 3 040 problemes, 16 disciplines, 5 niveaux de difficulte |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (32)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI | ▫ n.d. | 97,8 % | 16 juillet 2026 | Auto-déclaré |
| 2 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 94,5 % | 24 juin 2026 | Auto-déclaré |
| 3 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 93,2 % | 20 avril 2026 | Auto-déclaré |
| 4 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 92,7 % | 24 juin 2026 | Auto-déclaré |
| 5 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 90,3 % | 31 mai 2026 | Auto-déclaré |
| 6 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 88,0 % | 31 mars 2026 | Auto-déclaré |
| 7 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,2 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,0 % | 24 février 2026 | Auto-déclaré |
| 9 | Gemma 4 31B | 🟢 Ouvert | 85,6 % | 2 avril 2026 | Auto-déclaré | |
| 10 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 84,2 % | 27 janvier 2026 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 24 février 2026 | Auto-déclaré |
| 12 | Gemma 4 26B-A4B | 🟢 Ouvert | 82,4 % | 2 avril 2026 | Auto-déclaré | |
| 13 | Gemma 4 12B | 🟢 Ouvert | 79,7 % | 23 mai 2026 | Auto-déclaré | |
| 14 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,6 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Step3-VL-10B | StepFun | 🟢 Ouvert | 70,8 % | 15 janvier 2026 | Auto-déclaré |
| 16 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 70,5 % | 10 juin 2026 | Auto-déclaré | |
| 17 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,2 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,5 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,7 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,4 % | 22 septembre 2025 | Auto-déclaré |
| 21 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,7 % | 22 septembre 2025 | Auto-déclaré |
| 22 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,2 % | 22 septembre 2025 | Auto-déclaré |
| 23 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,0 % | 22 septembre 2025 | Auto-déclaré |
| 24 | Gemma 4 E4B | 🟢 Ouvert | 59,5 % | 2 avril 2026 | Auto-déclaré | |
| 25 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 53,9 % | 22 septembre 2025 | Auto-déclaré |
| 26 | Gemma 4 E2B | 🟢 Ouvert | 52,4 % | 2 avril 2026 | Auto-déclaré | |
| 27 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,6 % | 22 septembre 2025 | Auto-déclaré |
| 28 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 38,4 % | 28 février 2025 | Auto-déclaré |
| 29 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 38,1 % | 26 janvier 2025 | Auto-déclaré |
| 30 | QvQ-72B-Preview | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 35,9 % | 25 décembre 2024 | Auto-déclaré |
| 31 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 25,1 % | 26 janvier 2025 | Auto-déclaré |
| 32 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 25,0 % | 27 mars 2025 | Auto-déclaré |
Classement établi sur 32 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 70,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MathVision indique qu’un modèle fournit fréquemment la réponse exacte à des problèmes associant contexte visuel et raisonnement mathématique. Il reflète donc une bonne performance sur cette tâche précise, sans constituer une mesure générale de toutes les capacités mathématiques ou multimodales. Dans la base, la médiane de 70 % et le meilleur score de 94 %, obtenu par Seed 2.1 Pro, montrent un écart notable entre le niveau central et la tête du classement. La proximité du meilleur résultat avec le maximum possible signale aussi un risque de saturation au sommet, susceptible de réduire progressivement le pouvoir discriminant du benchmark pour les modèles les plus performants.
La comparaison doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public au jeu crée également un risque de contamination si ses problèmes ont été exposés aux modèles durant leur développement. Enfin, sa portée reste centrée sur des problèmes en anglais relevant du raisonnement mathématique multimodal. Le classement de 31 modèles renseigne ainsi sur leur efficacité relative dans ce cadre délimité.
Sources des scores : llm-stats.