MathVision

MathVision est un benchmark créé en 2024 par l’équipe MATH-Vision (mathllm) pour évaluer le raisonnement mathématique multimodal. Il réunit des problèmes dont la résolution exige de combiner la compréhension d’éléments visuels avec des opérations de raisonnement mathématique.

MathVision est un benchmark créé en 2024 par l’équipe MATH-Vision (mathllm) pour évaluer le raisonnement mathématique multimodal. Il réunit des problèmes dont la résolution exige de combiner la compréhension d’éléments visuels avec des opérations de raisonnement mathématique.

Avec des questions à choix multiples et à réponse ouverte, MathVision sert à comparer la capacité des modèles à relier les domaines visuel et mathématique. Son éventail de disciplines et de niveaux de difficulté permet d’examiner cette compétence sur des problèmes variés, au moyen d’une mesure fondée sur l’exactitude des réponses.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEquipe MATH-Vision (mathllm)
Capacités mesuréesRaisonnement mathematique multimodal combinant comprehension visuelle et resolution mathematique
ModalitéMultimodal
Type de questionsproblemes mathematiques avec contexte visuel (QCM et reponse ouverte)
Métrique d'évaluationexactitude (accuracy)
AccèsPublic
Languesanglais
Taille du jeu3 040 problemes, 16 disciplines, 5 niveaux de difficulte
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (32)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K3Moonshot AI▫ n.d.97,8 %16 juillet 2026Auto-déclaré
2Seed 2.1 ProByteDance🔒 Propriétaire94,5 %24 juin 2026Auto-déclaré
3Kimi K2.6Moonshot AI🟢 Ouvert93,2 %20 avril 2026Auto-déclaré
4Seed 2.1 TurboByteDance🔒 Propriétaire92,7 %24 juin 2026Auto-déclaré
5Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire90,3 %31 mai 2026Auto-déclaré
6Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire88,0 %31 mars 2026Auto-déclaré
7Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert86,2 %24 février 2026Auto-déclaré
8Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert86,0 %24 février 2026Auto-déclaré
9Gemma 4 31BGoogle🟢 Ouvert85,6 %2 avril 2026Auto-déclaré
10Kimi K2.5Moonshot AI🟢 Ouvert84,2 %27 janvier 2026Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %24 février 2026Auto-déclaré
12Gemma 4 26B-A4BGoogle🟢 Ouvert82,4 %2 avril 2026Auto-déclaré
13Gemma 4 12BGoogle🟢 Ouvert79,7 %23 mai 2026Auto-déclaré
14Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert74,6 %22 septembre 2025Auto-déclaré
15Step3-VL-10BStepFun🟢 Ouvert70,8 %15 janvier 2026Auto-déclaré
16DiffusionGemma 26B-A4BGoogle🟢 Ouvert70,5 %10 juin 2026Auto-déclaré
17Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert70,2 %22 septembre 2025Auto-déclaré
18Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert66,5 %22 septembre 2025Auto-déclaré
19Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert65,7 %22 septembre 2025Auto-déclaré
20Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,4 %22 septembre 2025Auto-déclaré
21Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert62,7 %22 septembre 2025Auto-déclaré
22Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert60,2 %22 septembre 2025Auto-déclaré
23Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert60,0 %22 septembre 2025Auto-déclaré
24Gemma 4 E4BGoogle🟢 Ouvert59,5 %2 avril 2026Auto-déclaré
25Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert53,9 %22 septembre 2025Auto-déclaré
26Gemma 4 E2BGoogle🟢 Ouvert52,4 %2 avril 2026Auto-déclaré
27Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert51,6 %22 septembre 2025Auto-déclaré
28Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert38,4 %28 février 2025Auto-déclaré
29Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert38,1 %26 janvier 2025Auto-déclaré
30QvQ-72B-PreviewAlibaba Cloud / Qwen Team🟢 Ouvert35,9 %25 décembre 2024Auto-déclaré
31Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert25,1 %26 janvier 2025Auto-déclaré
32Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert25,0 %27 mars 2025Auto-déclaré

Classement établi sur 32 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 70,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MathVision indique qu’un modèle fournit fréquemment la réponse exacte à des problèmes associant contexte visuel et raisonnement mathématique. Il reflète donc une bonne performance sur cette tâche précise, sans constituer une mesure générale de toutes les capacités mathématiques ou multimodales. Dans la base, la médiane de 70 % et le meilleur score de 94 %, obtenu par Seed 2.1 Pro, montrent un écart notable entre le niveau central et la tête du classement. La proximité du meilleur résultat avec le maximum possible signale aussi un risque de saturation au sommet, susceptible de réduire progressivement le pouvoir discriminant du benchmark pour les modèles les plus performants.

La comparaison doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public au jeu crée également un risque de contamination si ses problèmes ont été exposés aux modèles durant leur développement. Enfin, sa portée reste centrée sur des problèmes en anglais relevant du raisonnement mathématique multimodal. Le classement de 31 modèles renseigne ainsi sur leur efficacité relative dans ce cadre délimité.


Sources des scores : llm-stats.