MathVista

MathVista est un benchmark créé par P. Lu et al. pour évaluer le raisonnement mathématique des modèles de fondation dans des contextes visuels. Il associe l’interprétation de figures, diagrammes, graphiques et images à des calculs ou à des inférences mathématiques.

MathVista est un benchmark créé par P. Lu et al. pour évaluer le raisonnement mathématique des modèles de fondation dans des contextes visuels. Il associe l’interprétation de figures, diagrammes, graphiques et images à des calculs ou à des inférences mathématiques.

Ses questions visuelles combinent QCM et réponses courtes ouvertes. Issu de nombreux jeux multimodaux existants et de trois jeux spécialement créés, MathVista sert à comparer la capacité des modèles à comprendre des représentations complexes et à mener un raisonnement rigoureux en anglais.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkP. Lu et al.
Capacités mesuréesmathématiques, multimodal, vision
ModalitéMultimodal
Type de questionsquestions visuelles mêlant QCM et réponses courtes ouvertes
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu6 141 exemples
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (38)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 ProByteDance🔒 Propriétaire90,7 %24 juin 2026Auto-déclaré
2Seed 2.1 TurboByteDance🔒 Propriétaire90,5 %24 juin 2026Auto-déclaré
3o3OpenAI🔒 Propriétaire86,8 %16 avril 2025Auto-déclaré
4o4-miniOpenAI🔒 Propriétaire84,3 %16 avril 2025Auto-déclaré
5Step3-VL-10BStepFun🟢 Ouvert84,0 %15 janvier 2026Auto-déclaré
6Command A+Cohere🟢 Ouvert80,6 %20 mai 2026Auto-déclaré
7Kimi-k1.5Moonshot AI🔒 Propriétaire74,9 %20 janvier 2025Auto-déclaré
8Llama 4 MaverickMeta🟢 Ouvert73,7 %5 avril 2025Auto-déclaré
9GPT-4.1 miniOpenAI🔒 Propriétaire73,1 %14 avril 2025Auto-déclaré
10GPT-4.5OpenAI🔒 Propriétaire72,3 %5 mars 2026Auto-déclaré
11GPT-4.1OpenAI🔒 Propriétaire72,2 %14 avril 2025Auto-déclaré
12o1OpenAI🔒 Propriétaire71,8 %17 décembre 2024Auto-déclaré
13QvQ-72B-PreviewAlibaba Cloud / Qwen Team🟢 Ouvert71,4 %25 décembre 2024Auto-déclaré
14Llama 4 ScoutMeta🟢 Ouvert70,7 %5 avril 2025Auto-déclaré
15Pixtral LargeMistral AI🟢 Ouvert69,4 %18 novembre 2024Auto-déclaré
16Grok-2xAI🔒 Propriétaire69,0 %13 août 2024Auto-déclaré
17Gemini 1.5 ProGoogle🔒 Propriétaire68,1 %1 mai 2024Auto-déclaré
18Grok-2 minixAI🔒 Propriétaire68,1 %13 août 2024Auto-déclaré
19Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert67,9 %27 mars 2025Auto-déclaré
20Claude 3.5 SonnetAnthropic🔒 Propriétaire67,7 %22 octobre 2024Auto-déclaré
21Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert67,1 %20 juin 2025Auto-déclaré
22Gemini 1.5 FlashGoogle🔒 Propriétaire65,8 %1 mai 2024Auto-déclaré
23DeepSeek VL2DeepSeek🟢 Ouvert62,8 %13 décembre 2024Auto-déclaré
24Phi-4-multimodal-instructMicrosoft🟢 Ouvert62,4 %1 février 2025Auto-déclaré
25GPT-4oOpenAI🔒 Propriétaire61,4 %27 mars 2025Auto-déclaré
26DeepSeek VL2 SmallDeepSeek🟢 Ouvert60,7 %13 décembre 2024Auto-déclaré
27Pixtral-12BMistral AI🟢 Ouvert58,0 %17 septembre 2024Auto-déclaré
28Llama 3.2 90B InstructMeta🟢 Ouvert57,3 %25 septembre 2024Auto-déclaré
29GPT-4o miniOpenAI🔒 Propriétaire56,7 %18 juillet 2024Auto-déclaré
30GPT-4.1 nanoOpenAI🔒 Propriétaire56,2 %14 avril 2025Auto-déclaré
31Gemini 1.5 Flash 8BGoogle🔒 Propriétaire54,7 %15 mars 2024Auto-déclaré
32DeepSeek VL2 TinyDeepSeek🟢 Ouvert53,6 %13 décembre 2024Auto-déclaré
33Grok-1.5xAI🔒 Propriétaire52,8 %28 mars 2024Auto-déclaré
34Grok-1.5VxAI🔒 Propriétaire52,8 %12 avril 2024Auto-déclaré
35Llama 3.2 11B InstructMeta🟢 Ouvert51,5 %25 septembre 2024Auto-déclaré
36Gemini 1.0 ProGoogle🔒 Propriétaire46,6 %15 février 2024n.d.
37Phi-3.5-vision-instructMicrosoft🟢 Ouvert43,9 %23 août 2024Auto-déclaré
38GPT-3.5 TurboOpenAI🔒 Propriétaire0,0 %21 mars 2023n.d.

Classement établi sur 38 modèles évalués, dont 31 de grands éditeurs. Score médian de l'ensemble : 67,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MathVista indique une forte capacité à relier compréhension visuelle et raisonnement mathématique, qu’il s’agisse d’extraire des informations d’un graphique, d’interpréter une figure ou d’effectuer les calculs nécessaires. L’accuracy fournit une mesure directe de la proportion de réponses correctes, mais ne décrit pas séparément les différentes compétences mobilisées.

La lecture du classement exige une certaine prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique. Le caractère public du benchmark et la réutilisation de 28 jeux existants créent aussi un risque de contamination pour les modèles susceptibles d’avoir rencontré ces contenus. Le meilleur résultat, 91 % pour Seed 2.1 Pro, reste sous le maximum théorique, ce qui suggère une marge avant saturation complète. Avec 38 modèles évalués et une médiane de 68 %, le classement révèle un écart marqué entre le meilleur modèle et le niveau central. Sa portée demeure ciblée sur le raisonnement mathématique multimodal en anglais, dans les formats visuels et les types de réponses couverts.


Sources des scores : llm-stats.