MathVista
MathVista est un benchmark créé par P. Lu et al. pour évaluer le raisonnement mathématique des modèles de fondation dans des contextes visuels. Il associe l’interprétation de figures, diagrammes, graphiques et images à des calculs ou à des inférences mathématiques.
MathVista est un benchmark créé par P. Lu et al. pour évaluer le raisonnement mathématique des modèles de fondation dans des contextes visuels. Il associe l’interprétation de figures, diagrammes, graphiques et images à des calculs ou à des inférences mathématiques.
Ses questions visuelles combinent QCM et réponses courtes ouvertes. Issu de nombreux jeux multimodaux existants et de trois jeux spécialement créés, MathVista sert à comparer la capacité des modèles à comprendre des représentations complexes et à mener un raisonnement rigoureux en anglais.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | P. Lu et al. |
| Capacités mesurées | mathématiques, multimodal, vision |
| Modalité | Multimodal |
| Type de questions | questions visuelles mêlant QCM et réponses courtes ouvertes |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 6 141 exemples |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (38)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 90,7 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 90,5 % | 24 juin 2026 | Auto-déclaré |
| 3 | o3 | OpenAI | 🔒 Propriétaire | 86,8 % | 16 avril 2025 | Auto-déclaré |
| 4 | o4-mini | OpenAI | 🔒 Propriétaire | 84,3 % | 16 avril 2025 | Auto-déclaré |
| 5 | Step3-VL-10B | StepFun | 🟢 Ouvert | 84,0 % | 15 janvier 2026 | Auto-déclaré |
| 6 | Command A+ | Cohere | 🟢 Ouvert | 80,6 % | 20 mai 2026 | Auto-déclaré |
| 7 | Kimi-k1.5 | Moonshot AI | 🔒 Propriétaire | 74,9 % | 20 janvier 2025 | Auto-déclaré |
| 8 | Llama 4 Maverick | Meta | 🟢 Ouvert | 73,7 % | 5 avril 2025 | Auto-déclaré |
| 9 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 73,1 % | 14 avril 2025 | Auto-déclaré |
| 10 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 72,3 % | 5 mars 2026 | Auto-déclaré |
| 11 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 72,2 % | 14 avril 2025 | Auto-déclaré |
| 12 | o1 | OpenAI | 🔒 Propriétaire | 71,8 % | 17 décembre 2024 | Auto-déclaré |
| 13 | QvQ-72B-Preview | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,4 % | 25 décembre 2024 | Auto-déclaré |
| 14 | Llama 4 Scout | Meta | 🟢 Ouvert | 70,7 % | 5 avril 2025 | Auto-déclaré |
| 15 | Pixtral Large | Mistral AI | 🟢 Ouvert | 69,4 % | 18 novembre 2024 | Auto-déclaré |
| 16 | Grok-2 | xAI | 🔒 Propriétaire | 69,0 % | 13 août 2024 | Auto-déclaré |
| 17 | Gemini 1.5 Pro | 🔒 Propriétaire | 68,1 % | 1 mai 2024 | Auto-déclaré | |
| 18 | Grok-2 mini | xAI | 🔒 Propriétaire | 68,1 % | 13 août 2024 | Auto-déclaré |
| 19 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,9 % | 27 mars 2025 | Auto-déclaré |
| 20 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 67,7 % | 22 octobre 2024 | Auto-déclaré |
| 21 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 67,1 % | 20 juin 2025 | Auto-déclaré |
| 22 | Gemini 1.5 Flash | 🔒 Propriétaire | 65,8 % | 1 mai 2024 | Auto-déclaré | |
| 23 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 62,8 % | 13 décembre 2024 | Auto-déclaré |
| 24 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 62,4 % | 1 février 2025 | Auto-déclaré |
| 25 | GPT-4o | OpenAI | 🔒 Propriétaire | 61,4 % | 27 mars 2025 | Auto-déclaré |
| 26 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 60,7 % | 13 décembre 2024 | Auto-déclaré |
| 27 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 58,0 % | 17 septembre 2024 | Auto-déclaré |
| 28 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 57,3 % | 25 septembre 2024 | Auto-déclaré |
| 29 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 56,7 % | 18 juillet 2024 | Auto-déclaré |
| 30 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 56,2 % | 14 avril 2025 | Auto-déclaré |
| 31 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 54,7 % | 15 mars 2024 | Auto-déclaré | |
| 32 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 53,6 % | 13 décembre 2024 | Auto-déclaré |
| 33 | Grok-1.5 | xAI | 🔒 Propriétaire | 52,8 % | 28 mars 2024 | Auto-déclaré |
| 34 | Grok-1.5V | xAI | 🔒 Propriétaire | 52,8 % | 12 avril 2024 | Auto-déclaré |
| 35 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 51,5 % | 25 septembre 2024 | Auto-déclaré |
| 36 | Gemini 1.0 Pro | 🔒 Propriétaire | 46,6 % | 15 février 2024 | n.d. | |
| 37 | Phi-3.5-vision-instruct | Microsoft | 🟢 Ouvert | 43,9 % | 23 août 2024 | Auto-déclaré |
| 38 | GPT-3.5 Turbo | OpenAI | 🔒 Propriétaire | 0,0 % | 21 mars 2023 | n.d. |
Classement établi sur 38 modèles évalués, dont 31 de grands éditeurs. Score médian de l'ensemble : 67,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MathVista indique une forte capacité à relier compréhension visuelle et raisonnement mathématique, qu’il s’agisse d’extraire des informations d’un graphique, d’interpréter une figure ou d’effectuer les calculs nécessaires. L’accuracy fournit une mesure directe de la proportion de réponses correctes, mais ne décrit pas séparément les différentes compétences mobilisées.
La lecture du classement exige une certaine prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique. Le caractère public du benchmark et la réutilisation de 28 jeux existants créent aussi un risque de contamination pour les modèles susceptibles d’avoir rencontré ces contenus. Le meilleur résultat, 91 % pour Seed 2.1 Pro, reste sous le maximum théorique, ce qui suggère une marge avant saturation complète. Avec 38 modèles évalués et une médiane de 68 %, le classement révèle un écart marqué entre le meilleur modèle et le niveau central. Sa portée demeure ciblée sur le raisonnement mathématique multimodal en anglais, dans les formats visuels et les types de réponses couverts.
Sources des scores : llm-stats.