MathVista-Mini
Créé par Pan Lu et al. en 2023, MathVista-Mini est une version réduite de MathVista consacrée au raisonnement mathématique en contexte visuel. Ses questions multimodales associent mathématiques, compréhension d’images et interprétation de diagrammes, tableaux, figures ou scènes.
Créé par Pan Lu et al. en 2023, MathVista-Mini est une version réduite de MathVista consacrée au raisonnement mathématique en contexte visuel. Ses questions multimodales associent mathématiques, compréhension d’images et interprétation de diagrammes, tableaux, figures ou scènes.
Le benchmark évalue ainsi la capacité des modèles de fondation à combiner perception visuelle et raisonnement quantitatif, plutôt qu’à traiter séparément ces compétences. La diversité des tâches et l’alternance entre QCM et réponses courtes en font un indicateur synthétique de résolution de problèmes visuels mathématiques.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Pan Lu et al. |
| Capacités mesurées | mathématiques, multimodal, vision |
| Modalité | Multimodal |
| Type de questions | questions multimodales de mathématiques, mêlant QCM et réponses courtes |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 1 000 questions |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (23)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 90,1 % | 27 janvier 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,8 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,4 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,4 % | 21 avril 2026 | Auto-déclaré |
| 5 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,4 % | 16 avril 2026 | Auto-déclaré |
| 6 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,2 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,9 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,8 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,9 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,8 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,9 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,4 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,1 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,5 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,2 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,8 % | 26 janvier 2025 | Auto-déclaré |
| 17 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,7 % | 28 février 2025 | Auto-déclaré |
| 18 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,7 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,5 % | 29 août 2024 | Auto-déclaré |
| 20 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,2 % | 26 janvier 2025 | Auto-déclaré |
| 21 | Gemma 3 27B | 🟢 Ouvert | 67,6 % | 12 mars 2025 | Auto-déclaré | |
| 22 | Gemma 3 12B | 🟢 Ouvert | 62,9 % | 12 mars 2025 | Auto-déclaré | |
| 23 | Gemma 3 4B | 🟢 Ouvert | 50,0 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 23 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 81,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MathVista-Mini indique qu’un modèle répond correctement à une forte proportion de problèmes nécessitant d’articuler compréhension visuelle, interprétation des informations et calcul. L’accuracy offre une lecture directe des performances, mais ne distingue pas les différentes étapes du raisonnement ni les types d’erreurs. Dans la base, les résultats sont majoritairement auto-déclarés par les éditeurs, ce qui invite à les considérer avec davantage de prudence que des mesures produites selon une évaluation indépendante et uniforme.
La médiane de 81 % parmi les 23 modèles évalués, face au meilleur résultat de 90 % obtenu par Kimi K2.5, montre un niveau globalement élevé et un écart limité entre le centre du classement et son sommet. Cette concentration peut réduire le pouvoir discriminant du benchmark pour les modèles les plus performants et signaler un risque de saturation progressive. Son caractère public rend aussi la contamination des évaluations possible. Enfin, sa portée reste circonscrite au raisonnement mathématique visuel en anglais et ne résume pas les capacités générales d’un modèle.
Sources des scores : llm-stats.