MathVista-Mini

Créé par Pan Lu et al. en 2023, MathVista-Mini est une version réduite de MathVista consacrée au raisonnement mathématique en contexte visuel. Ses questions multimodales associent mathématiques, compréhension d’images et interprétation de diagrammes, tableaux, figures ou scènes.

Créé par Pan Lu et al. en 2023, MathVista-Mini est une version réduite de MathVista consacrée au raisonnement mathématique en contexte visuel. Ses questions multimodales associent mathématiques, compréhension d’images et interprétation de diagrammes, tableaux, figures ou scènes.

Le benchmark évalue ainsi la capacité des modèles de fondation à combiner perception visuelle et raisonnement quantitatif, plutôt qu’à traiter séparément ces compétences. La diversité des tâches et l’alternance entre QCM et réponses courtes en font un indicateur synthétique de résolution de problèmes visuels mathématiques.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkPan Lu et al.
Capacités mesuréesmathématiques, multimodal, vision
ModalitéMultimodal
Type de questionsquestions multimodales de mathématiques, mêlant QCM et réponses courtes
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu1 000 questions
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (23)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.5Moonshot AI🟢 Ouvert90,1 %27 janvier 2026Auto-déclaré
2Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert87,8 %24 février 2026Auto-déclaré
3Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert87,4 %24 février 2026Auto-déclaré
4Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert87,4 %21 avril 2026Auto-déclaré
5Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert86,4 %16 avril 2026Auto-déclaré
6Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert86,2 %24 février 2026Auto-déclaré
7Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert85,9 %22 septembre 2025Auto-déclaré
8Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert85,8 %22 septembre 2025Auto-déclaré
9Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,9 %22 septembre 2025Auto-déclaré
10Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,8 %22 septembre 2025Auto-déclaré
11Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert81,9 %22 septembre 2025Auto-déclaré
12Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert81,4 %22 septembre 2025Auto-déclaré
13Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,1 %22 septembre 2025Auto-déclaré
14Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert79,5 %22 septembre 2025Auto-déclaré
15Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,2 %22 septembre 2025Auto-déclaré
16Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert74,8 %26 janvier 2025Auto-déclaré
17Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert74,7 %28 février 2025Auto-déclaré
18Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert73,7 %22 septembre 2025Auto-déclaré
19Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,5 %29 août 2024Auto-déclaré
20Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert68,2 %26 janvier 2025Auto-déclaré
21Gemma 3 27BGoogle🟢 Ouvert67,6 %12 mars 2025Auto-déclaré
22Gemma 3 12BGoogle🟢 Ouvert62,9 %12 mars 2025Auto-déclaré
23Gemma 3 4BGoogle🟢 Ouvert50,0 %12 mars 2025Auto-déclaré

Classement établi sur 23 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 81,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MathVista-Mini indique qu’un modèle répond correctement à une forte proportion de problèmes nécessitant d’articuler compréhension visuelle, interprétation des informations et calcul. L’accuracy offre une lecture directe des performances, mais ne distingue pas les différentes étapes du raisonnement ni les types d’erreurs. Dans la base, les résultats sont majoritairement auto-déclarés par les éditeurs, ce qui invite à les considérer avec davantage de prudence que des mesures produites selon une évaluation indépendante et uniforme.

La médiane de 81 % parmi les 23 modèles évalués, face au meilleur résultat de 90 % obtenu par Kimi K2.5, montre un niveau globalement élevé et un écart limité entre le centre du classement et son sommet. Cette concentration peut réduire le pouvoir discriminant du benchmark pour les modèles les plus performants et signaler un risque de saturation progressive. Son caractère public rend aussi la contamination des évaluations possible. Enfin, sa portée reste circonscrite au raisonnement mathématique visuel en anglais et ne résume pas les capacités générales d’un modèle.


Sources des scores : llm-stats.