MMStar

Créé par Lin Chen et ses coauteurs en 2024, MMStar est un benchmark multimodal conçu autour de tâches pour lesquelles l’image est indispensable. Ses questions évaluent conjointement la perception visuelle, le raisonnement multimodal, la compréhension fine et la résolution de problèmes…

Créé par Lin Chen et ses coauteurs en 2024, MMStar est un benchmark multimodal conçu autour de tâches pour lesquelles l’image est indispensable. Ses questions évaluent conjointement la perception visuelle, le raisonnement multimodal, la compréhension fine et la résolution de problèmes visuels variés.

La sélection humaine d’échantillons difficiles vise à mieux distinguer les modèles capables d’exploiter réellement le contenu visuel. MMStar cherche notamment à limiter deux faiblesses d’autres évaluations multimodales, la possibilité de répondre sans examiner l’image et les fuites involontaires de données.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkLin Chen et al.
Capacités mesuréesgénéraliste, multimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM multimodaux avec image
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu1 500 questions
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (22)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire83,3 %31 mars 2026Auto-déclaré
2Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert82,9 %24 février 2026Auto-déclaré
3Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert81,9 %24 février 2026Auto-déclaré
4Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert81,4 %21 avril 2026Auto-déclaré
5Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert81,0 %24 février 2026Auto-déclaré
6Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert79,4 %22 septembre 2025Auto-déclaré
7Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert78,7 %22 septembre 2025Auto-déclaré
8Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert78,4 %22 septembre 2025Auto-déclaré
9Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,7 %22 septembre 2025Auto-déclaré
10Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert75,5 %22 septembre 2025Auto-déclaré
11Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert75,3 %22 septembre 2025Auto-déclaré
12Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert73,2 %22 septembre 2025Auto-déclaré
13Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert72,1 %22 septembre 2025Auto-déclaré
14Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,9 %22 septembre 2025Auto-déclaré
15Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,8 %26 janvier 2025Auto-déclaré
16Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert69,8 %22 septembre 2025Auto-déclaré
17Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert69,5 %28 février 2025Auto-déclaré
18Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert64,0 %27 mars 2025Auto-déclaré
19Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,9 %26 janvier 2025Auto-déclaré
20DeepSeek VL2DeepSeek🟢 Ouvert61,3 %13 décembre 2024Auto-déclaré
21DeepSeek VL2 SmallDeepSeek🟢 Ouvert57,0 %13 décembre 2024Auto-déclaré
22DeepSeek VL2 TinyDeepSeek🟢 Ouvert45,9 %13 décembre 2024Auto-déclaré

Classement établi sur 22 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 74,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMStar indique qu’un modèle répond correctement à une forte proportion de QCM nécessitant l’analyse de l’image, sur plusieurs capacités et axes détaillés. Il traduit donc une aptitude étendue à combiner perception et raisonnement, sans constituer une mesure générale de toutes les compétences multimodales. La portée reste circonscrite à 1 500 questions en anglais, au format QCM avec image.

Le classement de 22 modèles montre un niveau médian de 74 %, tandis que Qwen3.6 Plus atteint 83 %. Cet écart suggère qu’une marge de progression subsiste, mais le niveau déjà élevé de l’ensemble peut aussi réduire progressivement le pouvoir discriminant du benchmark si les performances continuent d’augmenter. MMStar a été conçu pour combattre la non-nécessité du contenu visuel et les fuites involontaires, deux facteurs susceptibles de gonfler artificiellement les résultats, sans faire de son score une garantie absolue contre toute contamination. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de l’application cohérente du protocole, ce qui appelle davantage de prudence qu’une évaluation intégralement mesurée de manière indépendante.


Sources des scores : llm-stats.