MMStar
Créé par Lin Chen et ses coauteurs en 2024, MMStar est un benchmark multimodal conçu autour de tâches pour lesquelles l’image est indispensable. Ses questions évaluent conjointement la perception visuelle, le raisonnement multimodal, la compréhension fine et la résolution de problèmes…
Créé par Lin Chen et ses coauteurs en 2024, MMStar est un benchmark multimodal conçu autour de tâches pour lesquelles l’image est indispensable. Ses questions évaluent conjointement la perception visuelle, le raisonnement multimodal, la compréhension fine et la résolution de problèmes visuels variés.
La sélection humaine d’échantillons difficiles vise à mieux distinguer les modèles capables d’exploiter réellement le contenu visuel. MMStar cherche notamment à limiter deux faiblesses d’autres évaluations multimodales, la possibilité de répondre sans examiner l’image et les fuites involontaires de données.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Lin Chen et al. |
| Capacités mesurées | généraliste, multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM multimodaux avec image |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 1 500 questions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (22)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 83,3 % | 31 mars 2026 | Auto-déclaré |
| 2 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,9 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,9 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,4 % | 21 avril 2026 | Auto-déclaré |
| 5 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,0 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,4 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,7 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,4 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,7 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,5 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,3 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,2 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,1 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,9 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,8 % | 26 janvier 2025 | Auto-déclaré |
| 16 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,8 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,5 % | 28 février 2025 | Auto-déclaré |
| 18 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,0 % | 27 mars 2025 | Auto-déclaré |
| 19 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,9 % | 26 janvier 2025 | Auto-déclaré |
| 20 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 61,3 % | 13 décembre 2024 | Auto-déclaré |
| 21 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 57,0 % | 13 décembre 2024 | Auto-déclaré |
| 22 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 45,9 % | 13 décembre 2024 | Auto-déclaré |
Classement établi sur 22 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 74,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMStar indique qu’un modèle répond correctement à une forte proportion de QCM nécessitant l’analyse de l’image, sur plusieurs capacités et axes détaillés. Il traduit donc une aptitude étendue à combiner perception et raisonnement, sans constituer une mesure générale de toutes les compétences multimodales. La portée reste circonscrite à 1 500 questions en anglais, au format QCM avec image.
Le classement de 22 modèles montre un niveau médian de 74 %, tandis que Qwen3.6 Plus atteint 83 %. Cet écart suggère qu’une marge de progression subsiste, mais le niveau déjà élevé de l’ensemble peut aussi réduire progressivement le pouvoir discriminant du benchmark si les performances continuent d’augmenter. MMStar a été conçu pour combattre la non-nécessité du contenu visuel et les fuites involontaires, deux facteurs susceptibles de gonfler artificiellement les résultats, sans faire de son score une garantie absolue contre toute contamination. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de l’application cohérente du protocole, ce qui appelle davantage de prudence qu’une évaluation intégralement mesurée de manière indépendante.
Sources des scores : llm-stats.