MMBench-V1.1
MMBench-V1.1 est un benchmark bilingue créé par Shanghai AI Laboratory et plusieurs collaborateurs pour évaluer les modèles vision-langage. Cette version améliorée s’appuie sur des questions à choix multiple en anglais et en chinois afin de comparer leurs capacités multimodales.
MMBench-V1.1 est un benchmark bilingue créé par Shanghai AI Laboratory et plusieurs collaborateurs pour évaluer les modèles vision-langage. Cette version améliorée s’appuie sur des questions à choix multiple en anglais et en chinois afin de comparer leurs capacités multimodales.
Les épreuves couvrent notamment la perception visuelle, le raisonnement à partir d’images et la compréhension de scènes. MMBench-V1.1 fournit ainsi un cadre d’évaluation systématique pour situer les modèles sur diverses tâches associant informations visuelles et langage.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Shanghai AI Laboratory et al. |
| Capacités mesurées | multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais et chinois |
| Taille du jeu | environ 3 000 questions |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,8 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,8 % | 16 avril 2026 | Auto-déclaré |
| 3 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,6 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,3 % | 21 avril 2026 | Auto-déclaré |
| 5 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,5 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,8 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,6 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,9 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,9 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,5 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,0 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,7 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,1 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,0 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,8 % | 27 mars 2025 | Auto-déclaré |
| 16 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 79,3 % | 13 décembre 2024 | Auto-déclaré |
| 17 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 79,2 % | 13 décembre 2024 | Auto-déclaré |
| 18 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 68,3 % | 13 décembre 2024 | Auto-déclaré |
Classement établi sur 18 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 88,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle sélectionne fréquemment la bonne réponse parmi les choix proposés, sur des tâches de perception, de raisonnement visuel et de compréhension de scènes. La médiane de 88 % parmi les 18 modèles recensés, face à un meilleur score de 93 % pour Qwen3.5-122B-A10B, montre un classement concentré dans une zone de performance élevée. Cet écart limité suggère une capacité de discrimination réduite entre les meilleurs systèmes et un possible effet de saturation. La portée reste circonscrite aux QCM bilingues et aux capacités vision-langage couvertes par environ 3 000 questions, sans représenter toutes les formes d’usage multimodal. Le jeu de test privé, dont les réponses ne sont pas divulguées, encadre l’exposition directe des solutions et limite le risque de contamination par celles-ci. La lecture du classement demande néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un dispositif de mesure uniforme et indépendant.
Sources des scores : llm-stats.