MMBench-V1.1

MMBench-V1.1 est un benchmark bilingue créé par Shanghai AI Laboratory et plusieurs collaborateurs pour évaluer les modèles vision-langage. Cette version améliorée s’appuie sur des questions à choix multiple en anglais et en chinois afin de comparer leurs capacités multimodales.

MMBench-V1.1 est un benchmark bilingue créé par Shanghai AI Laboratory et plusieurs collaborateurs pour évaluer les modèles vision-langage. Cette version améliorée s’appuie sur des questions à choix multiple en anglais et en chinois afin de comparer leurs capacités multimodales.

Les épreuves couvrent notamment la perception visuelle, le raisonnement à partir d’images et la compréhension de scènes. MMBench-V1.1 fournit ainsi un cadre d’évaluation systématique pour situer les modèles sur diverses tâches associant informations visuelles et langage.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkShanghai AI Laboratory et al.
Capacités mesuréesmultimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
Languesanglais et chinois
Taille du jeuenviron 3 000 questions
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert92,8 %24 février 2026Auto-déclaré
2Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert92,8 %16 avril 2026Auto-déclaré
3Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert92,6 %24 février 2026Auto-déclaré
4Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert92,3 %21 avril 2026Auto-déclaré
5Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert91,5 %24 février 2026Auto-déclaré
6Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert90,8 %22 septembre 2025Auto-déclaré
7Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert90,6 %22 septembre 2025Auto-déclaré
8Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,9 %22 septembre 2025Auto-déclaré
9Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert88,9 %22 septembre 2025Auto-déclaré
10Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert87,5 %22 septembre 2025Auto-déclaré
11Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert87,0 %22 septembre 2025Auto-déclaré
12Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert86,7 %22 septembre 2025Auto-déclaré
13Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,1 %22 septembre 2025Auto-déclaré
14Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,0 %22 septembre 2025Auto-déclaré
15Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert81,8 %27 mars 2025Auto-déclaré
16DeepSeek VL2 SmallDeepSeek🟢 Ouvert79,3 %13 décembre 2024Auto-déclaré
17DeepSeek VL2DeepSeek🟢 Ouvert79,2 %13 décembre 2024Auto-déclaré
18DeepSeek VL2 TinyDeepSeek🟢 Ouvert68,3 %13 décembre 2024Auto-déclaré

Classement établi sur 18 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 88,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle sélectionne fréquemment la bonne réponse parmi les choix proposés, sur des tâches de perception, de raisonnement visuel et de compréhension de scènes. La médiane de 88 % parmi les 18 modèles recensés, face à un meilleur score de 93 % pour Qwen3.5-122B-A10B, montre un classement concentré dans une zone de performance élevée. Cet écart limité suggère une capacité de discrimination réduite entre les meilleurs systèmes et un possible effet de saturation. La portée reste circonscrite aux QCM bilingues et aux capacités vision-langage couvertes par environ 3 000 questions, sans représenter toutes les formes d’usage multimodal. Le jeu de test privé, dont les réponses ne sont pas divulguées, encadre l’exposition directe des solutions et limite le risque de contamination par celles-ci. La lecture du classement demande néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un dispositif de mesure uniforme et indépendant.


Sources des scores : llm-stats.