MMBench

MMBench est un benchmark bilingue créé en 2023 par Shanghai AI Laboratory et OpenCompass, dans le cadre des travaux de Y. Liu et al. Il évalue les capacités multimodales des modèles de vision et de langage au moyen de questions à choix multiples en anglais et en chinois.

MMBench est un benchmark bilingue créé en 2023 par Shanghai AI Laboratory et OpenCompass, dans le cadre des travaux de Y. Liu et al. Il évalue les capacités multimodales des modèles de vision et de langage au moyen de questions à choix multiples en anglais et en chinois.

Ses épreuves couvrent la compréhension conjointe de l’image et du texte, le raisonnement visuel, la reconnaissance d’objets, la perception fine et les réponses à des questions visuelles. Il fournit ainsi un cadre systématique pour comparer les performances sur diverses tâches image-texte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkShanghai AI Laboratory / OpenCompass (Y. Liu et al.)
Capacités mesuréesmultimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais et chinois
Taille du jeuenviron 2 974 questions
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Step3-VL-10BStepFun🟢 Ouvert91,8 %15 janvier 2026Auto-déclaré
2Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,0 %26 janvier 2025Auto-déclaré
3Phi-4-multimodal-instructMicrosoft🟢 Ouvert86,7 %1 février 2025Auto-déclaré
4Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert86,5 %29 août 2024Auto-déclaré
5Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,3 %26 janvier 2025Auto-déclaré
6Phi-3.5-vision-instructMicrosoft🟢 Ouvert81,9 %23 août 2024Auto-déclaré
7DeepSeek VL2 SmallDeepSeek🟢 Ouvert80,3 %13 décembre 2024Auto-déclaré
8DeepSeek VL2DeepSeek🟢 Ouvert79,6 %13 décembre 2024Auto-déclaré
9DeepSeek VL2 TinyDeepSeek🟢 Ouvert69,2 %13 décembre 2024Auto-déclaré

Classement établi sur 9 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 84,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMBench indique qu’un modèle répond correctement à une forte proportion de QCM mobilisant compréhension multimodale, perception et raisonnement visuel. L’accuracy offre une mesure directe et lisible, mais elle résume des capacités diverses dans un résultat unique. Dans la base, la médiane de 84 % et le meilleur score de 92 %, obtenu par Step3-VL-10B de StepFun, montrent un niveau général élevé parmi les neuf modèles évalués. Cette concentration vers le haut peut signaler une saturation progressive du benchmark et réduire sa capacité à différencier finement les systèmes les plus performants. La fiabilité du classement doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’issus d’une évaluation mesurée de façon homogène. Son accès public crée par ailleurs un risque de contamination des évaluations. Enfin, sa portée reste celle de QCM bilingues centrés sur l’image et le texte : le classement renseigne précisément sur ce cadre, sans constituer à lui seul une mesure générale de toutes les capacités multimodales.


Sources des scores : llm-stats.