MMBench
MMBench est un benchmark bilingue créé en 2023 par Shanghai AI Laboratory et OpenCompass, dans le cadre des travaux de Y. Liu et al. Il évalue les capacités multimodales des modèles de vision et de langage au moyen de questions à choix multiples en anglais et en chinois.
MMBench est un benchmark bilingue créé en 2023 par Shanghai AI Laboratory et OpenCompass, dans le cadre des travaux de Y. Liu et al. Il évalue les capacités multimodales des modèles de vision et de langage au moyen de questions à choix multiples en anglais et en chinois.
Ses épreuves couvrent la compréhension conjointe de l’image et du texte, le raisonnement visuel, la reconnaissance d’objets, la perception fine et les réponses à des questions visuelles. Il fournit ainsi un cadre systématique pour comparer les performances sur diverses tâches image-texte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Shanghai AI Laboratory / OpenCompass (Y. Liu et al.) |
| Capacités mesurées | multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais et chinois |
| Taille du jeu | environ 2 974 questions |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Step3-VL-10B | StepFun | 🟢 Ouvert | 91,8 % | 15 janvier 2026 | Auto-déclaré |
| 2 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,0 % | 26 janvier 2025 | Auto-déclaré |
| 3 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 86,7 % | 1 février 2025 | Auto-déclaré |
| 4 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,5 % | 29 août 2024 | Auto-déclaré |
| 5 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,3 % | 26 janvier 2025 | Auto-déclaré |
| 6 | Phi-3.5-vision-instruct | Microsoft | 🟢 Ouvert | 81,9 % | 23 août 2024 | Auto-déclaré |
| 7 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 80,3 % | 13 décembre 2024 | Auto-déclaré |
| 8 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 79,6 % | 13 décembre 2024 | Auto-déclaré |
| 9 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 69,2 % | 13 décembre 2024 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 84,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMBench indique qu’un modèle répond correctement à une forte proportion de QCM mobilisant compréhension multimodale, perception et raisonnement visuel. L’accuracy offre une mesure directe et lisible, mais elle résume des capacités diverses dans un résultat unique. Dans la base, la médiane de 84 % et le meilleur score de 92 %, obtenu par Step3-VL-10B de StepFun, montrent un niveau général élevé parmi les neuf modèles évalués. Cette concentration vers le haut peut signaler une saturation progressive du benchmark et réduire sa capacité à différencier finement les systèmes les plus performants. La fiabilité du classement doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’issus d’une évaluation mesurée de façon homogène. Son accès public crée par ailleurs un risque de contamination des évaluations. Enfin, sa portée reste celle de QCM bilingues centrés sur l’image et le texte : le classement renseigne précisément sur ce cadre, sans constituer à lui seul une mesure générale de toutes les capacités multimodales.
Sources des scores : llm-stats.