MuirBench

MuirBench est un benchmark académique publié en 2024 par le consortium à l’origine du projet, parmi lequel figurent Pan Lu et lupantech. Il évalue la compréhension robuste de plusieurs images par les grands modèles de langage multimodaux.

MuirBench est un benchmark académique publié en 2024 par le consortium à l’origine du projet, parmi lequel figurent Pan Lu et lupantech. Il évalue la compréhension robuste de plusieurs images par les grands modèles de langage multimodaux.

Ses tâches couvrent notamment les changements de point de vue, les relations temporelles, l’ordonnancement et la compréhension de scènes. L’association de questions à choix multiples avec des variantes non répondables vise à vérifier que les modèles exploitent réellement les relations entre images, plutôt que des indices isolés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkConsortium academique (auteurs MuirBench, dont Pan Lu / lupantech)
Capacités mesuréesComprehension robuste multi-images (multivue, relations temporelles, ordonnancement, comprehension de scene)
ModalitéMultimodal
Type de questionsQCM (choix multiples), avec variantes non-repondables appariees
Métrique d'évaluationPrécision (accuracy)
AccèsPublic
Languesanglais
Taille du jeu11 264 images, 2 600 questions a choix multiples, 12 taches, 10 categories de relations multi-images
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert80,3 %22 septembre 2025Auto-déclaré
2Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert80,1 %22 septembre 2025Auto-déclaré
3Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert77,6 %22 septembre 2025Auto-déclaré
4Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert76,8 %22 septembre 2025Auto-déclaré
5Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert75,0 %22 septembre 2025Auto-déclaré
6Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert72,8 %22 septembre 2025Auto-déclaré
7Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert72,8 %22 septembre 2025Auto-déclaré
8Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert64,4 %22 septembre 2025Auto-déclaré
9Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,8 %22 septembre 2025Auto-déclaré
10Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert62,9 %22 septembre 2025Auto-déclaré
11Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert59,2 %27 mars 2025Auto-déclaré

Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 72,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MuirBench indique une bonne capacité à sélectionner la réponse correcte en combinant les informations de plusieurs images, y compris lorsque celles-ci entretiennent des relations multivues, temporelles, narratives ou complémentaires. Les variantes non répondables appariées renforcent la rigueur du protocole en testant aussi la capacité à reconnaître qu’une réponse ne peut pas être établie. La précision reste toutefois une mesure de réussite au QCM, et non une évaluation générale de toutes les aptitudes multimodales.

Dans la base, Qwen3 VL 32B Thinking atteint 80 %, contre une médiane de 73 % sur onze modèles. Cet écart signale un avantage mesurable du premier modèle, mais ne traduit pas une saturation complète puisque la meilleure précision reste inférieure au maximum possible. L’interprétation comparative doit rester prudente, les scores étant majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un contrôle unique. Comme MuirBench est public, l’exposition potentielle de son contenu constitue également un risque de contamination à considérer. Enfin, sa portée demeure circonscrite à des QCM en anglais et aux relations multi-images couvertes par ses tâches.


Sources des scores : llm-stats.