MuirBench
MuirBench est un benchmark académique publié en 2024 par le consortium à l’origine du projet, parmi lequel figurent Pan Lu et lupantech. Il évalue la compréhension robuste de plusieurs images par les grands modèles de langage multimodaux.
MuirBench est un benchmark académique publié en 2024 par le consortium à l’origine du projet, parmi lequel figurent Pan Lu et lupantech. Il évalue la compréhension robuste de plusieurs images par les grands modèles de langage multimodaux.
Ses tâches couvrent notamment les changements de point de vue, les relations temporelles, l’ordonnancement et la compréhension de scènes. L’association de questions à choix multiples avec des variantes non répondables vise à vérifier que les modèles exploitent réellement les relations entre images, plutôt que des indices isolés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Consortium academique (auteurs MuirBench, dont Pan Lu / lupantech) |
| Capacités mesurées | Comprehension robuste multi-images (multivue, relations temporelles, ordonnancement, comprehension de scene) |
| Modalité | Multimodal |
| Type de questions | QCM (choix multiples), avec variantes non-repondables appariees |
| Métrique d'évaluation | Précision (accuracy) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 11 264 images, 2 600 questions a choix multiples, 12 taches, 10 categories de relations multi-images |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,3 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,1 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,6 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,8 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,0 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,8 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,8 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,4 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,8 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,9 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,2 % | 27 mars 2025 | Auto-déclaré |
Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 72,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MuirBench indique une bonne capacité à sélectionner la réponse correcte en combinant les informations de plusieurs images, y compris lorsque celles-ci entretiennent des relations multivues, temporelles, narratives ou complémentaires. Les variantes non répondables appariées renforcent la rigueur du protocole en testant aussi la capacité à reconnaître qu’une réponse ne peut pas être établie. La précision reste toutefois une mesure de réussite au QCM, et non une évaluation générale de toutes les aptitudes multimodales.
Dans la base, Qwen3 VL 32B Thinking atteint 80 %, contre une médiane de 73 % sur onze modèles. Cet écart signale un avantage mesurable du premier modèle, mais ne traduit pas une saturation complète puisque la meilleure précision reste inférieure au maximum possible. L’interprétation comparative doit rester prudente, les scores étant majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un contrôle unique. Comme MuirBench est public, l’exposition potentielle de son contenu constitue également un risque de contamination à considérer. Enfin, sa portée demeure circonscrite à des QCM en anglais et aux relations multi-images couvertes par ses tâches.
Sources des scores : llm-stats.