MM-MT-Bench
MM-MT-Bench est un benchmark créé par Mistral AI en 2024 pour évaluer des modèles multimodaux ajustés au suivi d’instructions. Il repose sur des dialogues en anglais combinant texte et images, organisés sur plusieurs tours.
MM-MT-Bench est un benchmark créé par Mistral AI en 2024 pour évaluer des modèles multimodaux ajustés au suivi d’instructions. Il repose sur des dialogues en anglais combinant texte et images, organisés sur plusieurs tours.
Son objectif est de mesurer la capacité des modèles à suivre les demandes successives, à communiquer de façon cohérente et à répondre en zero-shot à des questions ouvertes. Les réponses sont appréciées par un LLM juge, ce qui permet de comparer les performances en vision-langage dans un cadre conversationnel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Mistral AI |
| Capacités mesurées | multimodal, vision-langage, suivi d'instructions multi-tours, communication, réponse à questions ouvertes en zero-shot |
| Modalité | Multimodal |
| Type de questions | dialogues multimodaux (texte + images) multi-tours, questions ouvertes, jugé par LLM |
| Métrique d'évaluation | score LLM-as-judge (échelle 1-10) |
| Accès | Public |
| Langues | anglais |
| Année de publication | 2024 |
| Ressources | Article scientifique |
Classement des modèles (17)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Mistral Large 3 | Mistral AI | 🟢 Ouvert | 84,9 % | 1 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,0 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Pixtral Large | Mistral AI | 🟢 Ouvert | 74,0 % | 18 novembre 2024 | Auto-déclaré |
| 4 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 60,5 % | 17 septembre 2024 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 8,5 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 8,5 % | 22 septembre 2025 | Auto-déclaré |
| 7 | MiniStral 3 (14B Instruct 2512) | Mistral AI | 🟢 Ouvert | 8,5 % | 4 décembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 8,4 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 8,1 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Ministral 3 (8B Instruct 2512) | Mistral AI | 🟢 Ouvert | 8,1 % | 4 décembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 8,0 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 7,9 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Ministral 3 (3B Instruct 2512) | Mistral AI | 🟢 Ouvert | 7,8 % | 4 décembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 7,7 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 7,7 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 7,5 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 6,0 % | 27 mars 2025 | Auto-déclaré |
Classement établi sur 17 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 8,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle suit efficacement les instructions au fil d’un dialogue multimodal et produit des réponses ouvertes jugées satisfaisantes. L’évaluation repose toutefois sur un LLM-as-a-judge, avec une note sur une échelle de 1 à 10. Elle reflète donc le jugement du modèle évaluateur plutôt qu’une mesure entièrement objective. La fiabilité du classement doit aussi être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs.
Parmi les 17 modèles de la base, Mistral Large 3 arrive en tête avec 85 %, tandis que la médiane atteint 8 %. Cet écart révèle une forte concentration des performances au sommet et ne suggère pas une saturation générale du benchmark. Sa portée reste ciblée sur les dialogues multimodaux en anglais, le suivi d’instructions multi-tours et les réponses ouvertes en zero-shot. Son accès public crée par ailleurs un risque potentiel d’exposition des modèles au contenu d’évaluation, ce qui invite à considérer la contamination lors de l’interprétation des résultats.
Sources des scores : llm-stats.