MM-MT-Bench

MM-MT-Bench est un benchmark créé par Mistral AI en 2024 pour évaluer des modèles multimodaux ajustés au suivi d’instructions. Il repose sur des dialogues en anglais combinant texte et images, organisés sur plusieurs tours.

MM-MT-Bench est un benchmark créé par Mistral AI en 2024 pour évaluer des modèles multimodaux ajustés au suivi d’instructions. Il repose sur des dialogues en anglais combinant texte et images, organisés sur plusieurs tours.

Son objectif est de mesurer la capacité des modèles à suivre les demandes successives, à communiquer de façon cohérente et à répondre en zero-shot à des questions ouvertes. Les réponses sont appréciées par un LLM juge, ce qui permet de comparer les performances en vision-langage dans un cadre conversationnel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMistral AI
Capacités mesuréesmultimodal, vision-langage, suivi d'instructions multi-tours, communication, réponse à questions ouvertes en zero-shot
ModalitéMultimodal
Type de questionsdialogues multimodaux (texte + images) multi-tours, questions ouvertes, jugé par LLM
Métrique d'évaluationscore LLM-as-judge (échelle 1-10)
AccèsPublic
Languesanglais
Année de publication2024
RessourcesArticle scientifique

Classement des modèles (17)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Mistral Large 3Mistral AI🟢 Ouvert84,9 %1 septembre 2025Auto-déclaré
2Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert83,0 %22 septembre 2025Auto-déclaré
3Pixtral LargeMistral AI🟢 Ouvert74,0 %18 novembre 2024Auto-déclaré
4Pixtral-12BMistral AI🟢 Ouvert60,5 %17 septembre 2024Auto-déclaré
5Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert8,5 %22 septembre 2025Auto-déclaré
6Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert8,5 %22 septembre 2025Auto-déclaré
7MiniStral 3 (14B Instruct 2512)Mistral AI🟢 Ouvert8,5 %4 décembre 2025Auto-déclaré
8Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert8,4 %22 septembre 2025Auto-déclaré
9Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert8,1 %22 septembre 2025Auto-déclaré
10Ministral 3 (8B Instruct 2512)Mistral AI🟢 Ouvert8,1 %4 décembre 2025Auto-déclaré
11Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert8,0 %22 septembre 2025Auto-déclaré
12Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert7,9 %22 septembre 2025Auto-déclaré
13Ministral 3 (3B Instruct 2512)Mistral AI🟢 Ouvert7,8 %4 décembre 2025Auto-déclaré
14Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert7,7 %22 septembre 2025Auto-déclaré
15Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert7,7 %22 septembre 2025Auto-déclaré
16Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert7,5 %22 septembre 2025Auto-déclaré
17Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert6,0 %27 mars 2025Auto-déclaré

Classement établi sur 17 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 8,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle suit efficacement les instructions au fil d’un dialogue multimodal et produit des réponses ouvertes jugées satisfaisantes. L’évaluation repose toutefois sur un LLM-as-a-judge, avec une note sur une échelle de 1 à 10. Elle reflète donc le jugement du modèle évaluateur plutôt qu’une mesure entièrement objective. La fiabilité du classement doit aussi être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs.

Parmi les 17 modèles de la base, Mistral Large 3 arrive en tête avec 85 %, tandis que la médiane atteint 8 %. Cet écart révèle une forte concentration des performances au sommet et ne suggère pas une saturation générale du benchmark. Sa portée reste ciblée sur les dialogues multimodaux en anglais, le suivi d’instructions multi-tours et les réponses ouvertes en zero-shot. Son accès public crée par ailleurs un risque potentiel d’exposition des modèles au contenu d’évaluation, ce qui invite à considérer la contamination lors de l’interprétation des résultats.


Sources des scores : llm-stats.