MT-Bench
MT-Bench est un benchmark publié en 2023 par LMSYS Org (Zheng et al.) pour évaluer les capacités conversationnelles des grands modèles de langage. Il repose sur des échanges ouverts en plusieurs tours, examinés par un autre LLM agissant comme juge.
MT-Bench est un benchmark publié en 2023 par LMSYS Org (Zheng et al.) pour évaluer les capacités conversationnelles des grands modèles de langage. Il repose sur des échanges ouverts en plusieurs tours, examinés par un autre LLM agissant comme juge.
Les conversations couvrent notamment le raisonnement, l’écriture, le jeu de rôle, les mathématiques, le code et les connaissances générales. MT-Bench mesure ainsi la faculté à suivre des instructions tout en produisant des réponses cohérentes, utiles et nuancées dans la durée. Il facilite une comparaison standardisée et explicable des modèles conversationnels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | LMSYS Org (Zheng et al.) |
| Capacités mesurées | communication, créativité, généraliste, raisonnement, jeu de rôle |
| Modalité | Texte |
| Type de questions | questions ouvertes multi-tours évaluées par un juge LLM |
| Métrique d'évaluation | score moyen attribué par un juge LLM, généralement sur une échelle de 1 à 10 puis parfois remis à l’échelle |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais |
| Taille du jeu | 80 questions multi-tours, soit environ 160 tours |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,5 % | 19 septembre 2024 | Auto-déclaré |
| 2 | Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 🟢 Ouvert | 91,7 % | 18 mars 2025 | Auto-déclaré |
| 3 | DeepSeek-V2.5 | DeepSeek | 🟢 Ouvert | 90,2 % | 8 mai 2024 | Auto-déclaré |
| 4 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 89,9 % | 15 août 2024 | Auto-déclaré |
| 5 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,5 % | 19 septembre 2024 | Auto-déclaré |
| 6 | Mistral Large 2 | Mistral AI | 🟢 Ouvert | 86,3 % | 24 juillet 2024 | Auto-déclaré |
| 7 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,1 % | 23 juillet 2024 | Auto-déclaré |
| 8 | Mistral Small 3 24B Instruct | Mistral AI | 🟢 Ouvert | 83,5 % | 30 janvier 2025 | Auto-déclaré |
| 9 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 83,0 % | 16 octobre 2024 | Auto-déclaré |
| 10 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 🟢 Ouvert | 81,0 % | 18 mars 2025 | Auto-déclaré |
| 11 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 76,8 % | 17 septembre 2024 | Auto-déclaré |
| 12 | Llama 3.1 Nemotron 70B Instruct | NVIDIA | 🟢 Ouvert | 9,0 % | 1 octobre 2024 | Auto-déclaré |
Classement établi sur 12 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 85,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MT-Bench indique qu’un modèle répond efficacement à des consignes variées et conserve la cohérence, la pertinence et la nuance au fil de plusieurs tours. L’évaluation par un LLM juge permet de traiter à grande échelle des réponses ouvertes, mais elle reste dépendante des appréciations de ce juge. Dans cette base, les résultats étant majoritairement auto-déclarés par les éditeurs, leur rigueur et leur comparabilité doivent être considérées avec prudence.
Le score médian de 85 % et le meilleur résultat de 94 %, obtenu par Qwen2.5 72B Instruct, montrent un classement concentré dans le haut de l’échelle. Cette proximité peut signaler un début de saturation et réduire le pouvoir discriminant du benchmark entre modèles performants. Son accès public crée aussi un risque de contamination si les questions entrent dans les données d’entraînement. Enfin, sa portée reste centrée sur des conversations en anglais et sur les domaines couverts par ses questions. Parmi les douze modèles recensés, le classement met surtout en évidence l’avantage de Qwen2.5 72B Instruct sur cet ensemble précis de tâches conversationnelles.
Sources des scores : llm-stats.