CMMLU
CMMLU, pour Chinese Massive Multitask Language Understanding, est un benchmark public créé par Haonan Li et ses coauteurs en 2023. Il évalue en chinois les capacités de compréhension, de connaissance et de raisonnement des grands modèles de langage.
CMMLU, pour Chinese Massive Multitask Language Understanding, est un benchmark public créé par Haonan Li et ses coauteurs en 2023. Il évalue en chinois les capacités de compréhension, de connaissance et de raisonnement des grands modèles de langage.
Ses QCM couvrent 67 matières relevant notamment des sciences naturelles, des sciences sociales, de l’ingénierie et des humanités, avec des niveaux allant des notions élémentaires aux connaissances professionnelles avancées. CMMLU sert ainsi à comparer la maîtrise de contenus généraux et spécialisés dans un contexte linguistique chinois.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Haonan Li et al. |
| Capacités mesurées | généraliste, langage, raisonnement |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | chinois |
| Taille du jeu | environ 11 500 questions |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 90,2 % | 27 avril 2026 | Auto-déclaré |
| 2 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,1 % | 23 juillet 2024 | Auto-déclaré |
| 3 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 84,3 % | 29 août 2025 | Auto-déclaré |
| 4 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 82,5 % | 5 février 2026 | Auto-déclaré |
| 5 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 81,5 % | 11 février 2026 | Auto-déclaré |
| 6 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 39,8 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 83,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur CMMLU indique qu’un modèle choisit fréquemment la bonne réponse dans des QCM chinois mobilisant compréhension linguistique, connaissances et raisonnement. Il témoigne d’une large maîtrise des matières couvertes, sans résumer à lui seul les capacités générales du modèle, puisque l’évaluation reste circonscrite au chinois, à 67 sujets et au format QCM.
La lecture du classement demande aussi de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’obtenus dans un protocole indépendant commun. Leur comparabilité dépend donc de la rigueur des évaluations rapportées. Le caractère public du jeu appelle également une vigilance quant à une possible contamination des données d’entraînement. Avec six modèles évalués, une médiane de 83 % et MiMo-V2.5-Pro en tête à 90 %, le classement montre un niveau globalement élevé et un avantage de sept points pour le meilleur modèle par rapport à la médiane. Cette concentration vers le haut peut réduire le pouvoir discriminant du benchmark et signaler un risque de saturation parmi les modèles les plus performants.
Sources des scores : llm-stats.