CMMLU

CMMLU, pour Chinese Massive Multitask Language Understanding, est un benchmark public créé par Haonan Li et ses coauteurs en 2023. Il évalue en chinois les capacités de compréhension, de connaissance et de raisonnement des grands modèles de langage.

CMMLU, pour Chinese Massive Multitask Language Understanding, est un benchmark public créé par Haonan Li et ses coauteurs en 2023. Il évalue en chinois les capacités de compréhension, de connaissance et de raisonnement des grands modèles de langage.

Ses QCM couvrent 67 matières relevant notamment des sciences naturelles, des sciences sociales, de l’ingénierie et des humanités, avec des niveaux allant des notions élémentaires aux connaissances professionnelles avancées. CMMLU sert ainsi à comparer la maîtrise de contenus généraux et spécialisés dans un contexte linguistique chinois.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkHaonan Li et al.
Capacités mesuréesgénéraliste, langage, raisonnement
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
Langueschinois
Taille du jeuenviron 11 500 questions
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiMo-V2.5-ProXiaomi🟢 Ouvert90,2 %27 avril 2026Auto-déclaré
2Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert90,1 %23 juillet 2024Auto-déclaré
3LongCat-Flash-ChatMeituan🟢 Ouvert84,3 %29 août 2025Auto-déclaré
4LongCat-Flash-LiteMeituan🟢 Ouvert82,5 %5 février 2026Auto-déclaré
5MiniCPM-SALAOpenBMB🟢 Ouvert81,5 %11 février 2026Auto-déclaré
6ERNIE 4.5Baidu🔒 Propriétaire39,8 %25 juin 2025Auto-déclaré

Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 83,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur CMMLU indique qu’un modèle choisit fréquemment la bonne réponse dans des QCM chinois mobilisant compréhension linguistique, connaissances et raisonnement. Il témoigne d’une large maîtrise des matières couvertes, sans résumer à lui seul les capacités générales du modèle, puisque l’évaluation reste circonscrite au chinois, à 67 sujets et au format QCM.

La lecture du classement demande aussi de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’obtenus dans un protocole indépendant commun. Leur comparabilité dépend donc de la rigueur des évaluations rapportées. Le caractère public du jeu appelle également une vigilance quant à une possible contamination des données d’entraînement. Avec six modèles évalués, une médiane de 83 % et MiMo-V2.5-Pro en tête à 90 %, le classement montre un niveau globalement élevé et un avantage de sept points pour le meilleur modèle par rapport à la médiane. Cette concentration vers le haut peut réduire le pouvoir discriminant du benchmark et signaler un risque de saturation parmi les modèles les plus performants.


Sources des scores : llm-stats.