Multilingual MMLU

Multilingual MMLU est un benchmark public conçu par les auteurs de MMLU-ProX, Weihao Xuan et al., et publié en 2025. Héritier de MMLU-Pro, il repose sur des questions à choix multiple exigeantes, centrées sur le raisonnement et les connaissances académiques multidisciplinaires.

Multilingual MMLU est un benchmark public conçu par les auteurs de MMLU-ProX, Weihao Xuan et al., et publié en 2025. Héritier de MMLU-Pro, il repose sur des questions à choix multiple exigeantes, centrées sur le raisonnement et les connaissances académiques multidisciplinaires.

Ses versions linguistiques utilisent des questions identiques, ce qui permet de comparer directement les performances à travers 29 langues typologiquement diverses. Multilingual MMLU sert ainsi à évaluer la capacité des grands modèles de langage à raisonner au-delà des frontières linguistiques et culturelles, dans un cadre commun.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs MMLU-ProX (Weihao Xuan et al.)
Capacités mesuréesRaisonnement avance et connaissances academiques multidisciplinaires evalues de maniere comparable a travers langues et cultures.
ModalitéTexte
Type de questionsQuestions a choix multiple (QCM, jusqu'a 10 options, type MMLU-Pro)
Métrique d'évaluationExactitude (accuracy)
AccèsPublic
Langues29 langues typologiquement diverses
Taille du jeu11 829 questions identiques par langue (version lite : 658 par langue) x 29 langues
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1o3-miniOpenAI🔒 Propriétaire80,7 %30 janvier 2025Auto-déclaré
2Ministral 3 (14B Base 2512)Mistral AI🟢 Ouvert74,2 %4 décembre 2025Auto-déclaré
3Ministral 3 (8B Base 2512)Mistral AI🟢 Ouvert70,6 %4 décembre 2025Auto-déclaré
4Ministral 3 (3B Base 2512)Mistral AI🟢 Ouvert65,2 %4 décembre 2025Auto-déclaré
5Phi 4 MiniMicrosoft🟢 Ouvert49,3 %30 avril 2025Auto-déclaré

Classement établi sur 5 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 70,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé correspond à une forte proportion de réponses exactes sur des QCM pouvant comporter jusqu’à dix options. Il indique donc une bonne maîtrise des connaissances académiques et du raisonnement visés par MMLU-ProX, ainsi qu’une capacité à les mobiliser dans les langues évaluées. La structure identique des questions dans chaque langue renforce la comparabilité directe entre versions linguistiques, mais la portée reste celle d’une évaluation académique au format QCM. Elle ne résume pas l’ensemble des capacités d’un modèle.

Dans la base, cinq modèles ont été évalués. o3-mini obtient le meilleur résultat, avec 81 %, tandis que la médiane atteint 71 %. Cet écart montre une avance du premier modèle sur le niveau central du groupe, sans indiquer une saturation complète du benchmark. L’interprétation du classement exige toutefois de la prudence : les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans un processus de mesure indépendant et uniforme. Ils renseignent donc sur les performances rapportées, mais leur fiabilité dépend principalement des procédures appliquées par chaque éditeur.


Sources des scores : llm-stats.