Multilingual MMLU
Multilingual MMLU est un benchmark public conçu par les auteurs de MMLU-ProX, Weihao Xuan et al., et publié en 2025. Héritier de MMLU-Pro, il repose sur des questions à choix multiple exigeantes, centrées sur le raisonnement et les connaissances académiques multidisciplinaires.
Multilingual MMLU est un benchmark public conçu par les auteurs de MMLU-ProX, Weihao Xuan et al., et publié en 2025. Héritier de MMLU-Pro, il repose sur des questions à choix multiple exigeantes, centrées sur le raisonnement et les connaissances académiques multidisciplinaires.
Ses versions linguistiques utilisent des questions identiques, ce qui permet de comparer directement les performances à travers 29 langues typologiquement diverses. Multilingual MMLU sert ainsi à évaluer la capacité des grands modèles de langage à raisonner au-delà des frontières linguistiques et culturelles, dans un cadre commun.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs MMLU-ProX (Weihao Xuan et al.) |
| Capacités mesurées | Raisonnement avance et connaissances academiques multidisciplinaires evalues de maniere comparable a travers langues et cultures. |
| Modalité | Texte |
| Type de questions | Questions a choix multiple (QCM, jusqu'a 10 options, type MMLU-Pro) |
| Métrique d'évaluation | Exactitude (accuracy) |
| Accès | Public |
| Langues | 29 langues typologiquement diverses |
| Taille du jeu | 11 829 questions identiques par langue (version lite : 658 par langue) x 29 langues |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | o3-mini | OpenAI | 🔒 Propriétaire | 80,7 % | 30 janvier 2025 | Auto-déclaré |
| 2 | Ministral 3 (14B Base 2512) | Mistral AI | 🟢 Ouvert | 74,2 % | 4 décembre 2025 | Auto-déclaré |
| 3 | Ministral 3 (8B Base 2512) | Mistral AI | 🟢 Ouvert | 70,6 % | 4 décembre 2025 | Auto-déclaré |
| 4 | Ministral 3 (3B Base 2512) | Mistral AI | 🟢 Ouvert | 65,2 % | 4 décembre 2025 | Auto-déclaré |
| 5 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 49,3 % | 30 avril 2025 | Auto-déclaré |
Classement établi sur 5 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 70,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé correspond à une forte proportion de réponses exactes sur des QCM pouvant comporter jusqu’à dix options. Il indique donc une bonne maîtrise des connaissances académiques et du raisonnement visés par MMLU-ProX, ainsi qu’une capacité à les mobiliser dans les langues évaluées. La structure identique des questions dans chaque langue renforce la comparabilité directe entre versions linguistiques, mais la portée reste celle d’une évaluation académique au format QCM. Elle ne résume pas l’ensemble des capacités d’un modèle.
Dans la base, cinq modèles ont été évalués. o3-mini obtient le meilleur résultat, avec 81 %, tandis que la médiane atteint 71 %. Cet écart montre une avance du premier modèle sur le niveau central du groupe, sans indiquer une saturation complète du benchmark. L’interprétation du classement exige toutefois de la prudence : les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis dans un processus de mesure indépendant et uniforme. Ils renseignent donc sur les performances rapportées, mais leur fiabilité dépend principalement des procédures appliquées par chaque éditeur.
Sources des scores : llm-stats.