MMLU-ProX

MMLU-ProX est un benchmark public créé en 2025 par l’équipe MMLU-ProX, menée par Weihao Xuan. Extension de MMLU-Pro fondée sur le cadre Massive Multitask Language Understanding, il rassemble des QCM difficiles et parallèles dans plusieurs langues, avec un format étendu pouvant approcher…

MMLU-ProX est un benchmark public créé en 2025 par l’équipe MMLU-ProX, menée par Weihao Xuan. Extension de MMLU-Pro fondée sur le cadre Massive Multitask Language Understanding, il rassemble des QCM difficiles et parallèles dans plusieurs langues, avec un format étendu pouvant approcher dix options.

Il mesure les capacités multidisciplinaires avancées des modèles dans des domaines académiques et professionnels, ainsi que leur raisonnement translingue. Son rôle est de comparer, par l’exactitude des réponses, la maîtrise de connaissances complexes et leur mobilisation dans un cadre multilingue.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkÉquipe MMLU-ProX (Weihao Xuan et al.)
Capacités mesuréesÉvaluation multilingue avancée multidisciplinaire (académique, professionnel) avec raisonnement translingue ; QCM difficiles parallèles entre langues.
ModalitéTexte
Type de questionsQCM étendu (jusqu'à ~10 options, comme MMLU-Pro)
Métrique d'évaluationExactitude
AccèsPublic
Langues29 langues
Taille du jeu11 829 questions par langue (29 langues) ; version lite : 658 questions/langue
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (32)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire87,0 %19 mai 2026Auto-déclaré
2Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire85,4 %31 mai 2026Auto-déclaré
3Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert84,7 %16 février 2026Auto-déclaré
4Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire84,7 %31 mars 2026Auto-déclaré
5Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert83,0 %4 juin 2026Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert82,2 %24 février 2026Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert82,2 %24 février 2026Auto-déclaré
8Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert81,0 %25 juillet 2025Auto-déclaré
9Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert81,0 %24 février 2026Auto-déclaré
10Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert80,6 %22 septembre 2025Auto-déclaré
11Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert79,4 %22 juillet 2025Auto-déclaré
12Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert79,4 %11 mars 2026Auto-déclaré
13Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert78,7 %10 septembre 2025Auto-déclaré
14Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,8 %22 septembre 2025Auto-déclaré
15Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert77,2 %22 septembre 2025Auto-déclaré
16Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert76,7 %10 septembre 2025Auto-déclaré
17Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert76,3 %2 mars 2026Auto-déclaré
18Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert76,1 %22 septembre 2025Auto-déclaré
19Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert73,4 %22 septembre 2025Auto-déclaré
20Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert71,5 %2 mars 2026Auto-déclaré
21Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,9 %22 septembre 2025Auto-déclaré
22Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert70,7 %22 septembre 2025Auto-déclaré
23Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert65,4 %22 septembre 2025Auto-déclaré
24Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert65,0 %22 septembre 2025Auto-déclaré
25Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert59,5 %15 décembre 2025Auto-déclaré
26Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert59,4 %22 septembre 2025Auto-déclaré
27Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert52,3 %2 mars 2026Auto-déclaré
28Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert34,6 %2 mars 2026Auto-déclaré
29Gemma 3n E4B InstructedGoogle🔒 Propriétaire19,9 %26 juin 2025Auto-déclaré
30Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert19,9 %20 mai 2025Auto-déclaré
31Gemma 3n E2B InstructedGoogle🔒 Propriétaire8,1 %26 juin 2025Auto-déclaré
32Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert8,1 %20 mai 2025Auto-déclaré

Classement établi sur 32 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 76,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMLU-ProX indique qu’un modèle répond correctement à une forte proportion de QCM difficiles, dans plusieurs langues et domaines, tout en mobilisant un raisonnement translingue. Dans la base, la médiane atteint 76 %, tandis que Qwen3.7 Max obtient 87 %. Cet écart montre que le classement distingue encore le meilleur résultat du niveau central des 32 modèles évalués, sans saturation complète au sommet.

L’interprétation exige toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis selon une mesure indépendante uniforme. Cette situation peut réduire la comparabilité si les conditions d’évaluation diffèrent. Le caractère public du jeu appelle aussi à considérer le risque de contamination lors de l’analyse des performances. Enfin, la portée reste celle de QCM académiques et professionnels parallèles entre langues. Un bon classement renseigne donc précisément sur l’exactitude dans ce cadre, mais ne constitue pas à lui seul une mesure générale de toutes les capacités d’un modèle.


Sources des scores : llm-stats.