MMLU-ProX
MMLU-ProX est un benchmark public créé en 2025 par l’équipe MMLU-ProX, menée par Weihao Xuan. Extension de MMLU-Pro fondée sur le cadre Massive Multitask Language Understanding, il rassemble des QCM difficiles et parallèles dans plusieurs langues, avec un format étendu pouvant approcher…
MMLU-ProX est un benchmark public créé en 2025 par l’équipe MMLU-ProX, menée par Weihao Xuan. Extension de MMLU-Pro fondée sur le cadre Massive Multitask Language Understanding, il rassemble des QCM difficiles et parallèles dans plusieurs langues, avec un format étendu pouvant approcher dix options.
Il mesure les capacités multidisciplinaires avancées des modèles dans des domaines académiques et professionnels, ainsi que leur raisonnement translingue. Son rôle est de comparer, par l’exactitude des réponses, la maîtrise de connaissances complexes et leur mobilisation dans un cadre multilingue.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Équipe MMLU-ProX (Weihao Xuan et al.) |
| Capacités mesurées | Évaluation multilingue avancée multidisciplinaire (académique, professionnel) avec raisonnement translingue ; QCM difficiles parallèles entre langues. |
| Modalité | Texte |
| Type de questions | QCM étendu (jusqu'à ~10 options, comme MMLU-Pro) |
| Métrique d'évaluation | Exactitude |
| Accès | Public |
| Langues | 29 langues |
| Taille du jeu | 11 829 questions par langue (29 langues) ; version lite : 658 questions/langue |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (32)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 87,0 % | 19 mai 2026 | Auto-déclaré |
| 2 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 85,4 % | 31 mai 2026 | Auto-déclaré |
| 3 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,7 % | 16 février 2026 | Auto-déclaré |
| 4 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 84,7 % | 31 mars 2026 | Auto-déclaré |
| 5 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 83,0 % | 4 juin 2026 | Auto-déclaré |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,2 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,2 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,0 % | 25 juillet 2025 | Auto-déclaré |
| 9 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,0 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,6 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,4 % | 22 juillet 2025 | Auto-déclaré |
| 12 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 79,4 % | 11 mars 2026 | Auto-déclaré |
| 13 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,7 % | 10 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,8 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,2 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,7 % | 10 septembre 2025 | Auto-déclaré |
| 17 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,3 % | 2 mars 2026 | Auto-déclaré |
| 18 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,1 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,4 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,5 % | 2 mars 2026 | Auto-déclaré |
| 21 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,9 % | 22 septembre 2025 | Auto-déclaré |
| 22 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,7 % | 22 septembre 2025 | Auto-déclaré |
| 23 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,4 % | 22 septembre 2025 | Auto-déclaré |
| 24 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,0 % | 22 septembre 2025 | Auto-déclaré |
| 25 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 59,5 % | 15 décembre 2025 | Auto-déclaré |
| 26 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,4 % | 22 septembre 2025 | Auto-déclaré |
| 27 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,3 % | 2 mars 2026 | Auto-déclaré |
| 28 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 34,6 % | 2 mars 2026 | Auto-déclaré |
| 29 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 19,9 % | 26 juin 2025 | Auto-déclaré | |
| 30 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 19,9 % | 20 mai 2025 | Auto-déclaré | |
| 31 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 8,1 % | 26 juin 2025 | Auto-déclaré | |
| 32 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 8,1 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 32 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 76,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMLU-ProX indique qu’un modèle répond correctement à une forte proportion de QCM difficiles, dans plusieurs langues et domaines, tout en mobilisant un raisonnement translingue. Dans la base, la médiane atteint 76 %, tandis que Qwen3.7 Max obtient 87 %. Cet écart montre que le classement distingue encore le meilleur résultat du niveau central des 32 modèles évalués, sans saturation complète au sommet.
L’interprétation exige toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, plutôt qu’établis selon une mesure indépendante uniforme. Cette situation peut réduire la comparabilité si les conditions d’évaluation diffèrent. Le caractère public du jeu appelle aussi à considérer le risque de contamination lors de l’analyse des performances. Enfin, la portée reste celle de QCM académiques et professionnels parallèles entre langues. Un bon classement renseigne donc précisément sur l’exactitude dans ce cadre, mais ne constitue pas à lui seul une mesure générale de toutes les capacités d’un modèle.
Sources des scores : llm-stats.