MMLU-Redux
MMLU-Redux est une version améliorée de MMLU, créée en 2024 par Aryo Pradipta Gema et des chercheurs de l’University of Edinburgh. Ses questions ont été ré-annotées manuellement afin d’identifier et de corriger des erreurs présentes dans le jeu original.
MMLU-Redux est une version améliorée de MMLU, créée en 2024 par Aryo Pradipta Gema et des chercheurs de l’University of Edinburgh. Ses questions ont été ré-annotées manuellement afin d’identifier et de corriger des erreurs présentes dans le jeu original.
Le benchmark mesure les connaissances générales multitâches des modèles de langage dans un large éventail de matières académiques et professionnelles. Son format standardisé permet de comparer leur capacité à sélectionner une réponse correcte, avec une évaluation rendue plus fiable par le travail de correction des données.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | University of Edinburgh et al. (Aryo Pradipta Gema et al.) |
| Capacités mesurées | Connaissances multitâches générales (57 matières académiques et professionnelles), version corrigée pour une évaluation plus fiable. |
| Modalité | Texte |
| Type de questions | QCM (questions à choix multiples, 4 options) |
| Métrique d'évaluation | Exactitude |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 5 700 questions ré-annotées manuellement (57 matières) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (48)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 95,0 % | 19 mai 2026 | Auto-déclaré |
| 2 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,9 % | 16 février 2026 | Auto-déclaré |
| 3 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 94,5 % | 31 mars 2026 | Auto-déclaré |
| 4 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 94,5 % | 31 mai 2026 | Auto-déclaré |
| 5 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 94,4 % | 5 septembre 2025 | Auto-déclaré |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 94,0 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,8 % | 25 juillet 2025 | Auto-déclaré |
| 8 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,7 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,5 % | 21 avril 2026 | Auto-déclaré |
| 10 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 93,4 % | 28 mai 2025 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,3 % | 24 février 2026 | Auto-déclaré |
| 12 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,3 % | 16 avril 2026 | Auto-déclaré |
| 13 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,2 % | 24 février 2026 | Auto-déclaré |
| 14 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,1 % | 22 juillet 2025 | Auto-déclaré |
| 15 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 92,8 % | 27 avril 2026 | Auto-déclaré |
| 16 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 92,7 % | 11 juillet 2025 | Auto-déclaré |
| 17 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 92,7 % | 5 septembre 2025 | Auto-déclaré |
| 18 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,5 % | 10 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,2 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,9 % | 22 septembre 2025 | Auto-déclaré |
| 21 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 91,8 % | 10 janvier 2025 | Auto-déclaré |
| 22 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,1 % | 2 mars 2026 | Auto-déclaré |
| 23 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,9 % | 22 septembre 2025 | Auto-déclaré |
| 24 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,9 % | 10 septembre 2025 | Auto-déclaré |
| 25 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,8 % | 22 septembre 2025 | Auto-déclaré |
| 26 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 89,3 % | 22 septembre 2025 | Auto-déclaré |
| 27 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 89,1 % | 25 décembre 2024 | Auto-déclaré |
| 28 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,8 % | 22 septembre 2025 | Auto-déclaré |
| 29 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,8 % | 2 mars 2026 | Auto-déclaré |
| 30 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,4 % | 22 septembre 2025 | Auto-déclaré |
| 31 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,4 % | 29 avril 2025 | Auto-déclaré |
| 32 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,8 % | 19 septembre 2024 | Auto-déclaré |
| 33 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,0 % | 22 septembre 2025 | Auto-déclaré |
| 34 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,9 % | 22 septembre 2025 | Auto-déclaré |
| 35 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 19 septembre 2024 | Auto-déclaré |
| 36 | Ministral 3 (14B Base 2512) | Mistral AI | 🟢 Ouvert | 82,0 % | 4 décembre 2025 | Auto-déclaré |
| 37 | Mistral Large 3 | Mistral AI | 🟢 Ouvert | 82,0 % | 1 septembre 2025 | Auto-déclaré |
| 38 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,5 % | 22 septembre 2025 | Auto-déclaré |
| 39 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,0 % | 19 septembre 2024 | Auto-déclaré |
| 40 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,6 % | 2 mars 2026 | Auto-déclaré |
| 41 | Ministral 3 (8B Base 2512) | Mistral AI | 🟢 Ouvert | 79,3 % | 4 décembre 2025 | Auto-déclaré |
| 42 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,5 % | 19 septembre 2024 | Auto-déclaré |
| 43 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,4 % | 19 septembre 2024 | Auto-déclaré |
| 44 | Ministral 3 (3B Base 2512) | Mistral AI | 🟢 Ouvert | 73,5 % | 4 décembre 2025 | Auto-déclaré |
| 45 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,0 % | 27 mars 2025 | Auto-déclaré |
| 46 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,6 % | 19 septembre 2024 | Auto-déclaré |
| 47 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,5 % | 2 mars 2026 | Auto-déclaré |
| 48 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 43,2 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 48 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 90,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMLU-Redux indique une forte exactitude face à des QCM couvrant 57 matières, mais il reflète avant tout la capacité à répondre dans ce cadre précis. La ré-annotation manuelle renforce la rigueur du jeu en corrigeant des problèmes de qualité de MMLU. En revanche, les résultats recensés sont majoritairement auto-déclarés par les éditeurs, ce qui appelle à distinguer la qualité intrinsèque du benchmark des conditions de mesure et de publication des scores.
Avec une médiane de 90 % parmi 48 modèles et un meilleur résultat de 95 % pour Qwen3.7 Max, le classement montre des performances élevées et relativement resserrées en tête. Cette proximité suggère une saturation partielle, qui réduit le pouvoir discriminant entre les meilleurs modèles. L’accès public implique aussi de considérer le risque de contamination lors de l’interprétation. Enfin, la portée reste circonscrite à des questions en anglais, à choix multiples et centrées sur les connaissances académiques et professionnelles. Le classement révèle donc surtout des écarts d’exactitude sur ce périmètre, plutôt qu’une mesure générale de toutes les capacités d’un modèle.
Sources des scores : llm-stats.