MMLU-Redux

MMLU-Redux est une version améliorée de MMLU, créée en 2024 par Aryo Pradipta Gema et des chercheurs de l’University of Edinburgh. Ses questions ont été ré-annotées manuellement afin d’identifier et de corriger des erreurs présentes dans le jeu original.

MMLU-Redux est une version améliorée de MMLU, créée en 2024 par Aryo Pradipta Gema et des chercheurs de l’University of Edinburgh. Ses questions ont été ré-annotées manuellement afin d’identifier et de corriger des erreurs présentes dans le jeu original.

Le benchmark mesure les connaissances générales multitâches des modèles de langage dans un large éventail de matières académiques et professionnelles. Son format standardisé permet de comparer leur capacité à sélectionner une réponse correcte, avec une évaluation rendue plus fiable par le travail de correction des données.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkUniversity of Edinburgh et al. (Aryo Pradipta Gema et al.)
Capacités mesuréesConnaissances multitâches générales (57 matières académiques et professionnelles), version corrigée pour une évaluation plus fiable.
ModalitéTexte
Type de questionsQCM (questions à choix multiples, 4 options)
Métrique d'évaluationExactitude
AccèsPublic
LanguesAnglais
Taille du jeu5 700 questions ré-annotées manuellement (57 matières)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (48)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire95,0 %19 mai 2026Auto-déclaré
2Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert94,9 %16 février 2026Auto-déclaré
3Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire94,5 %31 mars 2026Auto-déclaré
4Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire94,5 %31 mai 2026Auto-déclaré
5Kimi K2 0905Moonshot AI🔒 Propriétaire94,4 %5 septembre 2025Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert94,0 %24 février 2026Auto-déclaré
7Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert93,8 %25 juillet 2025Auto-déclaré
8Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert93,7 %22 septembre 2025Auto-déclaré
9Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert93,5 %21 avril 2026Auto-déclaré
10DeepSeek-R1-0528DeepSeek🟢 Ouvert93,4 %28 mai 2025Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert93,3 %24 février 2026Auto-déclaré
12Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert93,3 %16 avril 2026Auto-déclaré
13Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert93,2 %24 février 2026Auto-déclaré
14Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert93,1 %22 juillet 2025Auto-déclaré
15MiMo-V2.5-ProXiaomi🟢 Ouvert92,8 %27 avril 2026Auto-déclaré
16Kimi K2 InstructMoonshot AI🟢 Ouvert92,7 %11 juillet 2025Auto-déclaré
17Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert92,7 %5 septembre 2025Auto-déclaré
18Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert92,5 %10 septembre 2025Auto-déclaré
19Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert92,2 %22 septembre 2025Auto-déclaré
20Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert91,9 %22 septembre 2025Auto-déclaré
21DeepSeek-V3.1DeepSeek🟢 Ouvert91,8 %10 janvier 2025Auto-déclaré
22Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert91,1 %2 mars 2026Auto-déclaré
23Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert90,9 %22 septembre 2025Auto-déclaré
24Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert90,9 %10 septembre 2025Auto-déclaré
25Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,8 %22 septembre 2025Auto-déclaré
26LongCat-Flash-ThinkingMeituan🟢 Ouvert89,3 %22 septembre 2025Auto-déclaré
27DeepSeek-V3DeepSeek🟢 Ouvert89,1 %25 décembre 2024Auto-déclaré
28Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert88,8 %22 septembre 2025Auto-déclaré
29Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert88,8 %2 mars 2026Auto-déclaré
30Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,4 %22 septembre 2025Auto-déclaré
31Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert87,4 %29 avril 2025Auto-déclaré
32Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert86,8 %19 septembre 2024Auto-déclaré
33Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert86,0 %22 septembre 2025Auto-déclaré
34Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,9 %22 septembre 2025Auto-déclaré
35Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %19 septembre 2024Auto-déclaré
36Ministral 3 (14B Base 2512)Mistral AI🟢 Ouvert82,0 %4 décembre 2025Auto-déclaré
37Mistral Large 3Mistral AI🟢 Ouvert82,0 %1 septembre 2025Auto-déclaré
38Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert81,5 %22 septembre 2025Auto-déclaré
39Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,0 %19 septembre 2024Auto-déclaré
40Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert79,6 %2 mars 2026Auto-déclaré
41Ministral 3 (8B Base 2512)Mistral AI🟢 Ouvert79,3 %4 décembre 2025Auto-déclaré
42Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,5 %19 septembre 2024Auto-déclaré
43Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert75,4 %19 septembre 2024Auto-déclaré
44Ministral 3 (3B Base 2512)Mistral AI🟢 Ouvert73,5 %4 décembre 2025Auto-déclaré
45Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert71,0 %27 mars 2025Auto-déclaré
46Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert66,6 %19 septembre 2024Auto-déclaré
47Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert59,5 %2 mars 2026Auto-déclaré
48ERNIE 4.5Baidu🔒 Propriétaire43,2 %25 juin 2025Auto-déclaré

Classement établi sur 48 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 90,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMLU-Redux indique une forte exactitude face à des QCM couvrant 57 matières, mais il reflète avant tout la capacité à répondre dans ce cadre précis. La ré-annotation manuelle renforce la rigueur du jeu en corrigeant des problèmes de qualité de MMLU. En revanche, les résultats recensés sont majoritairement auto-déclarés par les éditeurs, ce qui appelle à distinguer la qualité intrinsèque du benchmark des conditions de mesure et de publication des scores.

Avec une médiane de 90 % parmi 48 modèles et un meilleur résultat de 95 % pour Qwen3.7 Max, le classement montre des performances élevées et relativement resserrées en tête. Cette proximité suggère une saturation partielle, qui réduit le pouvoir discriminant entre les meilleurs modèles. L’accès public implique aussi de considérer le risque de contamination lors de l’interprétation. Enfin, la portée reste circonscrite à des questions en anglais, à choix multiples et centrées sur les connaissances académiques et professionnelles. Le classement révèle donc surtout des écarts d’exactitude sur ce périmètre, plutôt qu’une mesure générale de toutes les capacités d’un modèle.


Sources des scores : llm-stats.