MMLU-Pro
Créé en 2024 par TIGER AI Lab, MMLU-Pro est un benchmark public de compréhension multitâche conçu comme une extension plus robuste et plus difficile de MMLU. Il écarte les questions triviales et privilégie des tâches exigeant davantage de raisonnement.
Créé en 2024 par TIGER AI Lab, MMLU-Pro est un benchmark public de compréhension multitâche conçu comme une extension plus robuste et plus difficile de MMLU. Il écarte les questions triviales et privilégie des tâches exigeant davantage de raisonnement.
Ses QCM en anglais couvrent 14 domaines et proposent dix réponses possibles, contre quatre dans MMLU. MMLU-Pro sert ainsi à comparer la capacité des modèles à mobiliser leurs connaissances et leur raisonnement face à des problèmes variés, avec un niveau de difficulté plus discriminant.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | TIGER AI Lab |
| Capacités mesurées | finance, généraliste, santé, langage, juridique, mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | QCM à 10 choix |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 12 000 questions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (125)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 89,6 % | 19 mai 2026 | Auto-déclaré |
| 2 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 88,5 % | 31 mars 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 88,5 % | 31 mai 2026 | Auto-déclaré |
| 4 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 88,0 % | 23 décembre 2025 | Auto-déclaré |
| 5 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,8 % | 16 février 2026 | Auto-déclaré |
| 6 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 87,5 % | 23 avril 2026 | Auto-déclaré |
| 7 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 87,1 % | 27 janvier 2026 | Auto-déclaré |
| 8 | ERNIE 5.0 | Baidu | 🔒 Propriétaire | 87,0 % | 22 janvier 2026 | Auto-déclaré |
| 9 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 86,8 % | 4 juin 2026 | Auto-déclaré |
| 10 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,7 % | 24 février 2026 | Auto-déclaré |
| 11 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 86,2 % | 23 avril 2026 | Auto-déclaré |
| 12 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,2 % | 21 avril 2026 | Auto-déclaré |
| 13 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,1 % | 24 février 2026 | Auto-déclaré |
| 14 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,3 % | 24 février 2026 | Auto-déclaré |
| 15 | Gemma 4 31B | 🟢 Ouvert | 85,2 % | 2 avril 2026 | Auto-déclaré | |
| 16 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,2 % | 16 avril 2026 | Auto-déclaré |
| 17 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 85,0 % | 28 mai 2025 | Auto-déclaré |
| 18 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 85,0 % | 1 décembre 2025 | Auto-déclaré |
| 19 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 85,0 % | 1 décembre 2025 | Auto-déclaré |
| 20 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 85,0 % | 29 septembre 2025 | Auto-déclaré |
| 21 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 85,0 % | 2 juin 2026 | Auto-déclaré |
| 22 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 84,9 % | 16 décembre 2025 | Auto-déclaré |
| 23 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 84,6 % | 28 juillet 2025 | Auto-déclaré |
| 24 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,4 % | 25 juillet 2025 | Auto-déclaré |
| 25 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 84,3 % | 22 décembre 2025 | Auto-déclaré |
| 26 | K-EXAONE-236B-A23B | LG AI Research | 🔒 Propriétaire | 83,8 % | 31 décembre 2025 | Auto-déclaré |
| 27 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,8 % | 22 septembre 2025 | Auto-déclaré |
| 28 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 83,7 % | 11 mars 2026 | Auto-déclaré |
| 29 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 83,7 % | 10 janvier 2025 | Auto-déclaré |
| 30 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,0 % | 22 juillet 2025 | Auto-déclaré |
| 31 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,7 % | 10 septembre 2025 | Auto-déclaré |
| 32 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 82,7 % | 29 août 2025 | Auto-déclaré |
| 33 | Gemma 4 26B-A4B | 🟢 Ouvert | 82,6 % | 2 avril 2026 | Auto-déclaré | |
| 34 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 82,6 % | 22 septembre 2025 | Auto-déclaré |
| 35 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 82,5 % | 5 septembre 2025 | Auto-déclaré |
| 36 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,5 % | 2 mars 2026 | Auto-déclaré |
| 37 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,1 % | 22 septembre 2025 | Auto-déclaré |
| 38 | MiniMax M2 | MiniMax | 🟢 Ouvert | 82,0 % | 27 octobre 2025 | Auto-déclaré |
| 39 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,8 % | 22 septembre 2025 | Auto-déclaré |
| 40 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 81,7 % | 6 mars 2026 | Auto-déclaré |
| 41 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 81,6 % | 2 décembre 2025 | Auto-déclaré |
| 42 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 81,4 % | 28 juillet 2025 | Auto-déclaré |
| 43 | DeepSeek-V3 0324 | DeepSeek | 🟢 Ouvert | 81,2 % | 25 mars 2025 | Auto-déclaré |
| 44 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 81,1 % | 11 juillet 2025 | Auto-déclaré |
| 45 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 81,1 % | 5 septembre 2025 | Auto-déclaré |
| 46 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 80,9 % | 2 décembre 2025 | Auto-déclaré |
| 47 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 80,7 % | 5 août 2025 | Auto-déclaré |
| 48 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 80,7 % | 2 décembre 2025 | Auto-déclaré |
| 49 | MiniMax M1 | MiniMax | 🟢 Ouvert | 80,6 % | 17 juin 2025 | Auto-déclaré |
| 50 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,6 % | 10 septembre 2025 | Auto-déclaré |
| 51 | Llama 4 Maverick | Meta | 🟢 Ouvert | 80,5 % | 5 avril 2025 | Auto-déclaré |
| 52 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,5 % | 22 septembre 2025 | Auto-déclaré |
| 53 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 80,0 % | 6 mars 2026 | Auto-déclaré |
| 54 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,1 % | 2 mars 2026 | Auto-déclaré |
| 55 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,6 % | 22 septembre 2025 | Auto-déclaré |
| 56 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 78,3 % | 15 décembre 2025 | Auto-déclaré |
| 57 | LongCat-Flash-Lite | Meituan | 🟢 Ouvert | 78,3 % | 5 février 2026 | Auto-déclaré |
| 58 | Mistral Small 4 | Mistral AI | 🟢 Ouvert | 78,0 % | 16 mars 2026 | Auto-déclaré |
| 59 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,8 % | 22 septembre 2025 | Auto-déclaré |
| 60 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 77,6 % | 22 octobre 2024 | Auto-déclaré |
| 61 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 77,6 % | 10 juin 2026 | Auto-déclaré | |
| 62 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,3 % | 22 septembre 2025 | Auto-déclaré |
| 63 | Gemma 4 12B | 🟢 Ouvert | 77,2 % | 23 mai 2026 | Auto-déclaré | |
| 64 | Gemini 2.0 Flash | 🔒 Propriétaire | 76,4 % | 21 janvier 2025 | Auto-déclaré | |
| 65 | Phi 4 Reasoning Plus | Microsoft | 🟢 Ouvert | 76,0 % | 30 avril 2025 | Auto-déclaré |
| 66 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 75,9 % | 25 décembre 2024 | Auto-déclaré |
| 67 | Gemini 1.5 Pro | 🔒 Propriétaire | 75,8 % | 1 mai 2024 | Auto-déclaré | |
| 68 | Grok-2 | xAI | 🔒 Propriétaire | 75,5 % | 13 août 2024 | Auto-déclaré |
| 69 | GPT-4o | OpenAI | 🔒 Propriétaire | 74,7 % | 27 mars 2025 | Auto-déclaré |
| 70 | Llama 4 Scout | Meta | 🟢 Ouvert | 74,3 % | 5 avril 2025 | Auto-déclaré |
| 71 | Phi 4 Reasoning | Microsoft | 🟢 Ouvert | 74,3 % | 30 avril 2025 | Auto-déclaré |
| 72 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,6 % | 22 septembre 2025 | Auto-déclaré |
| 73 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 73,3 % | 23 juillet 2024 | Auto-déclaré |
| 74 | Grok-2 mini | xAI | 🔒 Propriétaire | 72,0 % | 13 août 2024 | Auto-déclaré |
| 75 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 71,6 % | 5 février 2025 | Auto-déclaré | |
| 76 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,6 % | 22 septembre 2025 | Auto-déclaré |
| 77 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,1 % | 19 septembre 2024 | Auto-déclaré |
| 78 | Phi 4 | Microsoft | 🟢 Ouvert | 70,4 % | 12 décembre 2024 | Auto-déclaré |
| 79 | Gemma 4 E4B | 🟢 Ouvert | 69,4 % | 2 avril 2026 | Auto-déclaré | |
| 80 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 69,2 % | 11 juillet 2025 | Auto-déclaré |
| 81 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 69,1 % | 20 juin 2025 | Auto-déclaré |
| 82 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,0 % | 19 septembre 2024 | Auto-déclaré |
| 83 | Llama 3.3 70B Instruct | Meta | 🟢 Ouvert | 68,9 % | 6 décembre 2024 | Auto-déclaré |
| 84 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,8 % | 28 février 2025 | Auto-déclaré |
| 85 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 68,5 % | 29 février 2024 | Auto-déclaré |
| 86 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 68,5 % | 27 avril 2026 | Auto-déclaré |
| 87 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,2 % | 29 avril 2025 | Auto-déclaré |
| 88 | Gemma 3 27B | 🟢 Ouvert | 67,5 % | 12 mars 2025 | Auto-déclaré | |
| 89 | Gemini 1.5 Flash | 🔒 Propriétaire | 67,3 % | 1 mai 2024 | Auto-déclaré | |
| 90 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,1 % | 22 septembre 2025 | Auto-déclaré |
| 91 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 67,0 % | 11 février 2026 | Auto-déclaré |
| 92 | Mistral Small 3.1 24B Instruct | Mistral AI | 🟢 Ouvert | 66,8 % | 17 mars 2025 | Auto-déclaré |
| 93 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,5 % | 2 mars 2026 | Auto-déclaré |
| 94 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 66,4 % | 23 juillet 2024 | Auto-déclaré |
| 95 | Mistral Small 3 24B Instruct | Mistral AI | 🟢 Ouvert | 66,3 % | 30 janvier 2025 | Auto-déclaré |
| 96 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 65,0 % | 4 novembre 2024 | Auto-déclaré |
| 97 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,4 % | 23 juillet 2024 | Auto-déclaré |
| 98 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,7 % | 19 septembre 2024 | Auto-déclaré |
| 99 | Gemma 3 12B | 🟢 Ouvert | 60,6 % | 12 mars 2025 | Auto-déclaré | |
| 100 | Gemma 4 E2B | 🟢 Ouvert | 60,0 % | 2 avril 2026 | Auto-déclaré | |
| 101 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 58,7 % | 15 mars 2024 | Auto-déclaré | |
| 102 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 56,8 % | 29 février 2024 | Auto-déclaré |
| 103 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,3 % | 19 septembre 2024 | Auto-déclaré |
| 104 | Mistral Small 3.1 24B Base | Mistral AI | 🟢 Ouvert | 56,0 % | 17 mars 2025 | Auto-déclaré |
| 105 | Mistral Small 3 24B Base | Mistral AI | 🟢 Ouvert | 54,4 % | 30 janvier 2025 | Auto-déclaré |
| 106 | Jamba 1.5 Large | AI21 Labs | 🟢 Ouvert | 53,5 % | 22 août 2024 | Auto-déclaré |
| 107 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 52,8 % | 30 avril 2025 | Auto-déclaré |
| 108 | Grok-1.5 | xAI | 🔒 Propriétaire | 51,0 % | 28 mars 2024 | Auto-déclaré |
| 109 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 50,6 % | 26 juin 2025 | Auto-déclaré | |
| 110 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 50,6 % | 20 mai 2025 | Auto-déclaré | |
| 111 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,4 % | 19 septembre 2024 | Auto-déclaré |
| 112 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 48,3 % | 23 juillet 2024 | Auto-déclaré |
| 113 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 47,4 % | 23 août 2024 | Auto-déclaré |
| 114 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 47,2 % | 15 août 2024 | Auto-déclaré |
| 115 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 47,0 % | 27 mars 2025 | Auto-déclaré |
| 116 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 45,3 % | 23 août 2024 | Auto-déclaré |
| 117 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,1 % | 23 juillet 2024 | Auto-déclaré |
| 118 | Gemma 3 4B | 🟢 Ouvert | 43,6 % | 12 mars 2025 | Auto-déclaré | |
| 119 | Jamba 1.5 Mini | AI21 Labs | 🟢 Ouvert | 42,5 % | 22 août 2024 | Auto-déclaré |
| 120 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 42,3 % | 2 mars 2026 | Auto-déclaré |
| 121 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 40,5 % | 26 juin 2025 | Auto-déclaré | |
| 122 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 40,5 % | 20 mai 2025 | Auto-déclaré | |
| 123 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 40,1 % | 19 septembre 2024 | Auto-déclaré |
| 124 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 16,0 % | 25 juin 2025 | Auto-déclaré |
| 125 | Gemma 3 1B | 🟢 Ouvert | 14,7 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 125 modèles évalués, dont 62 de grands éditeurs. Score médian de l'ensemble : 77,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMLU-Pro indique qu’un modèle répond correctement à une large part de questions difficiles, dans plusieurs domaines, malgré un choix parmi dix options. L’accuracy mesure directement cette réussite, mais ne décrit pas les étapes du raisonnement. Dans la base, 125 modèles atteignent un score médian de 77 %, tandis que Qwen3.7 Max arrive en tête à 90 %. Cet écart révèle une différenciation encore visible entre le modèle dominant et le niveau central, même si la proximité de certains résultats avec le plafond peut progressivement réduire le pouvoir discriminant du classement.
La rigueur d’interprétation dépend aussi de la provenance des scores, majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public peut en outre favoriser l’exposition des modèles aux questions, ce qui crée un risque de contamination et peut surestimer leur capacité de généralisation. Enfin, la portée reste circonscrite à des QCM en anglais dans 14 domaines. Le recul de 16 à 33 % par rapport à MMLU confirme toutefois que la sélection de questions plus exigeantes renforce la difficulté de l’évaluation.
Sources des scores : llm-stats.