Humanity's Last Exam
Humanity's Last Exam est un benchmark académique multimodal créé en 2025 par le Center for AI Safety (CAIS) et Scale AI. Il confronte les modèles à des questions expertes en mathématiques, sciences naturelles et sciences humaines, avec des solutions conçues pour être vérifiables et sans…
Humanity's Last Exam est un benchmark académique multimodal créé en 2025 par le Center for AI Safety (CAIS) et Scale AI. Il confronte les modèles à des questions expertes en mathématiques, sciences naturelles et sciences humaines, avec des solutions conçues pour être vérifiables et sans ambiguïté.
Ses questions ouvertes à réponse courte et ses QCM évaluent notamment le raisonnement, la maîtrise de connaissances situées aux frontières du savoir humain et l'interprétation visuelle. HLE sert ainsi à comparer les capacités de modèles avancés sur un ensemble académique exigeant.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Center for AI Safety (CAIS) et Scale AI |
| Capacités mesurées | mathématiques, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | questions académiques multimodales, principalement questions ouvertes à réponse courte et QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 2 500 questions |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (89)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Mythos Preview | Anthropic | 🔒 Propriétaire | 64,7 % | — | Auto-déclaré |
| 2 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 64,5 % | 9 juin 2026 | Auto-déclaré |
| 3 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 62,1 % | 9 juillet 2026 | Auto-déclaré |
| 4 | Muse Spark | Meta | 🔒 Propriétaire | 58,4 % | 8 avril 2026 | Auto-déclaré |
| 5 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 57,9 % | 28 mai 2026 | Auto-déclaré |
| 6 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 57,4 % | 30 juin 2026 | Auto-déclaré |
| 7 | GPT-5.5 Pro | OpenAI | 🔒 Propriétaire | 57,2 % | 23 avril 2026 | Auto-déclaré |
| 8 | Kimi K3 | Moonshot AI | ▫ n.d. | 56,0 % | 16 juillet 2026 | Auto-déclaré |
| 9 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 55,7 % | 24 juin 2026 | Auto-déclaré |
| 10 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 54,7 % | 16 avril 2026 | Auto-déclaré |
| 11 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 54,7 % | 16 juin 2026 | Auto-déclaré |
| 12 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 54,6 % | 24 juin 2026 | Auto-déclaré |
| 13 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 53,1 % | 5 février 2026 | Auto-déclaré |
| 14 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 52,3 % | 7 avril 2026 | Auto-déclaré |
| 15 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 52,2 % | 23 avril 2026 | Auto-déclaré |
| 16 | Gemini 3.1 Pro Preview | ▫ n.d. | 51,4 % | 19 février 2026 | Auto-déclaré | |
| 17 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 51,0 % | 5 septembre 2025 | Auto-déclaré |
| 18 | Grok-4 Heavy | xAI | 🔒 Propriétaire | 50,7 % | — | Auto-déclaré |
| 19 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 50,2 % | 27 janvier 2026 | Auto-déclaré |
| 20 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 49,0 % | 17 février 2026 | Auto-déclaré |
| 21 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 48,5 % | 24 février 2026 | Auto-déclaré |
| 22 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 48,2 % | 23 avril 2026 | Auto-déclaré |
| 23 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 47,5 % | 24 février 2026 | Auto-déclaré |
| 24 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 47,4 % | 24 février 2026 | Auto-déclaré |
| 25 | Gemini 3 Pro | 🔒 Propriétaire | 45,8 % | 18 novembre 2025 | Auto-déclaré | |
| 26 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 45,1 % | 23 avril 2026 | Auto-déclaré |
| 27 | Gemini 3 Flash | 🔒 Propriétaire | 43,5 % | 17 décembre 2025 | Auto-déclaré | |
| 28 | GLM-4.7 | Zhipu AI | 🟢 Ouvert | 42,8 % | 22 décembre 2025 | Auto-déclaré |
| 29 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 41,4 % | 19 mai 2026 | Auto-déclaré |
| 30 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 40,8 % | 1 décembre 2025 | Auto-déclaré |
| 31 | Gemini 3.5 Flash | 🔒 Propriétaire | 40,2 % | 19 mai 2026 | Auto-déclaré | |
| 32 | Grok-4 | xAI | 🔒 Propriétaire | 40,0 % | 9 juillet 2025 | Auto-déclaré |
| 33 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 39,8 % | 5 mars 2026 | Auto-déclaré |
| 34 | ERNIE 5.0 | Baidu | 🔒 Propriétaire | 39,0 % | 22 janvier 2026 | Auto-déclaré |
| 35 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 37,4 % | 4 juin 2026 | Auto-déclaré |
| 36 | GPT-5.2 Pro | OpenAI | 🔒 Propriétaire | 36,6 % | 11 décembre 2025 | Auto-déclaré |
| 37 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 36,4 % | 20 avril 2026 | Auto-déclaré |
| 38 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 34,7 % | 31 mai 2026 | Auto-déclaré |
| 39 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 34,5 % | 11 décembre 2025 | Auto-déclaré |
| 40 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 34,0 % | 27 avril 2026 | Auto-déclaré |
| 41 | DeepSeek-V3.2-Speciale | DeepSeek | 🟢 Ouvert | 30,6 % | 1 décembre 2025 | Auto-déclaré |
| 42 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 28,8 % | 31 mars 2026 | Auto-déclaré |
| 43 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 28,7 % | 16 février 2026 | Auto-déclaré |
| 44 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 28,2 % | 17 mars 2026 | Auto-déclaré |
| 45 | Gemma 4 31B | 🟢 Ouvert | 26,5 % | 2 avril 2026 | Auto-déclaré | |
| 46 | LongCat-Flash-Thinking-2601 | Meituan | 🟢 Ouvert | 25,2 % | 14 janvier 2026 | Auto-déclaré |
| 47 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 25,1 % | 1 décembre 2025 | Auto-déclaré |
| 48 | GPT-5 | OpenAI | 🔒 Propriétaire | 24,8 % | 7 août 2025 | Auto-déclaré |
| 49 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 24,3 % | 17 mars 2026 | Auto-déclaré |
| 50 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 24,0 % | 21 avril 2026 | Auto-déclaré |
| 51 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 22,8 % | 11 mars 2026 | Auto-déclaré |
| 52 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 22,1 % | 16 décembre 2025 | Auto-déclaré |
| 53 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 22,0 % | 23 décembre 2025 | Auto-déclaré |
| 54 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 21,6 % | 5 juin 2025 | Auto-déclaré | |
| 55 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 21,4 % | 16 avril 2026 | Auto-déclaré |
| 56 | Grok 4 Fast | xAI | 🔒 Propriétaire | 20,0 % | 28 août 2025 | Auto-déclaré |
| 57 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 19,8 % | 29 septembre 2025 | Auto-déclaré |
| 58 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 18,2 % | 25 juillet 2025 | Auto-déclaré |
| 59 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 18,0 % | 2 juin 2026 | Auto-déclaré |
| 60 | Gemini 2.5 Pro | 🔒 Propriétaire | 17,8 % | 20 mai 2025 | Auto-déclaré | |
| 61 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 17,7 % | 28 mai 2025 | Auto-déclaré |
| 62 | GLM-4.6 | Zhipu AI | 🟢 Ouvert | 17,2 % | 30 septembre 2025 | Auto-déclaré |
| 63 | Gemma 4 26B-A4B | 🟢 Ouvert | 17,2 % | 2 avril 2026 | Auto-déclaré | |
| 64 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 16,7 % | 7 août 2025 | Auto-déclaré |
| 65 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 16,0 % | 3 mars 2026 | Auto-déclaré | |
| 66 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 15,9 % | 10 janvier 2025 | Auto-déclaré |
| 67 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 15,5 % | 15 décembre 2025 | Auto-déclaré |
| 68 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 14,9 % | 5 août 2025 | Auto-déclaré |
| 69 | o3 | OpenAI | 🔒 Propriétaire | 14,7 % | 16 avril 2025 | Auto-déclaré |
| 70 | o4-mini | OpenAI | 🔒 Propriétaire | 14,7 % | 16 avril 2025 | Auto-déclaré |
| 71 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 14,4 % | 28 juillet 2025 | Auto-déclaré |
| 72 | GLM-4.7-Flash | Zhipu AI | 🟢 Ouvert | 14,4 % | 19 janvier 2026 | Auto-déclaré |
| 73 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 13,6 % | 22 septembre 2025 | Auto-déclaré |
| 74 | MiniMax M2 | MiniMax | 🟢 Ouvert | 12,5 % | 27 octobre 2025 | Auto-déclaré |
| 75 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 11,9 % | 10 juin 2026 | Auto-déclaré | |
| 76 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 11,2 % | 6 mars 2026 | Auto-déclaré |
| 77 | Gemini 2.5 Flash | 🔒 Propriétaire | 11,0 % | 20 mai 2025 | Auto-déclaré | |
| 78 | GPT OSS 20B | OpenAI | 🟢 Ouvert | 10,9 % | 5 août 2025 | Auto-déclaré |
| 79 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 10,6 % | 28 juillet 2025 | Auto-déclaré |
| 80 | Magistral Medium | Mistral AI | 🟢 Ouvert | 9,0 % | 10 juin 2025 | Auto-déclaré |
| 81 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 8,7 % | 7 août 2025 | Auto-déclaré |
| 82 | MiniMax M1 | MiniMax | 🟢 Ouvert | 7,2 % | 17 juin 2025 | Auto-déclaré |
| 83 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 5,4 % | 14 avril 2025 | Auto-déclaré |
| 84 | GPT-4o | OpenAI | 🔒 Propriétaire | 5,3 % | 27 mars 2025 | Auto-déclaré |
| 85 | Gemma 4 12B | 🟢 Ouvert | 5,2 % | 23 mai 2026 | Auto-déclaré | |
| 86 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 5,1 % | 17 juin 2025 | Auto-déclaré | |
| 87 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 4,7 % | 11 juillet 2025 | Auto-déclaré |
| 88 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 4,7 % | 5 septembre 2025 | Auto-déclaré |
| 89 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 3,7 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 89 modèles évalués, dont 55 de grands éditeurs. Score médian de l'ensemble : 26,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Humanity's Last Exam indique qu'un modèle fournit davantage de réponses exactes à des problèmes académiques experts, y compris lorsque leur résolution combine connaissances spécialisées, raisonnement et interprétation visuelle. Dans la base, Claude Mythos Preview domine avec 65 %, contre une médiane de 25 % parmi 87 modèles. Cet écart révèle une forte différenciation des performances, tandis que le meilleur résultat reste éloigné d'une accuracy parfaite, ce qui ne suggère pas une saturation générale du benchmark.
La lecture du classement exige néanmoins de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune, ce qui limite leur comparabilité. L'accès public peut aussi accroître le risque que les questions entrent dans les données ou pratiques d'entraînement, avec un possible effet de contamination sur les résultats. Enfin, la portée de HLE reste celle de questions académiques en anglais, principalement ouvertes à réponse courte ou sous forme de QCM. Le classement renseigne donc sur cette capacité ciblée, et non sur l'ensemble des usages possibles d'un modèle.
Sources des scores : llm-stats.