Humanity's Last Exam

Humanity's Last Exam est un benchmark académique multimodal créé en 2025 par le Center for AI Safety (CAIS) et Scale AI. Il confronte les modèles à des questions expertes en mathématiques, sciences naturelles et sciences humaines, avec des solutions conçues pour être vérifiables et sans…

Humanity's Last Exam est un benchmark académique multimodal créé en 2025 par le Center for AI Safety (CAIS) et Scale AI. Il confronte les modèles à des questions expertes en mathématiques, sciences naturelles et sciences humaines, avec des solutions conçues pour être vérifiables et sans ambiguïté.

Ses questions ouvertes à réponse courte et ses QCM évaluent notamment le raisonnement, la maîtrise de connaissances situées aux frontières du savoir humain et l'interprétation visuelle. HLE sert ainsi à comparer les capacités de modèles avancés sur un ensemble académique exigeant.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkCenter for AI Safety (CAIS) et Scale AI
Capacités mesuréesmathématiques, raisonnement, vision
ModalitéMultimodal
Type de questionsquestions académiques multimodales, principalement questions ouvertes à réponse courte et QCM
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeuenviron 2 500 questions
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (89)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Mythos PreviewAnthropic🔒 Propriétaire64,7 %Auto-déclaré
2Claude Fable 5Anthropic🔒 Propriétaire64,5 %9 juin 2026Auto-déclaré
3Muse Spark 1.1Meta🔒 Propriétaire62,1 %9 juillet 2026Auto-déclaré
4Muse SparkMeta🔒 Propriétaire58,4 %8 avril 2026Auto-déclaré
5Claude Opus 4.8Anthropic🔒 Propriétaire57,9 %28 mai 2026Auto-déclaré
6Claude Sonnet 5Anthropic🔒 Propriétaire57,4 %30 juin 2026Auto-déclaré
7GPT-5.5 ProOpenAI🔒 Propriétaire57,2 %23 avril 2026Auto-déclaré
8Kimi K3Moonshot AI▫ n.d.56,0 %16 juillet 2026Auto-déclaré
9Seed 2.1 ProByteDance🔒 Propriétaire55,7 %24 juin 2026Auto-déclaré
10Claude Opus 4.7Anthropic🔒 Propriétaire54,7 %16 avril 2026Auto-déclaré
11GLM-5.2Zhipu AI🟢 Ouvert54,7 %16 juin 2026Auto-déclaré
12Seed 2.1 TurboByteDance🔒 Propriétaire54,6 %24 juin 2026Auto-déclaré
13Claude Opus 4.6Anthropic🔒 Propriétaire53,1 %5 février 2026Auto-déclaré
14GLM-5.1Zhipu AI🟢 Ouvert52,3 %7 avril 2026Auto-déclaré
15GPT-5.5OpenAI🔒 Propriétaire52,2 %23 avril 2026Auto-déclaré
16Gemini 3.1 Pro PreviewGoogle▫ n.d.51,4 %19 février 2026Auto-déclaré
17Kimi K2 0905Moonshot AI🔒 Propriétaire51,0 %5 septembre 2025Auto-déclaré
18Grok-4 HeavyxAI🔒 Propriétaire50,7 %Auto-déclaré
19Kimi K2.5Moonshot AI🟢 Ouvert50,2 %27 janvier 2026Auto-déclaré
20Claude Sonnet 4.6Anthropic🔒 Propriétaire49,0 %17 février 2026Auto-déclaré
21Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert48,5 %24 février 2026Auto-déclaré
22DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert48,2 %23 avril 2026Auto-déclaré
23Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert47,5 %24 février 2026Auto-déclaré
24Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert47,4 %24 février 2026Auto-déclaré
25Gemini 3 ProGoogle🔒 Propriétaire45,8 %18 novembre 2025Auto-déclaré
26DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert45,1 %23 avril 2026Auto-déclaré
27Gemini 3 FlashGoogle🔒 Propriétaire43,5 %17 décembre 2025Auto-déclaré
28GLM-4.7Zhipu AI🟢 Ouvert42,8 %22 décembre 2025Auto-déclaré
29Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire41,4 %19 mai 2026Auto-déclaré
30DeepSeek-V3.2DeepSeek🟢 Ouvert40,8 %1 décembre 2025Auto-déclaré
31Gemini 3.5 FlashGoogle🔒 Propriétaire40,2 %19 mai 2026Auto-déclaré
32Grok-4xAI🔒 Propriétaire40,0 %9 juillet 2025Auto-déclaré
33GPT-4.5OpenAI🔒 Propriétaire39,8 %5 mars 2026Auto-déclaré
34ERNIE 5.0Baidu🔒 Propriétaire39,0 %22 janvier 2026Auto-déclaré
35Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert37,4 %4 juin 2026Auto-déclaré
36GPT-5.2 ProOpenAI🔒 Propriétaire36,6 %11 décembre 2025Auto-déclaré
37Kimi K2.6Moonshot AI🟢 Ouvert36,4 %20 avril 2026Auto-déclaré
38Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire34,7 %31 mai 2026Auto-déclaré
39GPT-5.2OpenAI🔒 Propriétaire34,5 %11 décembre 2025Auto-déclaré
40MiMo-V2.5-ProXiaomi🟢 Ouvert34,0 %27 avril 2026Auto-déclaré
41DeepSeek-V3.2-SpecialeDeepSeek🟢 Ouvert30,6 %1 décembre 2025Auto-déclaré
42Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire28,8 %31 mars 2026Auto-déclaré
43Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert28,7 %16 février 2026Auto-déclaré
44GPT-5.4 miniOpenAI🔒 Propriétaire28,2 %17 mars 2026Auto-déclaré
45Gemma 4 31BGoogle🟢 Ouvert26,5 %2 avril 2026Auto-déclaré
46LongCat-Flash-Thinking-2601Meituan🟢 Ouvert25,2 %14 janvier 2026Auto-déclaré
47DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert25,1 %1 décembre 2025Auto-déclaré
48GPT-5OpenAI🔒 Propriétaire24,8 %7 août 2025Auto-déclaré
49GPT-5.4 nanoOpenAI🔒 Propriétaire24,3 %17 mars 2026Auto-déclaré
50Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert24,0 %21 avril 2026Auto-déclaré
51Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert22,8 %11 mars 2026Auto-déclaré
52MiMo-V2-FlashXiaomi🟢 Ouvert22,1 %16 décembre 2025Auto-déclaré
53MiniMax M2.1MiniMax🟢 Ouvert22,0 %23 décembre 2025Auto-déclaré
54Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire21,6 %5 juin 2025Auto-déclaré
55Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert21,4 %16 avril 2026Auto-déclaré
56Grok 4 FastxAI🔒 Propriétaire20,0 %28 août 2025Auto-déclaré
57DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert19,8 %29 septembre 2025Auto-déclaré
58Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert18,2 %25 juillet 2025Auto-déclaré
59MAI-Code-1-FlashMicrosoft🔒 Propriétaire18,0 %2 juin 2026Auto-déclaré
60Gemini 2.5 ProGoogle🔒 Propriétaire17,8 %20 mai 2025Auto-déclaré
61DeepSeek-R1-0528DeepSeek🟢 Ouvert17,7 %28 mai 2025Auto-déclaré
62GLM-4.6Zhipu AI🟢 Ouvert17,2 %30 septembre 2025Auto-déclaré
63Gemma 4 26B-A4BGoogle🟢 Ouvert17,2 %2 avril 2026Auto-déclaré
64GPT-5 miniOpenAI🔒 Propriétaire16,7 %7 août 2025Auto-déclaré
65Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire16,0 %3 mars 2026Auto-déclaré
66DeepSeek-V3.1DeepSeek🟢 Ouvert15,9 %10 janvier 2025Auto-déclaré
67Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert15,5 %15 décembre 2025Auto-déclaré
68GPT OSS 120BOpenAI🟢 Ouvert14,9 %5 août 2025Auto-déclaré
69o3OpenAI🔒 Propriétaire14,7 %16 avril 2025Auto-déclaré
70o4-miniOpenAI🔒 Propriétaire14,7 %16 avril 2025Auto-déclaré
71GLM-4.5Zhipu AI🟢 Ouvert14,4 %28 juillet 2025Auto-déclaré
72GLM-4.7-FlashZhipu AI🟢 Ouvert14,4 %19 janvier 2026Auto-déclaré
73Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert13,6 %22 septembre 2025Auto-déclaré
74MiniMax M2MiniMax🟢 Ouvert12,5 %27 octobre 2025Auto-déclaré
75DiffusionGemma 26B-A4BGoogle🟢 Ouvert11,9 %10 juin 2026Auto-déclaré
76Sarvam-105BSarvam AI🟢 Ouvert11,2 %6 mars 2026Auto-déclaré
77Gemini 2.5 FlashGoogle🔒 Propriétaire11,0 %20 mai 2025Auto-déclaré
78GPT OSS 20BOpenAI🟢 Ouvert10,9 %5 août 2025Auto-déclaré
79GLM-4.5-AirZhipu AI🟢 Ouvert10,6 %28 juillet 2025Auto-déclaré
80Magistral MediumMistral AI🟢 Ouvert9,0 %10 juin 2025Auto-déclaré
81GPT-5 nanoOpenAI🔒 Propriétaire8,7 %7 août 2025Auto-déclaré
82MiniMax M1MiniMax🟢 Ouvert7,2 %17 juin 2025Auto-déclaré
83GPT-4.1OpenAI🔒 Propriétaire5,4 %14 avril 2025Auto-déclaré
84GPT-4oOpenAI🔒 Propriétaire5,3 %27 mars 2025Auto-déclaré
85Gemma 4 12BGoogle🟢 Ouvert5,2 %23 mai 2026Auto-déclaré
86Gemini 2.5 Flash-LiteGoogle🟢 Ouvert5,1 %17 juin 2025Auto-déclaré
87Kimi K2 InstructMoonshot AI🟢 Ouvert4,7 %11 juillet 2025Auto-déclaré
88Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert4,7 %5 septembre 2025Auto-déclaré
89GPT-4.1 miniOpenAI🔒 Propriétaire3,7 %14 avril 2025Auto-déclaré

Classement établi sur 89 modèles évalués, dont 55 de grands éditeurs. Score médian de l'ensemble : 26,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Humanity's Last Exam indique qu'un modèle fournit davantage de réponses exactes à des problèmes académiques experts, y compris lorsque leur résolution combine connaissances spécialisées, raisonnement et interprétation visuelle. Dans la base, Claude Mythos Preview domine avec 65 %, contre une médiane de 25 % parmi 87 modèles. Cet écart révèle une forte différenciation des performances, tandis que le meilleur résultat reste éloigné d'une accuracy parfaite, ce qui ne suggère pas une saturation générale du benchmark.

La lecture du classement exige néanmoins de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune, ce qui limite leur comparabilité. L'accès public peut aussi accroître le risque que les questions entrent dans les données ou pratiques d'entraînement, avec un possible effet de contamination sur les résultats. Enfin, la portée de HLE reste celle de questions académiques en anglais, principalement ouvertes à réponse courte ou sous forme de QCM. Le classement renseigne donc sur cette capacité ciblée, et non sur l'ensemble des usages possibles d'un modèle.


Sources des scores : llm-stats.