HellaSwag

HellaSwag est un benchmark de raisonnement de bon sens créé en 2019 par Rowan Zellers et ses coauteurs, rattachés à l’University of Washington et à l’Allen Institute for AI. Il demande aux modèles de sélectionner, parmi plusieurs complétions, la suite la plus plausible d’une situation…

HellaSwag est un benchmark de raisonnement de bon sens créé en 2019 par Rowan Zellers et ses coauteurs, rattachés à l’University of Washington et à l’Allen Institute for AI. Il demande aux modèles de sélectionner, parmi plusieurs complétions, la suite la plus plausible d’une situation quotidienne ou physique.

Le jeu s’appuie sur l’Adversarial Filtering afin de produire des questions faciles pour les humains mais difficiles pour les modèles. HellaSwag sert ainsi à comparer leur aptitude à comprendre des activités ordinaires et les conséquences plausibles d’un contexte exprimé en langage naturel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkRowan Zellers et al. (University of Washington / Allen Institute for AI)
Capacités mesuréesraisonnement
ModalitéTexte
Type de questionsQCM à 4 choix de complétion de phrase
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeuenviron 70 000 exemples
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (27)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude 3 OpusAnthropic🔒 Propriétaire95,4 %29 février 2024Auto-déclaré
2GPT-4OpenAI🔒 Propriétaire95,3 %28 août 2023Auto-déclaré
3Gemini 1.5 ProGoogle🔒 Propriétaire93,3 %1 mai 2024Auto-déclaré
4MiMo-V2.5-ProXiaomi🟢 Ouvert89,8 %27 avril 2026Auto-déclaré
5Claude 3 SonnetAnthropic🔒 Propriétaire89,0 %29 février 2024Auto-déclaré
6Cohere: Command R (08-2024)Cohere🟢 Ouvert88,6 %30 août 2024Auto-déclaré
7Hermes 3 70BNous Research🟢 Ouvert88,2 %15 août 2024Auto-déclaré
8Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert87,6 %23 juillet 2024Auto-déclaré
9Gemini 1.5 FlashGoogle🔒 Propriétaire86,5 %1 mai 2024Auto-déclaré
10Gemma 2 27BGoogle🟢 Ouvert86,4 %27 juin 2024Auto-déclaré
11Claude 3 HaikuAnthropic🔒 Propriétaire85,9 %13 mars 2024Auto-déclaré
12Llama 3.1 Nemotron 70B InstructNVIDIA🟢 Ouvert85,6 %1 octobre 2024Auto-déclaré
13Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,2 %19 septembre 2024Auto-déclaré
14Phi-3.5-MoE-instructMicrosoft🟢 Ouvert83,8 %23 août 2024Auto-déclaré
15Mistral NeMo InstructMistral AI🟢 Ouvert83,5 %18 juillet 2024Auto-déclaré
16Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,0 %19 septembre 2024Auto-déclaré
17Gemma 2 9BGoogle🟢 Ouvert81,9 %27 juin 2024Auto-déclaré
18Granite 3.3 8B BaseIBM🟢 Ouvert80,1 %16 avril 2025Auto-déclaré
19Gemma 3n E4BGoogle🔒 Propriétaire78,6 %26 juin 2025Auto-déclaré
20Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert78,6 %20 mai 2025Auto-déclaré
21Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert76,8 %19 septembre 2024Auto-déclaré
22Gemma 3n E2BGoogle🔒 Propriétaire72,2 %26 juin 2025Auto-déclaré
23Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert72,2 %20 mai 2025Auto-déclaré
24Llama 3.2 3B InstructMeta🟢 Ouvert69,8 %25 septembre 2024Auto-déclaré
25Phi-3.5-mini-instructMicrosoft🟢 Ouvert69,4 %23 août 2024Auto-déclaré
26Phi 4 MiniMicrosoft🟢 Ouvert69,1 %30 avril 2025Auto-déclaré
27ERNIE 4.5Baidu🔒 Propriétaire33,0 %25 juin 2025Auto-déclaré

Classement établi sur 27 modèles évalués, dont 18 de grands éditeurs. Score médian de l'ensemble : 83,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur HellaSwag indique qu’un modèle choisit fréquemment la continuation attendue face à des scènes courantes ou physiques. Il témoigne donc d’une bonne performance sur ce format de raisonnement de bon sens, sans constituer une mesure générale de toutes les capacités d’un système. Dans la base, la médiane de 84 % et le meilleur résultat de 95 %, obtenu par Claude 3 Opus, montrent que plusieurs modèles atteignent un niveau élevé. La proximité du meilleur score avec la performance humaine annoncée comme supérieure à 95 % suggère une saturation possible au sommet du classement, où de faibles écarts deviennent moins discriminants.

L’interprétation exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. L’accès public au jeu crée en outre un risque de contamination si ses exemples ont été rencontrés pendant l’entraînement. Enfin, sa portée reste circonscrite à des QCM en anglais portant sur la plausibilité de situations quotidiennes et physiques. Le classement compare donc surtout la maîtrise de cette tâche précise parmi les 27 modèles évalués.


Sources des scores : llm-stats.