HellaSwag
HellaSwag est un benchmark de raisonnement de bon sens créé en 2019 par Rowan Zellers et ses coauteurs, rattachés à l’University of Washington et à l’Allen Institute for AI. Il demande aux modèles de sélectionner, parmi plusieurs complétions, la suite la plus plausible d’une situation…
HellaSwag est un benchmark de raisonnement de bon sens créé en 2019 par Rowan Zellers et ses coauteurs, rattachés à l’University of Washington et à l’Allen Institute for AI. Il demande aux modèles de sélectionner, parmi plusieurs complétions, la suite la plus plausible d’une situation quotidienne ou physique.
Le jeu s’appuie sur l’Adversarial Filtering afin de produire des questions faciles pour les humains mais difficiles pour les modèles. HellaSwag sert ainsi à comparer leur aptitude à comprendre des activités ordinaires et les conséquences plausibles d’un contexte exprimé en langage naturel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Rowan Zellers et al. (University of Washington / Allen Institute for AI) |
| Capacités mesurées | raisonnement |
| Modalité | Texte |
| Type de questions | QCM à 4 choix de complétion de phrase |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 70 000 exemples |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (27)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 95,4 % | 29 février 2024 | Auto-déclaré |
| 2 | GPT-4 | OpenAI | 🔒 Propriétaire | 95,3 % | 28 août 2023 | Auto-déclaré |
| 3 | Gemini 1.5 Pro | 🔒 Propriétaire | 93,3 % | 1 mai 2024 | Auto-déclaré | |
| 4 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 89,8 % | 27 avril 2026 | Auto-déclaré |
| 5 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 89,0 % | 29 février 2024 | Auto-déclaré |
| 6 | Cohere: Command R (08-2024) | Cohere | 🟢 Ouvert | 88,6 % | 30 août 2024 | Auto-déclaré |
| 7 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 88,2 % | 15 août 2024 | Auto-déclaré |
| 8 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,6 % | 23 juillet 2024 | Auto-déclaré |
| 9 | Gemini 1.5 Flash | 🔒 Propriétaire | 86,5 % | 1 mai 2024 | Auto-déclaré | |
| 10 | Gemma 2 27B | 🟢 Ouvert | 86,4 % | 27 juin 2024 | Auto-déclaré | |
| 11 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 85,9 % | 13 mars 2024 | Auto-déclaré |
| 12 | Llama 3.1 Nemotron 70B Instruct | NVIDIA | 🟢 Ouvert | 85,6 % | 1 octobre 2024 | Auto-déclaré |
| 13 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,2 % | 19 septembre 2024 | Auto-déclaré |
| 14 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 83,8 % | 23 août 2024 | Auto-déclaré |
| 15 | Mistral NeMo Instruct | Mistral AI | 🟢 Ouvert | 83,5 % | 18 juillet 2024 | Auto-déclaré |
| 16 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,0 % | 19 septembre 2024 | Auto-déclaré |
| 17 | Gemma 2 9B | 🟢 Ouvert | 81,9 % | 27 juin 2024 | Auto-déclaré | |
| 18 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 80,1 % | 16 avril 2025 | Auto-déclaré |
| 19 | Gemma 3n E4B | 🔒 Propriétaire | 78,6 % | 26 juin 2025 | Auto-déclaré | |
| 20 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 78,6 % | 20 mai 2025 | Auto-déclaré | |
| 21 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,8 % | 19 septembre 2024 | Auto-déclaré |
| 22 | Gemma 3n E2B | 🔒 Propriétaire | 72,2 % | 26 juin 2025 | Auto-déclaré | |
| 23 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 72,2 % | 20 mai 2025 | Auto-déclaré | |
| 24 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 69,8 % | 25 septembre 2024 | Auto-déclaré |
| 25 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 69,4 % | 23 août 2024 | Auto-déclaré |
| 26 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 69,1 % | 30 avril 2025 | Auto-déclaré |
| 27 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 33,0 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 27 modèles évalués, dont 18 de grands éditeurs. Score médian de l'ensemble : 83,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur HellaSwag indique qu’un modèle choisit fréquemment la continuation attendue face à des scènes courantes ou physiques. Il témoigne donc d’une bonne performance sur ce format de raisonnement de bon sens, sans constituer une mesure générale de toutes les capacités d’un système. Dans la base, la médiane de 84 % et le meilleur résultat de 95 %, obtenu par Claude 3 Opus, montrent que plusieurs modèles atteignent un niveau élevé. La proximité du meilleur score avec la performance humaine annoncée comme supérieure à 95 % suggère une saturation possible au sommet du classement, où de faibles écarts deviennent moins discriminants.
L’interprétation exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. L’accès public au jeu crée en outre un risque de contamination si ses exemples ont été rencontrés pendant l’entraînement. Enfin, sa portée reste circonscrite à des QCM en anglais portant sur la plausibilité de situations quotidiennes et physiques. Le classement compare donc surtout la maîtrise de cette tâche précise parmi les 27 modèles évalués.
Sources des scores : llm-stats.