Winogrande
Winogrande est un benchmark de raisonnement de sens commun conçu par l’Allen Institute for AI et l’University of Washington, dans le cadre des travaux de K. Sakaguchi et al. Il propose des phrases ambiguës où un système doit résoudre une coréférence, notamment pronominale.
Winogrande est un benchmark de raisonnement de sens commun conçu par l’Allen Institute for AI et l’University of Washington, dans le cadre des travaux de K. Sakaguchi et al. Il propose des phrases ambiguës où un système doit résoudre une coréférence, notamment pronominale.
Inspiré du Winograd Schema Challenge et construit à grande échelle, il utilise un filtrage adversarial pour réduire les biais artificiels et les raccourcis statistiques. Il sert ainsi à évaluer si un modèle mobilise des connaissances de sens commun plutôt que de simples régularités superficielles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Allen Institute for AI (AI2) et University of Washington; K. Sakaguchi et al. |
| Capacités mesurées | langage, raisonnement |
| Modalité | Texte |
| Type de questions | QCM binaire |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | environ 44 000 problèmes |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (22)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-4 | OpenAI | 🔒 Propriétaire | 87,5 % | 28 août 2023 | Auto-déclaré |
| 2 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 85,6 % | 27 avril 2026 | Auto-déclaré |
| 3 | Cohere: Command R (08-2024) | Cohere | 🟢 Ouvert | 85,4 % | 30 août 2024 | Auto-déclaré |
| 4 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,1 % | 23 juillet 2024 | Auto-déclaré |
| 5 | Llama 3.1 Nemotron 70B Instruct | NVIDIA | 🟢 Ouvert | 84,5 % | 1 octobre 2024 | Auto-déclaré |
| 6 | Gemma 2 27B | 🟢 Ouvert | 83,7 % | 27 juin 2024 | Auto-déclaré | |
| 7 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 83,2 % | 15 août 2024 | Auto-déclaré |
| 8 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,0 % | 19 septembre 2024 | Auto-déclaré |
| 9 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 81,3 % | 23 août 2024 | Auto-déclaré |
| 10 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,8 % | 19 septembre 2024 | Auto-déclaré |
| 11 | Gemma 2 9B | 🟢 Ouvert | 80,6 % | 27 juin 2024 | Auto-déclaré | |
| 12 | Mistral NeMo Instruct | Mistral AI | 🟢 Ouvert | 76,8 % | 18 juillet 2024 | Auto-déclaré |
| 13 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 75,3 % | 16 octobre 2024 | Auto-déclaré |
| 14 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 74,4 % | 16 avril 2025 | Auto-déclaré |
| 15 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,9 % | 19 septembre 2024 | Auto-déclaré |
| 16 | Gemma 3n E4B | 🔒 Propriétaire | 71,7 % | 26 juin 2025 | Auto-déclaré | |
| 17 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 71,7 % | 20 mai 2025 | Auto-déclaré | |
| 18 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 68,5 % | 23 août 2024 | Auto-déclaré |
| 19 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 67,0 % | 30 avril 2025 | Auto-déclaré |
| 20 | Gemma 3n E2B | 🔒 Propriétaire | 66,8 % | 26 juin 2025 | Auto-déclaré | |
| 21 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 66,8 % | 20 mai 2025 | Auto-déclaré | |
| 22 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 51,3 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 22 modèles évalués, dont 13 de grands éditeurs. Score médian de l'ensemble : 78,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle choisit fréquemment la bonne résolution parmi deux possibilités dans des phrases anglaises ambiguës. Le filtrage adversarial renforce la valeur de cette mesure en réduisant certains biais parasites. Le caractère privé du jeu de test, dont les réponses ne sont pas divulguées, limite aussi l’apprentissage direct des solutions. La rigueur comparative reste toutefois à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.
Le classement de 22 modèles montre un niveau médian de 79 %, tandis que GPT-4 atteint 88 %. Cet écart suggère une différenciation encore visible entre les systèmes et ne traduit pas une saturation complète. Le meilleur résultat demeure inférieur aux 94,0 % attribués aux humains, ce qui laisse subsister une marge sur la tâche. La portée du benchmark reste ciblée : il mesure des QCM binaires en anglais consacrés à la coréférence et au sens commun. Il ne constitue donc pas, à lui seul, une mesure générale de toutes les capacités d’un modèle.
Sources des scores : llm-stats.