Winogrande

Winogrande est un benchmark de raisonnement de sens commun conçu par l’Allen Institute for AI et l’University of Washington, dans le cadre des travaux de K. Sakaguchi et al. Il propose des phrases ambiguës où un système doit résoudre une coréférence, notamment pronominale.

Winogrande est un benchmark de raisonnement de sens commun conçu par l’Allen Institute for AI et l’University of Washington, dans le cadre des travaux de K. Sakaguchi et al. Il propose des phrases ambiguës où un système doit résoudre une coréférence, notamment pronominale.

Inspiré du Winograd Schema Challenge et construit à grande échelle, il utilise un filtrage adversarial pour réduire les biais artificiels et les raccourcis statistiques. Il sert ainsi à évaluer si un modèle mobilise des connaissances de sens commun plutôt que de simples régularités superficielles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAllen Institute for AI (AI2) et University of Washington; K. Sakaguchi et al.
Capacités mesuréeslangage, raisonnement
ModalitéTexte
Type de questionsQCM binaire
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeuenviron 44 000 problèmes
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (22)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-4OpenAI🔒 Propriétaire87,5 %28 août 2023Auto-déclaré
2MiMo-V2.5-ProXiaomi🟢 Ouvert85,6 %27 avril 2026Auto-déclaré
3Cohere: Command R (08-2024)Cohere🟢 Ouvert85,4 %30 août 2024Auto-déclaré
4Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,1 %23 juillet 2024Auto-déclaré
5Llama 3.1 Nemotron 70B InstructNVIDIA🟢 Ouvert84,5 %1 octobre 2024Auto-déclaré
6Gemma 2 27BGoogle🟢 Ouvert83,7 %27 juin 2024Auto-déclaré
7Hermes 3 70BNous Research🟢 Ouvert83,2 %15 août 2024Auto-déclaré
8Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,0 %19 septembre 2024Auto-déclaré
9Phi-3.5-MoE-instructMicrosoft🟢 Ouvert81,3 %23 août 2024Auto-déclaré
10Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,8 %19 septembre 2024Auto-déclaré
11Gemma 2 9BGoogle🟢 Ouvert80,6 %27 juin 2024Auto-déclaré
12Mistral NeMo InstructMistral AI🟢 Ouvert76,8 %18 juillet 2024Auto-déclaré
13Ministral 8B InstructMistral AI🟢 Ouvert75,3 %16 octobre 2024Auto-déclaré
14Granite 3.3 8B BaseIBM🟢 Ouvert74,4 %16 avril 2025Auto-déclaré
15Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert72,9 %19 septembre 2024Auto-déclaré
16Gemma 3n E4BGoogle🔒 Propriétaire71,7 %26 juin 2025Auto-déclaré
17Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert71,7 %20 mai 2025Auto-déclaré
18Phi-3.5-mini-instructMicrosoft🟢 Ouvert68,5 %23 août 2024Auto-déclaré
19Phi 4 MiniMicrosoft🟢 Ouvert67,0 %30 avril 2025Auto-déclaré
20Gemma 3n E2BGoogle🔒 Propriétaire66,8 %26 juin 2025Auto-déclaré
21Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert66,8 %20 mai 2025Auto-déclaré
22ERNIE 4.5Baidu🔒 Propriétaire51,3 %25 juin 2025Auto-déclaré

Classement établi sur 22 modèles évalués, dont 13 de grands éditeurs. Score médian de l'ensemble : 78,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle choisit fréquemment la bonne résolution parmi deux possibilités dans des phrases anglaises ambiguës. Le filtrage adversarial renforce la valeur de cette mesure en réduisant certains biais parasites. Le caractère privé du jeu de test, dont les réponses ne sont pas divulguées, limite aussi l’apprentissage direct des solutions. La rigueur comparative reste toutefois à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.

Le classement de 22 modèles montre un niveau médian de 79 %, tandis que GPT-4 atteint 88 %. Cet écart suggère une différenciation encore visible entre les systèmes et ne traduit pas une saturation complète. Le meilleur résultat demeure inférieur aux 94,0 % attribués aux humains, ce qui laisse subsister une marge sur la tâche. La portée du benchmark reste ciblée : il mesure des QCM binaires en anglais consacrés à la coréférence et au sens commun. Il ne constitue donc pas, à lui seul, une mesure générale de toutes les capacités d’un modèle.


Sources des scores : llm-stats.