Social IQa
Social IQa est un benchmark conçu en 2019 par Maarten Sap et ses coauteurs, rattachés à l’Allen Institute for AI et à l’University of Washington. Il constitue le premier benchmark à grande échelle consacré au raisonnement de sens commun sur les situations sociales.
Social IQa est un benchmark conçu en 2019 par Maarten Sap et ses coauteurs, rattachés à l’Allen Institute for AI et à l’University of Washington. Il constitue le premier benchmark à grande échelle consacré au raisonnement de sens commun sur les situations sociales.
Ses questions évaluent la compréhension des interactions quotidiennes et la capacité à inférer des motivations, des émotions, des intentions ou des réactions implicites. Social IQa sert ainsi à comparer les modèles sur des compétences relevant de l’intelligence sociale et du raisonnement de type théorie de l’esprit.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Maarten Sap et al. (Allen Institute for AI / University of Washington) |
| Capacités mesurées | créativité, psychologie, raisonnement |
| Modalité | Texte |
| Type de questions | QCM à 3 choix |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | environ 38 000 questions |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 78,0 % | 23 août 2024 | Auto-déclaré |
| 2 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 74,7 % | 23 août 2024 | Auto-déclaré |
| 3 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 72,5 % | 30 avril 2025 | Auto-déclaré |
| 4 | Gemma 2 27B | 🟢 Ouvert | 53,7 % | 27 juin 2024 | Auto-déclaré | |
| 5 | Gemma 2 9B | 🟢 Ouvert | 53,4 % | 27 juin 2024 | Auto-déclaré | |
| 6 | Gemma 3n E4B | 🔒 Propriétaire | 50,0 % | 26 juin 2025 | Auto-déclaré | |
| 7 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 50,0 % | 20 mai 2025 | Auto-déclaré | |
| 8 | Gemma 3n E2B | 🔒 Propriétaire | 48,8 % | 26 juin 2025 | Auto-déclaré | |
| 9 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 48,8 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 53,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Social IQa indique qu’un modèle choisit fréquemment la réponse attendue face à des scénarios sociaux en anglais. Il traduit une meilleure réussite dans l’interprétation des comportements, émotions et intentions implicites, dans les limites d’un QCM à trois choix. Le jeu d’environ 38 000 questions offre une base d’évaluation étendue, tandis que le caractère privé du test et la non-divulgation des réponses réduisent l’exposition directe aux solutions et le risque de contamination associé à leur publication. La portée reste toutefois circonscrite aux situations quotidiennes formulées en anglais et au format QCM. Avec un meilleur résultat de 78 %, obtenu par Phi-3.5-MoE-instruct, contre une médiane de 53 % parmi les neuf modèles recensés, le classement fait apparaître un écart notable entre la tête et le niveau central, sans signal de saturation complète. L’interprétation comparative exige néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole unique par une même entité.
Sources des scores : llm-stats.