Social IQa

Social IQa est un benchmark conçu en 2019 par Maarten Sap et ses coauteurs, rattachés à l’Allen Institute for AI et à l’University of Washington. Il constitue le premier benchmark à grande échelle consacré au raisonnement de sens commun sur les situations sociales.

Social IQa est un benchmark conçu en 2019 par Maarten Sap et ses coauteurs, rattachés à l’Allen Institute for AI et à l’University of Washington. Il constitue le premier benchmark à grande échelle consacré au raisonnement de sens commun sur les situations sociales.

Ses questions évaluent la compréhension des interactions quotidiennes et la capacité à inférer des motivations, des émotions, des intentions ou des réactions implicites. Social IQa sert ainsi à comparer les modèles sur des compétences relevant de l’intelligence sociale et du raisonnement de type théorie de l’esprit.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMaarten Sap et al. (Allen Institute for AI / University of Washington)
Capacités mesuréescréativité, psychologie, raisonnement
ModalitéTexte
Type de questionsQCM à 3 choix
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeuenviron 38 000 questions
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Phi-3.5-MoE-instructMicrosoft🟢 Ouvert78,0 %23 août 2024Auto-déclaré
2Phi-3.5-mini-instructMicrosoft🟢 Ouvert74,7 %23 août 2024Auto-déclaré
3Phi 4 MiniMicrosoft🟢 Ouvert72,5 %30 avril 2025Auto-déclaré
4Gemma 2 27BGoogle🟢 Ouvert53,7 %27 juin 2024Auto-déclaré
5Gemma 2 9BGoogle🟢 Ouvert53,4 %27 juin 2024Auto-déclaré
6Gemma 3n E4BGoogle🔒 Propriétaire50,0 %26 juin 2025Auto-déclaré
7Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert50,0 %20 mai 2025Auto-déclaré
8Gemma 3n E2BGoogle🔒 Propriétaire48,8 %26 juin 2025Auto-déclaré
9Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert48,8 %20 mai 2025Auto-déclaré

Classement établi sur 9 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 53,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Social IQa indique qu’un modèle choisit fréquemment la réponse attendue face à des scénarios sociaux en anglais. Il traduit une meilleure réussite dans l’interprétation des comportements, émotions et intentions implicites, dans les limites d’un QCM à trois choix. Le jeu d’environ 38 000 questions offre une base d’évaluation étendue, tandis que le caractère privé du test et la non-divulgation des réponses réduisent l’exposition directe aux solutions et le risque de contamination associé à leur publication. La portée reste toutefois circonscrite aux situations quotidiennes formulées en anglais et au format QCM. Avec un meilleur résultat de 78 %, obtenu par Phi-3.5-MoE-instruct, contre une médiane de 53 % parmi les neuf modèles recensés, le classement fait apparaître un écart notable entre la tête et le niveau central, sans signal de saturation complète. L’interprétation comparative exige néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole unique par une même entité.


Sources des scores : llm-stats.