PIQA

PIQA, créé par Yonatan Bisk et ses coauteurs, est un benchmark consacré au raisonnement de sens commun physique en langage naturel. Il confronte les modèles à des situations quotidiennes impliquant des interactions avec le monde matériel et leur demande de choisir la solution la plus…

PIQA, créé par Yonatan Bisk et ses coauteurs, est un benchmark consacré au raisonnement de sens commun physique en langage naturel. Il confronte les modèles à des situations quotidiennes impliquant des interactions avec le monde matériel et leur demande de choisir la solution la plus plausible.

Les problèmes privilégient notamment des solutions atypiques inspirées d’instructables.com. PIQA sert ainsi à évaluer la capacité d’un modèle à mobiliser des connaissances pratiques sur le monde physique, au-delà du simple traitement formel du texte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkYonatan Bisk et al.
Capacités mesuréesgénéraliste, physique, raisonnement
ModalitéTexte
Type de questionsQCM à deux choix
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeuenviron 21 000 questions
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Phi-3.5-MoE-instructMicrosoft🟢 Ouvert88,6 %23 août 2024Auto-déclaré
2Hermes 3 70BNous Research🟢 Ouvert84,4 %15 août 2024Auto-déclaré
3Gemma 2 27BGoogle🟢 Ouvert83,2 %27 juin 2024Auto-déclaré
4Gemma 2 9BGoogle🟢 Ouvert81,7 %27 juin 2024Auto-déclaré
5Gemma 3n E4BGoogle🔒 Propriétaire81,0 %26 juin 2025Auto-déclaré
6Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert81,0 %20 mai 2025Auto-déclaré
7Phi-3.5-mini-instructMicrosoft🟢 Ouvert81,0 %23 août 2024Auto-déclaré
8Gemma 3n E2BGoogle🔒 Propriétaire78,9 %26 juin 2025Auto-déclaré
9Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert78,9 %20 mai 2025Auto-déclaré
10Phi 4 MiniMicrosoft🟢 Ouvert77,6 %30 avril 2025Auto-déclaré
11ERNIE 4.5Baidu🔒 Propriétaire55,2 %25 juin 2025Auto-déclaré

Classement établi sur 11 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 81,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur PIQA indique qu’un modèle sélectionne fréquemment la solution jugée la plus appropriée face à des problèmes matériels courants ou atypiques. Cette performance reste circonscrite à un QCM binaire en anglais et ne mesure donc qu’une facette du raisonnement de sens commun physique. Le niveau médian de 81 % parmi les 11 modèles évalués, face à un meilleur score de 89 % pour Phi-3.5-MoE-instruct de Microsoft, montre une marge relativement resserrée en tête et suggère un risque de saturation progressive de cette mesure. Le classement distingue encore les modèles, mais des écarts limités doivent être interprétés avec prudence. La fiabilité comparative est également contrainte par des scores majoritairement auto-déclarés par les éditeurs, plutôt que mesurés selon une procédure indépendante commune. Le jeu de test privé, dont les réponses ne sont pas divulguées, réduit l’exposition directe des solutions et le risque de contamination associé. Il ne change toutefois pas la portée du benchmark, centrée sur des questions textuelles à deux choix et sur des interactions physiques plausibles.


Sources des scores : llm-stats.