PIQA
PIQA, créé par Yonatan Bisk et ses coauteurs, est un benchmark consacré au raisonnement de sens commun physique en langage naturel. Il confronte les modèles à des situations quotidiennes impliquant des interactions avec le monde matériel et leur demande de choisir la solution la plus…
PIQA, créé par Yonatan Bisk et ses coauteurs, est un benchmark consacré au raisonnement de sens commun physique en langage naturel. Il confronte les modèles à des situations quotidiennes impliquant des interactions avec le monde matériel et leur demande de choisir la solution la plus plausible.
Les problèmes privilégient notamment des solutions atypiques inspirées d’instructables.com. PIQA sert ainsi à évaluer la capacité d’un modèle à mobiliser des connaissances pratiques sur le monde physique, au-delà du simple traitement formel du texte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Yonatan Bisk et al. |
| Capacités mesurées | généraliste, physique, raisonnement |
| Modalité | Texte |
| Type de questions | QCM à deux choix |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | environ 21 000 questions |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 88,6 % | 23 août 2024 | Auto-déclaré |
| 2 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 84,4 % | 15 août 2024 | Auto-déclaré |
| 3 | Gemma 2 27B | 🟢 Ouvert | 83,2 % | 27 juin 2024 | Auto-déclaré | |
| 4 | Gemma 2 9B | 🟢 Ouvert | 81,7 % | 27 juin 2024 | Auto-déclaré | |
| 5 | Gemma 3n E4B | 🔒 Propriétaire | 81,0 % | 26 juin 2025 | Auto-déclaré | |
| 6 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 81,0 % | 20 mai 2025 | Auto-déclaré | |
| 7 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 81,0 % | 23 août 2024 | Auto-déclaré |
| 8 | Gemma 3n E2B | 🔒 Propriétaire | 78,9 % | 26 juin 2025 | Auto-déclaré | |
| 9 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 78,9 % | 20 mai 2025 | Auto-déclaré | |
| 10 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 77,6 % | 30 avril 2025 | Auto-déclaré |
| 11 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 55,2 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 11 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 81,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur PIQA indique qu’un modèle sélectionne fréquemment la solution jugée la plus appropriée face à des problèmes matériels courants ou atypiques. Cette performance reste circonscrite à un QCM binaire en anglais et ne mesure donc qu’une facette du raisonnement de sens commun physique. Le niveau médian de 81 % parmi les 11 modèles évalués, face à un meilleur score de 89 % pour Phi-3.5-MoE-instruct de Microsoft, montre une marge relativement resserrée en tête et suggère un risque de saturation progressive de cette mesure. Le classement distingue encore les modèles, mais des écarts limités doivent être interprétés avec prudence. La fiabilité comparative est également contrainte par des scores majoritairement auto-déclarés par les éditeurs, plutôt que mesurés selon une procédure indépendante commune. Le jeu de test privé, dont les réponses ne sont pas divulguées, réduit l’exposition directe des solutions et le risque de contamination associé. Il ne change toutefois pas la portée du benchmark, centrée sur des questions textuelles à deux choix et sur des interactions physiques plausibles.
Sources des scores : llm-stats.