Global PIQA
Global PIQA est un benchmark multilingue consacré au raisonnement de bon sens sur les interactions physiques. Publié en 2025, il résulte d’un effort participatif dirigé par Tyler A. Chang, Catherine Arnett et plus de 335 chercheurs issus de plus de 65 pays.
Global PIQA est un benchmark multilingue consacré au raisonnement de bon sens sur les interactions physiques. Publié en 2025, il résulte d’un effort participatif dirigé par Tyler A. Chang, Catherine Arnett et plus de 335 chercheurs issus de plus de 65 pays.
Ses questions à choix multiple évaluent la capacité des modèles à sélectionner une solution physiquement plausible dans des situations quotidiennes. Couvrant plus de 100 langues et de nombreux contextes culturels locaux, il permet d’étudier la robustesse de ce raisonnement au-delà des langues et références dominantes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Effort participatif multilingue mené par Tyler A. Chang, Catherine Arnett et al. (335+ chercheurs de 65+ pays) |
| Capacités mesurées | Raisonnement de bon sens sur les interactions physiques, dans un cadre multilingue et multiculturel (>50% d'exemples à référents culturels locaux) |
| Modalité | Texte |
| Type de questions | Choix multiple (bon sens physique, format PIQA : choisir la solution correcte) |
| Métrique d'évaluation | Accuracy (avec écart de performance entre langues à haute et basse ressource) |
| Accès | Public |
| Langues | 100+ langues (116 variétés en v0.1, 141 en v2 ; 14 à 19 familles, 23 à 24 systèmes d'écriture) |
| Taille du jeu | Nombre total d'exemples non précisé dans le papier ; splits parallèle et non-parallèle |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3 Pro | 🔒 Propriétaire | 93,4 % | 18 novembre 2025 | Auto-déclaré | |
| 2 | Gemini 3 Flash | 🔒 Propriétaire | 92,8 % | 17 décembre 2025 | Auto-déclaré | |
| 3 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 91,4 % | 19 mai 2026 | Auto-déclaré |
| 4 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 90,3 % | 31 mai 2026 | Auto-déclaré |
| 5 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,8 % | 16 février 2026 | Auto-déclaré |
| 6 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 89,8 % | 31 mars 2026 | Auto-déclaré |
| 7 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,4 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,5 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,6 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,2 % | 2 mars 2026 | Auto-déclaré |
| 11 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,9 % | 2 mars 2026 | Auto-déclaré |
| 12 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,3 % | 2 mars 2026 | Auto-déclaré |
| 13 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,4 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 88,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Global PIQA indique qu’un modèle choisit fréquemment la solution correcte à des problèmes de bon sens physique, dans des langues et des contextes culturels variés. Il ne mesure toutefois qu’une portée ciblée, la connaissance des interactions physiques au format PIQA, et ne résume donc pas les capacités générales d’un système. Avec une médiane de 88 % parmi les 13 modèles recensés et un meilleur résultat de 93 % pour Gemini 3 Pro, le classement montre des performances globalement élevées et relativement rapprochées. Cette concentration peut réduire le pouvoir de discrimination du benchmark au sommet et suggérer un risque de saturation. Les écarts entre langues à haute et basse ressource restent néanmoins un indicateur important de robustesse multilingue. L’interprétation du classement exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un protocole de mesure uniforme et indépendant. Les résultats éclairent ainsi surtout la maîtrise comparative du bon sens physique multiculturel dans le cadre précis des questions proposées.
Sources des scores : llm-stats.