Global PIQA

Global PIQA est un benchmark multilingue consacré au raisonnement de bon sens sur les interactions physiques. Publié en 2025, il résulte d’un effort participatif dirigé par Tyler A. Chang, Catherine Arnett et plus de 335 chercheurs issus de plus de 65 pays.

Global PIQA est un benchmark multilingue consacré au raisonnement de bon sens sur les interactions physiques. Publié en 2025, il résulte d’un effort participatif dirigé par Tyler A. Chang, Catherine Arnett et plus de 335 chercheurs issus de plus de 65 pays.

Ses questions à choix multiple évaluent la capacité des modèles à sélectionner une solution physiquement plausible dans des situations quotidiennes. Couvrant plus de 100 langues et de nombreux contextes culturels locaux, il permet d’étudier la robustesse de ce raisonnement au-delà des langues et références dominantes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEffort participatif multilingue mené par Tyler A. Chang, Catherine Arnett et al. (335+ chercheurs de 65+ pays)
Capacités mesuréesRaisonnement de bon sens sur les interactions physiques, dans un cadre multilingue et multiculturel (>50% d'exemples à référents culturels locaux)
ModalitéTexte
Type de questionsChoix multiple (bon sens physique, format PIQA : choisir la solution correcte)
Métrique d'évaluationAccuracy (avec écart de performance entre langues à haute et basse ressource)
AccèsPublic
Langues100+ langues (116 variétés en v0.1, 141 en v2 ; 14 à 19 familles, 23 à 24 systèmes d'écriture)
Taille du jeuNombre total d'exemples non précisé dans le papier ; splits parallèle et non-parallèle
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3 ProGoogle🔒 Propriétaire93,4 %18 novembre 2025Auto-déclaré
2Gemini 3 FlashGoogle🔒 Propriétaire92,8 %17 décembre 2025Auto-déclaré
3Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire91,4 %19 mai 2026Auto-déclaré
4Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire90,3 %31 mai 2026Auto-déclaré
5Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert89,8 %16 février 2026Auto-déclaré
6Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire89,8 %31 mars 2026Auto-déclaré
7Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert88,4 %24 février 2026Auto-déclaré
8Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert87,5 %24 février 2026Auto-déclaré
9Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert86,6 %24 février 2026Auto-déclaré
10Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert83,2 %2 mars 2026Auto-déclaré
11Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert78,9 %2 mars 2026Auto-déclaré
12Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert69,3 %2 mars 2026Auto-déclaré
13Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert59,4 %2 mars 2026Auto-déclaré

Classement établi sur 13 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 88,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Global PIQA indique qu’un modèle choisit fréquemment la solution correcte à des problèmes de bon sens physique, dans des langues et des contextes culturels variés. Il ne mesure toutefois qu’une portée ciblée, la connaissance des interactions physiques au format PIQA, et ne résume donc pas les capacités générales d’un système. Avec une médiane de 88 % parmi les 13 modèles recensés et un meilleur résultat de 93 % pour Gemini 3 Pro, le classement montre des performances globalement élevées et relativement rapprochées. Cette concentration peut réduire le pouvoir de discrimination du benchmark au sommet et suggérer un risque de saturation. Les écarts entre langues à haute et basse ressource restent néanmoins un indicateur important de robustesse multilingue. L’interprétation du classement exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un protocole de mesure uniforme et indépendant. Les résultats éclairent ainsi surtout la maîtrise comparative du bon sens physique multiculturel dans le cadre précis des questions proposées.


Sources des scores : llm-stats.