ERQA
ERQA est un benchmark de Google DeepMind consacré au raisonnement incarné, c’est-à-dire à la compréhension d’interactions avec le monde physique à partir d’informations visuelles et textuelles entrelacées. Il repose sur des questions visuelles à choix multiples.
ERQA est un benchmark de Google DeepMind consacré au raisonnement incarné, c’est-à-dire à la compréhension d’interactions avec le monde physique à partir d’informations visuelles et textuelles entrelacées. Il repose sur des questions visuelles à choix multiples.
L’évaluation mobilise plusieurs dimensions complémentaires, notamment le raisonnement spatial, les trajectoires, les actions, l’estimation d’état et l’analyse multi-vues. ERQA sert ainsi à comparer la capacité des modèles à interpréter une scène, à relier différents points de vue et à sélectionner une réponse cohérente avec la situation observée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google DeepMind |
| Capacités mesurées | raisonnement incarné (embodied), raisonnement spatial, de trajectoire, d'action, estimation d'état, raisonnement multi-vues, vision |
| Modalité | Multimodal |
| Type de questions | questions visuelles à choix multiples (réponse A-D), images et texte entrelacés |
| Métrique d'évaluation | exactitude (accuracy) sur QCM |
| Accès | Public |
| Licence | CC BY 4.0 |
| Langues | anglais |
| Taille du jeu | 400 questions à choix multiples |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (22)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 72,0 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 71,3 % | 24 juin 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 69,8 % | 31 mai 2026 | Auto-déclaré |
| 4 | GPT-5 | OpenAI | 🔒 Propriétaire | 65,7 % | 7 août 2025 | Auto-déclaré |
| 5 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 65,7 % | 31 mars 2026 | Auto-déclaré |
| 6 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,8 % | 24 février 2026 | Auto-déclaré |
| 7 | Muse Spark | Meta | 🔒 Propriétaire | 64,7 % | 8 avril 2026 | Auto-déclaré |
| 8 | o3 | OpenAI | 🔒 Propriétaire | 64,0 % | 16 avril 2025 | Auto-déclaré |
| 9 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,5 % | 21 avril 2026 | Auto-déclaré |
| 10 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,0 % | 24 février 2026 | Auto-déclaré |
| 11 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,5 % | 24 février 2026 | Auto-déclaré |
| 12 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,5 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,3 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,3 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 48,8 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 47,3 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,8 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 45,8 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 45,3 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,0 % | 22 septembre 2025 | Auto-déclaré |
| 21 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 41,3 % | 22 septembre 2025 | Auto-déclaré |
| 22 | GPT-4o | OpenAI | 🔒 Propriétaire | 35,2 % | 27 mars 2025 | Auto-déclaré |
Classement établi sur 22 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 56,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur ERQA indique qu’un modèle choisit fréquemment la bonne réponse parmi quatre options face à des problèmes visuels liés au monde physique. Il reflète une combinaison de perception et de raisonnement spatial, de trajectoire, d’action, d’état et multi-vues, sans mesurer séparément chacune de ces composantes. Dans la base, Seed 2.1 Pro domine avec 72 %, tandis que la médiane des 22 modèles atteint 56 %. Cet écart révèle une hiérarchie encore marquée et ne suggère pas une saturation générale du benchmark. La portée reste toutefois circonscrite à 400 QCM en anglais, avec l’exactitude comme unique métrique. Le format fermé peut aussi favoriser la sélection de la bonne option sans restituer tout le raisonnement sous-jacent. Comme le jeu est public, son exposition peut créer un risque de contamination lors du développement des modèles. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de la rigueur et de l’homogénéité des procédures d’évaluation employées.
Sources des scores : llm-stats.