ERQA

ERQA est un benchmark de Google DeepMind consacré au raisonnement incarné, c’est-à-dire à la compréhension d’interactions avec le monde physique à partir d’informations visuelles et textuelles entrelacées. Il repose sur des questions visuelles à choix multiples.

ERQA est un benchmark de Google DeepMind consacré au raisonnement incarné, c’est-à-dire à la compréhension d’interactions avec le monde physique à partir d’informations visuelles et textuelles entrelacées. Il repose sur des questions visuelles à choix multiples.

L’évaluation mobilise plusieurs dimensions complémentaires, notamment le raisonnement spatial, les trajectoires, les actions, l’estimation d’état et l’analyse multi-vues. ERQA sert ainsi à comparer la capacité des modèles à interpréter une scène, à relier différents points de vue et à sélectionner une réponse cohérente avec la situation observée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle DeepMind
Capacités mesuréesraisonnement incarné (embodied), raisonnement spatial, de trajectoire, d'action, estimation d'état, raisonnement multi-vues, vision
ModalitéMultimodal
Type de questionsquestions visuelles à choix multiples (réponse A-D), images et texte entrelacés
Métrique d'évaluationexactitude (accuracy) sur QCM
AccèsPublic
LicenceCC BY 4.0
Languesanglais
Taille du jeu400 questions à choix multiples
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (22)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 ProByteDance🔒 Propriétaire72,0 %24 juin 2026Auto-déclaré
2Seed 2.1 TurboByteDance🔒 Propriétaire71,3 %24 juin 2026Auto-déclaré
3Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire69,8 %31 mai 2026Auto-déclaré
4GPT-5OpenAI🔒 Propriétaire65,7 %7 août 2025Auto-déclaré
5Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire65,7 %31 mars 2026Auto-déclaré
6Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert64,8 %24 février 2026Auto-déclaré
7Muse SparkMeta🔒 Propriétaire64,7 %8 avril 2026Auto-déclaré
8o3OpenAI🔒 Propriétaire64,0 %16 avril 2025Auto-déclaré
9Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert62,5 %21 avril 2026Auto-déclaré
10Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert62,0 %24 février 2026Auto-déclaré
11Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert60,5 %24 février 2026Auto-déclaré
12Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert52,5 %22 septembre 2025Auto-déclaré
13Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert52,3 %22 septembre 2025Auto-déclaré
14Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert51,3 %22 septembre 2025Auto-déclaré
15Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert48,8 %22 septembre 2025Auto-déclaré
16Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert47,3 %22 septembre 2025Auto-déclaré
17Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert46,8 %22 septembre 2025Auto-déclaré
18Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert45,8 %22 septembre 2025Auto-déclaré
19Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert45,3 %22 septembre 2025Auto-déclaré
20Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert43,0 %22 septembre 2025Auto-déclaré
21Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert41,3 %22 septembre 2025Auto-déclaré
22GPT-4oOpenAI🔒 Propriétaire35,2 %27 mars 2025Auto-déclaré

Classement établi sur 22 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 56,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur ERQA indique qu’un modèle choisit fréquemment la bonne réponse parmi quatre options face à des problèmes visuels liés au monde physique. Il reflète une combinaison de perception et de raisonnement spatial, de trajectoire, d’action, d’état et multi-vues, sans mesurer séparément chacune de ces composantes. Dans la base, Seed 2.1 Pro domine avec 72 %, tandis que la médiane des 22 modèles atteint 56 %. Cet écart révèle une hiérarchie encore marquée et ne suggère pas une saturation générale du benchmark. La portée reste toutefois circonscrite à 400 QCM en anglais, avec l’exactitude comme unique métrique. Le format fermé peut aussi favoriser la sélection de la bonne option sans restituer tout le raisonnement sous-jacent. Comme le jeu est public, son exposition peut créer un risque de contamination lors du développement des modèles. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de la rigueur et de l’homogénéité des procédures d’évaluation employées.


Sources des scores : llm-stats.