RealWorldQA

Créé par xAI en 2024, RealWorldQA évalue la compréhension visuelle élémentaire du monde réel par les modèles multimodaux. Il s’appuie sur des images anonymisées prises depuis des véhicules et dans d’autres situations concrètes, accompagnées de questions ouvertes appelant des réponses…

Créé par xAI en 2024, RealWorldQA évalue la compréhension visuelle élémentaire du monde réel par les modèles multimodaux. Il s’appuie sur des images anonymisées prises depuis des véhicules et dans d’autres situations concrètes, accompagnées de questions ouvertes appelant des réponses courtes et vérifiables.

Le benchmark cible particulièrement le raisonnement spatial, les relations entre objets et l’interprétation de scènes quotidiennes. Il sert ainsi à comparer la capacité des modèles à extraire d’une image des informations utiles sur l’organisation et la dynamique d’un environnement naturel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkxAI
Capacités mesuréesraisonnement spatial, vision
ModalitéMultimodal
Type de questionsquestions ouvertes à réponse courte sur image
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeuenviron 765 questions
Année de publication2024
RessourcesSite / dépôt officiel

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (25)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire86,9 %31 mai 2026Auto-déclaré
2Seed 2.1 ProByteDance🔒 Propriétaire86,7 %24 juin 2026Auto-déclaré
3Seed 2.1 TurboByteDance🔒 Propriétaire86,3 %24 juin 2026Auto-déclaré
4Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire85,4 %31 mars 2026Auto-déclaré
5Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert85,3 %16 avril 2026Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert85,1 %24 février 2026Auto-déclaré
7Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert84,1 %24 février 2026Auto-déclaré
8Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert84,1 %21 avril 2026Auto-déclaré
9Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert83,7 %24 février 2026Auto-déclaré
10Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert81,3 %22 septembre 2025Auto-déclaré
11Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert79,3 %22 septembre 2025Auto-déclaré
12Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert79,0 %22 septembre 2025Auto-déclaré
13Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert78,4 %22 septembre 2025Auto-déclaré
14Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,8 %29 août 2024Auto-déclaré
15Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert77,4 %22 septembre 2025Auto-déclaré
16Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert73,7 %22 septembre 2025Auto-déclaré
17Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert73,5 %22 septembre 2025Auto-déclaré
18Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert73,2 %22 septembre 2025Auto-déclaré
19Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert71,5 %22 septembre 2025Auto-déclaré
20Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,9 %22 septembre 2025Auto-déclaré
21Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert70,3 %27 mars 2025Auto-déclaré
22Grok-1.5VxAI🔒 Propriétaire68,7 %12 avril 2024Auto-déclaré
23DeepSeek VL2DeepSeek🟢 Ouvert68,4 %13 décembre 2024Auto-déclaré
24DeepSeek VL2 SmallDeepSeek🟢 Ouvert65,4 %13 décembre 2024Auto-déclaré
25DeepSeek VL2 TinyDeepSeek🟢 Ouvert64,2 %13 décembre 2024Auto-déclaré

Classement établi sur 25 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 78,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur RealWorldQA indique qu’un modèle répond correctement à une forte proportion de questions portant sur des scènes réelles, notamment lorsqu’il faut identifier des relations spatiales entre objets ou interpréter une situation quotidienne. La métrique d’accuracy offre une lecture directe des performances, mais la fiabilité du classement doit être nuancée, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre commun indépendant.

Avec une médiane de 78 % sur 25 modèles et un meilleur résultat de 87 % pour Qwen3.7-Plus, le classement montre que les systèmes évalués atteignent déjà des niveaux relativement élevés. Cette proximité avec le maximum possible peut réduire progressivement le pouvoir discriminant du benchmark et signaler un risque de saturation. Son accès public implique également un risque de contamination à considérer lors de l’interprétation des scores. Enfin, sa portée reste ciblée par sa taille d’environ 765 questions, son contenu en anglais et sa spécialisation dans la compréhension spatiale d’images réelles.


Sources des scores : llm-stats.