RealWorldQA
Créé par xAI en 2024, RealWorldQA évalue la compréhension visuelle élémentaire du monde réel par les modèles multimodaux. Il s’appuie sur des images anonymisées prises depuis des véhicules et dans d’autres situations concrètes, accompagnées de questions ouvertes appelant des réponses…
Créé par xAI en 2024, RealWorldQA évalue la compréhension visuelle élémentaire du monde réel par les modèles multimodaux. Il s’appuie sur des images anonymisées prises depuis des véhicules et dans d’autres situations concrètes, accompagnées de questions ouvertes appelant des réponses courtes et vérifiables.
Le benchmark cible particulièrement le raisonnement spatial, les relations entre objets et l’interprétation de scènes quotidiennes. Il sert ainsi à comparer la capacité des modèles à extraire d’une image des informations utiles sur l’organisation et la dynamique d’un environnement naturel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | xAI |
| Capacités mesurées | raisonnement spatial, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes à réponse courte sur image |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 765 questions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (25)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 86,9 % | 31 mai 2026 | Auto-déclaré |
| 2 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 86,7 % | 24 juin 2026 | Auto-déclaré |
| 3 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 86,3 % | 24 juin 2026 | Auto-déclaré |
| 4 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 85,4 % | 31 mars 2026 | Auto-déclaré |
| 5 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,3 % | 16 avril 2026 | Auto-déclaré |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,1 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,1 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,1 % | 21 avril 2026 | Auto-déclaré |
| 9 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,7 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,3 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,3 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,0 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,4 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,8 % | 29 août 2024 | Auto-déclaré |
| 15 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,4 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,7 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,5 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,2 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,5 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,9 % | 22 septembre 2025 | Auto-déclaré |
| 21 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,3 % | 27 mars 2025 | Auto-déclaré |
| 22 | Grok-1.5V | xAI | 🔒 Propriétaire | 68,7 % | 12 avril 2024 | Auto-déclaré |
| 23 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 68,4 % | 13 décembre 2024 | Auto-déclaré |
| 24 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 65,4 % | 13 décembre 2024 | Auto-déclaré |
| 25 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 64,2 % | 13 décembre 2024 | Auto-déclaré |
Classement établi sur 25 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 78,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur RealWorldQA indique qu’un modèle répond correctement à une forte proportion de questions portant sur des scènes réelles, notamment lorsqu’il faut identifier des relations spatiales entre objets ou interpréter une situation quotidienne. La métrique d’accuracy offre une lecture directe des performances, mais la fiabilité du classement doit être nuancée, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre commun indépendant.
Avec une médiane de 78 % sur 25 modèles et un meilleur résultat de 87 % pour Qwen3.7-Plus, le classement montre que les systèmes évalués atteignent déjà des niveaux relativement élevés. Cette proximité avec le maximum possible peut réduire progressivement le pouvoir discriminant du benchmark et signaler un risque de saturation. Son accès public implique également un risque de contamination à considérer lors de l’interprétation des scores. Enfin, sa portée reste ciblée par sa taille d’environ 765 questions, son contenu en anglais et sa spécialisation dans la compréhension spatiale d’images réelles.
Sources des scores : llm-stats.