LingoQA
Créé par Wayve en 2024, LingoQA est un benchmark consacré à la compréhension visuelle et linguistique appliquée à la conduite autonome. Il repose sur des questions à réponse libre portant sur des séquences vidéo de conduite.
Créé par Wayve en 2024, LingoQA est un benchmark consacré à la compréhension visuelle et linguistique appliquée à la conduite autonome. Il repose sur des questions à réponse libre portant sur des séquences vidéo de conduite.
L’évaluation sollicite la perception de la scène, le raisonnement spatial et la capacité à justifier une réponse à partir des éléments observés. LingoQA sert ainsi à comparer des modèles multimodaux sur leur aptitude à relier langage et informations visuelles dans des situations de conduite.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Wayve |
| Capacités mesurées | Compréhension visuelle-linguistique pour la conduite autonome : perception, raisonnement et justification à partir de vidéos de conduite |
| Modalité | Multimodal |
| Type de questions | VQA (réponse libre sur séquences vidéo de conduite) |
| Métrique d'évaluation | Lingo-Judge (classifieur de véracité, ~0.95 de corrélation de Spearman avec l'humain) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 28 000 scénarios vidéo, 419 000 annotations QA |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | Qwen3.7-Plus | Qwen | 83,4 % | 31 mai 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Qwen | 82,0 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-122B-A10B | Qwen | 80,8 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-35B-A3B | Qwen | 79,2 % | 24 février 2026 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 81,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur LingoQA indique que les réponses libres d’un modèle sont fréquemment considérées comme véridiques par Lingo-Judge, au regard des vidéos et des annotations de référence. Ce résultat traduit une bonne combinaison de perception, de raisonnement et de justification dans le cadre précis de scènes de conduite en anglais. Lingo-Judge apporte une évaluation automatisée dont la corrélation de Spearman avec le jugement humain atteint environ 0,95. La lecture des résultats demande néanmoins de distinguer cette méthode de mesure de leur provenance, puisque les scores de la base sont majoritairement auto-déclarés par les éditeurs. Le classement reste aussi étroit, avec quatre modèles évalués. Qwen3.7-Plus arrive en tête à 83 %, tandis que la médiane atteint 81 %. Ce faible écart suggère une différenciation limitée entre les modèles recensés et peut signaler un début de saturation sur cet ensemble. L’accès public appelle également à considérer le risque de contamination lors de l’interprétation. Enfin, les conclusions restent circonscrites à la VQA vidéo pour la conduite autonome, et non aux capacités multimodales générales.
Sources des scores : llm-stats.