BabyVision
BabyVision est un benchmark conçu par les auteurs Liang Chen, Baobao Chang et leurs collaborateurs d’UniPat-AI. Il évalue des capacités visuelles prélinguistiques à travers des tâches inspirées de la perception enfantine, sans faire dépendre la réussite de connaissances linguistiques.
BabyVision est un benchmark conçu par les auteurs Liang Chen, Baobao Chang et leurs collaborateurs d’UniPat-AI. Il évalue des capacités visuelles prélinguistiques à travers des tâches inspirées de la perception enfantine, sans faire dépendre la réussite de connaissances linguistiques.
Ses épreuves portent sur la discrimination fine, le suivi visuel, la perception spatiale et la reconnaissance de motifs. BabyVision sert ainsi à isoler les aptitudes élémentaires de perception et de raisonnement visuel des modèles, puis à comparer leur exactitude à des baselines humaines.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs BabyVision (Liang Chen, Baobao Chang et al. ; UniPat-AI) |
| Capacités mesurées | Primitives visuelles pre-linguistiques : discrimination fine, suivi visuel, perception spatiale et reconnaissance de motifs, evaluees independamment des connaissances linguistiques. |
| Modalité | Multimodal |
| Type de questions | Taches de perception/raisonnement visuel (discrimination fine, suivi, perception spatiale, reconnaissance de motifs) |
| Métrique d'évaluation | Exactitude (accuracy) vs baselines humaines |
| Accès | Public |
| Langues | Independant du langage (visuel) |
| Taille du jeu | 388 items, 22 sous-classes, 4 domaines |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI | ▫ n.d. | 85,7 % | 16 juillet 2026 | Auto-déclaré |
| 2 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 76,3 % | 9 juillet 2026 | Auto-déclaré |
| 3 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 73,7 % | 24 juin 2026 | Auto-déclaré |
| 4 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 70,4 % | 31 mai 2026 | Auto-déclaré |
| 5 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 68,5 % | 20 avril 2026 | Auto-déclaré |
| 6 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 62,9 % | 24 juin 2026 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,6 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 40,2 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 38,4 % | 24 février 2026 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 68,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BabyVision indique qu’un modèle réussit fréquemment des tâches visuelles élémentaires couvrant les quatre domaines du benchmark. Il traduit une bonne maîtrise de la discrimination fine, du suivi, des relations spatiales et des motifs, plutôt qu’une mobilisation de connaissances linguistiques. L’interprétation doit néanmoins rester circonscrite à ces tâches et aux 388 items répartis en 22 sous-classes.
La fiabilité comparative est à considérer avec prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole de mesure indépendant. L’accès public au jeu implique aussi de surveiller une éventuelle exposition préalable des modèles aux items. Parmi les sept modèles évalués dans la base, Seed 2.1 Pro arrive en tête avec 74 %, tandis que la médiane atteint 63 %. Cet écart montre un avantage mesurable du premier modèle, mais son résultat reste éloigné d’une exactitude parfaite, ce qui ne suggère pas une saturation complète du benchmark. Le classement renseigne donc surtout sur les performances relatives dans ce périmètre visuel précis.
Sources des scores : llm-stats.