BabyVision

BabyVision est un benchmark conçu par les auteurs Liang Chen, Baobao Chang et leurs collaborateurs d’UniPat-AI. Il évalue des capacités visuelles prélinguistiques à travers des tâches inspirées de la perception enfantine, sans faire dépendre la réussite de connaissances linguistiques.

BabyVision est un benchmark conçu par les auteurs Liang Chen, Baobao Chang et leurs collaborateurs d’UniPat-AI. Il évalue des capacités visuelles prélinguistiques à travers des tâches inspirées de la perception enfantine, sans faire dépendre la réussite de connaissances linguistiques.

Ses épreuves portent sur la discrimination fine, le suivi visuel, la perception spatiale et la reconnaissance de motifs. BabyVision sert ainsi à isoler les aptitudes élémentaires de perception et de raisonnement visuel des modèles, puis à comparer leur exactitude à des baselines humaines.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs BabyVision (Liang Chen, Baobao Chang et al. ; UniPat-AI)
Capacités mesuréesPrimitives visuelles pre-linguistiques : discrimination fine, suivi visuel, perception spatiale et reconnaissance de motifs, evaluees independamment des connaissances linguistiques.
ModalitéMultimodal
Type de questionsTaches de perception/raisonnement visuel (discrimination fine, suivi, perception spatiale, reconnaissance de motifs)
Métrique d'évaluationExactitude (accuracy) vs baselines humaines
AccèsPublic
LanguesIndependant du langage (visuel)
Taille du jeu388 items, 22 sous-classes, 4 domaines
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K3Moonshot AI▫ n.d.85,7 %16 juillet 2026Auto-déclaré
2Muse Spark 1.1Meta🔒 Propriétaire76,3 %9 juillet 2026Auto-déclaré
3Seed 2.1 ProByteDance🔒 Propriétaire73,7 %24 juin 2026Auto-déclaré
4Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire70,4 %31 mai 2026Auto-déclaré
5Kimi K2.6Moonshot AI🟢 Ouvert68,5 %20 avril 2026Auto-déclaré
6Seed 2.1 TurboByteDance🔒 Propriétaire62,9 %24 juin 2026Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert44,6 %24 février 2026Auto-déclaré
8Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert40,2 %24 février 2026Auto-déclaré
9Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert38,4 %24 février 2026Auto-déclaré

Classement établi sur 9 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 68,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BabyVision indique qu’un modèle réussit fréquemment des tâches visuelles élémentaires couvrant les quatre domaines du benchmark. Il traduit une bonne maîtrise de la discrimination fine, du suivi, des relations spatiales et des motifs, plutôt qu’une mobilisation de connaissances linguistiques. L’interprétation doit néanmoins rester circonscrite à ces tâches et aux 388 items répartis en 22 sous-classes.

La fiabilité comparative est à considérer avec prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole de mesure indépendant. L’accès public au jeu implique aussi de surveiller une éventuelle exposition préalable des modèles aux items. Parmi les sept modèles évalués dans la base, Seed 2.1 Pro arrive en tête avec 74 %, tandis que la médiane atteint 63 %. Cet écart montre un avantage mesurable du premier modèle, mais son résultat reste éloigné d’une exactitude parfaite, ce qui ne suggère pas une saturation complète du benchmark. Le classement renseigne donc surtout sur les performances relatives dans ce périmètre visuel précis.


Sources des scores : llm-stats.