facebook/dinov2-small

facebook/dinov2-small est un modèle d’embedding d’images publié par Meta le 18 juillet 2023 sous licence ouverte Apache 2.0. Ce Vision Transformer de 22 millions de paramètres produit des représentations denses de dimension 384, à partir des patchs et du jeton global [CLS].

facebook/dinov2-small est un modèle d’embedding d’images publié par Meta le 18 juillet 2023 sous licence ouverte Apache 2.0. Ce Vision Transformer de 22 millions de paramètres produit des représentations denses de dimension 384, à partir des patchs et du jeton global [CLS].

Préentraîné par apprentissage auto-supervisé avec DINOv2, il sert à extraire des caractéristiques visuelles pour la recherche par similarité, la classification ou le clustering d’images. Il peut aussi alimenter un système de recherche augmentée fondé sur des contenus visuels, mais ne traite ni ne génère du texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMeta
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie18 juillet 2023
Dimension du vecteur384
Représentationreprésentations denses des patchs d’image et représentation dense globale de l’image via le dernier état caché du jeton [CLS]
Paramètres22 millions
Paramètres actifs22 millions
Modalités (entrée → sortie)image → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only43,1 %44ᵉ / 45mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

▶ facebook/dinov2-small43 %
nyu-visionx/moco-v3-vit…38 %

Notre analyse

Forces. facebook/dinov2-small associe une architecture ViT compacte à une représentation globale de chaque image et à des représentations locales de ses patchs. Les images sont découpées en séquences de patchs de taille fixe, enrichies par des plongements linéaires, des positions absolues et un jeton [CLS]. Le dernier état caché de ce jeton fournit un vecteur global de 384 dimensions. Cette dimension relativement compacte favorise des index visuels plus légers. La licence Apache 2.0 autorise en outre l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Son résultat MTEB Image only le place presque en dernière position, ce qui indique une qualité globale faible face aux modèles évalués pour la recherche, la classification et le clustering d’images. Sorti en 2023, il est très ancien à l’échelle de l’IA et probablement dépassé par des modèles visuels plus récents, voire retiré de certains catalogues. Le modèle brut ne comporte pas de tête affinée et sert avant tout d’extracteur de caractéristiques. Usages pertinents : prototypes légers, indexation visuelle compacte, similarité et clustering d’images lorsque l’auto-hébergement prime sur les performances de référence.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).