facebook/dinov2-base

facebook/dinov2-base est un modèle d’embedding visuel publié par Meta le 18 juillet 2023 sous licence ouverte Apache 2.0. Cet encodeur Vision Transformer de taille base compte 87 millions de paramètres actifs et produit des vecteurs denses de 768 dimensions.

facebook/dinov2-base est un modèle d’embedding visuel publié par Meta le 18 juillet 2023 sous licence ouverte Apache 2.0. Cet encodeur Vision Transformer de taille base compte 87 millions de paramètres actifs et produit des vecteurs denses de 768 dimensions.

Contrairement à un encodeur de texte, il transforme des images en représentations numériques. Préentraîné de manière auto-supervisée avec DINOv2, il traite chaque image comme une séquence de patchs et utilise notamment l’état caché final du jeton [CLS] comme représentation globale. Ces embeddings servent à la recherche d’images par similarité, à la classification et au clustering visuels.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMeta
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie18 juillet 2023
Dimension du vecteur768
Représentationdense
Paramètres87 millions
Paramètres actifs87 millions
Modalités (entrée → sortie)image → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only45,9 %42ᵉ / 45mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. facebook/dinov2-base fournit un encodeur visuel généraliste dépourvu de tête spécialisée, ce qui facilite sa réutilisation comme extracteur de caractéristiques dans différentes tâches en aval. Son préentraînement auto-supervisé sur une grande collection d’images vise à produire des représentations transférables, notamment pour la recherche visuelle, la classification et le regroupement d’images similaires. Ses 87 millions de paramètres restent contenus pour un Vision Transformer de taille base, tandis que ses vecteurs denses de 768 dimensions offrent une représentation globale directement indexable. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d’attention. Son résultat MTEB Image only le place près du bas du classement évalué, ce qui indique une qualité globale peu compétitive sur l’ensemble réunissant retrieval, classification et clustering. Sorti en 2023, le modèle appartient à une génération désormais ancienne à l’échelle de l’IA et peut être dépassé par des encodeurs visuels plus récents. Les vecteurs de 768 dimensions imposent aussi un espace d’indexation et un coût de recherche supérieurs à ceux de représentations plus courtes. Il ne convient pas à la recherche sémantique textuelle ni au RAG fondé uniquement sur du texte. Usages pertinents : extraction de caractéristiques, similarité et clustering d’images dans un environnement auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).