facebook/dinov2-small
facebook/dinov2-small est un modèle d’embedding d’images publié par Meta le 18 juillet 2023 sous licence ouverte Apache 2.0. Ce Vision Transformer de 22 millions de paramètres produit des représentations denses de dimension 384, à partir des patchs et du jeton global [CLS].
facebook/dinov2-small est un modèle d’embedding d’images publié par Meta le 18 juillet 2023 sous licence ouverte Apache 2.0. Ce Vision Transformer de 22 millions de paramètres produit des représentations denses de dimension 384, à partir des patchs et du jeton global [CLS].
Préentraîné par apprentissage auto-supervisé avec DINOv2, il sert à extraire des caractéristiques visuelles pour la recherche par similarité, la classification ou le clustering d’images. Il peut aussi alimenter un système de recherche augmentée fondé sur des contenus visuels, mais ne traite ni ne génère du texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 juillet 2023 |
| Dimension du vecteur | 384 |
| Représentation | représentations denses des patchs d’image et représentation dense globale de l’image via le dernier état caché du jeton [CLS] |
| Paramètres | 22 millions |
| Paramètres actifs | 22 millions |
| Modalités (entrée → sortie) | image → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 43,1 % | 44ᵉ / 45 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
Notre analyse
Forces. facebook/dinov2-small associe une architecture ViT compacte à une représentation globale de chaque image et à des représentations locales de ses patchs. Les images sont découpées en séquences de patchs de taille fixe, enrichies par des plongements linéaires, des positions absolues et un jeton [CLS]. Le dernier état caché de ce jeton fournit un vecteur global de 384 dimensions. Cette dimension relativement compacte favorise des index visuels plus légers. La licence Apache 2.0 autorise en outre l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Son résultat MTEB Image only le place presque en dernière position, ce qui indique une qualité globale faible face aux modèles évalués pour la recherche, la classification et le clustering d’images. Sorti en 2023, il est très ancien à l’échelle de l’IA et probablement dépassé par des modèles visuels plus récents, voire retiré de certains catalogues. Le modèle brut ne comporte pas de tête affinée et sert avant tout d’extracteur de caractéristiques. Usages pertinents : prototypes légers, indexation visuelle compacte, similarité et clustering d’images lorsque l’auto-hébergement prime sur les performances de référence.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).