facebook/dinov2-large

Publié par Meta le 18 juillet 2023, facebook/dinov2-large est un modèle d’embedding visuel de 304 millions de paramètres actifs. Ce Vision Transformer produit des représentations denses de 1 024 dimensions à partir des états cachés, avec une représentation globale de l’image portée par…

Publié par Meta le 18 juillet 2023, facebook/dinov2-large est un modèle d’embedding visuel de 304 millions de paramètres actifs. Ce Vision Transformer produit des représentations denses de 1 024 dimensions à partir des états cachés, avec une représentation globale de l’image portée par le jeton [CLS].

Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé. Il sert à indexer des images pour la recherche sémantique, à alimenter un système RAG sur des collections visuelles, à mesurer leur similarité ou à les regrouper par clustering. Le modèle brut extrait des caractéristiques visuelles sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMeta
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie18 juillet 2023
Dimension du vecteur1 024
Représentationreprésentation dense des images par états cachés, avec représentation globale de l’image via le jeton [CLS]
Paramètres304 millions
Paramètres actifs304 millions
Modalités (entrée → sortie)image → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only46,2 %41ᵉ / 45mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. facebook/dinov2-large repose sur un grand Vision Transformer préentraîné par auto-supervision avec DINOv2 sur une vaste collection d’images. Chaque image est découpée en patchs de taille fixe, enrichis de plongements de position absolue et d’un jeton [CLS]. Cette architecture fournit à la fois des caractéristiques locales et une représentation globale exploitable pour la recherche d’images, la classification et le clustering. Le dernier état caché du jeton [CLS] peut notamment alimenter l’entraînement d’un classifieur linéaire. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des chaînes de traitement visuel.

Limites et points d’attention. Sur MTEB Image only, qui couvre notamment retrieval, classification et clustering, le modèle se situe près du bas du classement, ce qui indique une qualité globale désormais peu compétitive. Ses vecteurs de 1 024 dimensions rendent aussi les index plus lourds et la recherche plus coûteuse que des représentations plus compactes. Sorti en 2023, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles visuels plus récents et susceptible d’avoir été retiré des catalogues courants. Usages pertinents : extraction locale de caractéristiques, prototypage reproductible et indexation visuelle auto-hébergée sous licence ouverte.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).