facebook/dinov2-giant
facebook/dinov2-giant est un modèle d’embedding d’images publié par Meta le 18 juillet 2023 sous licence ouverte Apache 2.0. Ce Vision Transformer géant compte 1 milliard de paramètres actifs et produit une représentation globale dense de 1 536 dimensions à partir du jeton [CLS].
facebook/dinov2-giant est un modèle d’embedding d’images publié par Meta le 18 juillet 2023 sous licence ouverte Apache 2.0. Ce Vision Transformer géant compte 1 milliard de paramètres actifs et produit une représentation globale dense de 1 536 dimensions à partir du jeton [CLS].
Préentraîné de manière auto-supervisée avec DINOv2, il transforme les images en séquences de patchs dotés de plongements linéaires et positionnels. Ses caractéristiques servent notamment à la recherche visuelle par similarité, au RAG intégrant des images, à la classification et au clustering d’images.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 juillet 2023 |
| Dimension du vecteur | 1 536 |
| Représentation | dense, sous forme d’états cachés de séquences de patchs et d’une représentation globale d’image via le jeton [CLS] |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Modalités (entrée → sortie) | image → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 46,3 % | 40ᵉ / 45 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
Notre analyse
Forces. Son architecture ViT à encodeur de type BERT fournit à la fois les états cachés d’une séquence de patchs et une représentation globale de l’image. Le modèle brut, sans tête affinée, peut ainsi servir d’extracteur de caractéristiques pour différentes tâches visuelles en aval. Sa licence Apache 2.0 facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes de recherche ou d’analyse d’images. Le préentraînement auto-supervisé sur une vaste collection d’images constitue son principal atout technique.
Limites et points d’attention. Son résultat MTEB Image only le place près du bas du classement évaluant conjointement retrieval, classification, clustering et autres usages visuels, ce qui limite son attrait face à des embeddings d’image mieux classés. Le milliard de paramètres alourdit aussi le déploiement, tandis que les vecteurs de 1 536 dimensions augmentent la taille des index et le coût de la recherche. Sorti il y a près de trois ans, il appartient à une génération ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : extraction de caractéristiques, similarité visuelle, recherche d’images, RAG multimodal et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).