google/siglip-so400m-patch14-384
Publié par Google le 8 janvier 2024 sous licence ouverte Apache 2.0, google/siglip-so400m-patch14-384 est un modèle d’embedding multimodal de 878 millions de paramètres actifs. Il produit des représentations denses de 1 152 dimensions pour rapprocher images et textes dans un même espace…
Publié par Google le 8 janvier 2024 sous licence ouverte Apache 2.0, google/siglip-so400m-patch14-384 est un modèle d’embedding multimodal de 878 millions de paramètres actifs. Il produit des représentations denses de 1 152 dimensions pour rapprocher images et textes dans un même espace vectoriel.
Pré-entraîné sur WebLI avec des images de 384 × 384 pixels, il repose sur l’architecture SoViT-400m optimisée pour sa forme et sur une perte sigmoid appliquée aux paires image-texte. Il sert à la recherche sémantique image-texte, à la classification d’images zero-shot, au clustering visuel et à la couche de recherche d’un RAG multimodal.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 janvier 2024 |
| Dimension du vecteur | 1 152 |
| Représentation | dense |
| Paramètres | 878 millions |
| Paramètres actifs | 878 millions |
| Longueur de séquence max | 64 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 64,2 % | 4ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 61,2 % | 3ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 57,1 % | 4ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 53,5 % | 10ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: ViDoRe (V1&V2) | 49,7 % | 44ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 15,8 % | 29ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les meilleurs sur les évaluations Image only, Image-Text en anglais et Image-Text multilingue. Il se distingue donc pour la représentation d’images, leur classification, leur regroupement et la recherche croisée entre requêtes textuelles et contenus visuels. Le bon classement multilingue, mesuré sur 39 langues, favorise les catalogues internationaux et les moteurs de recherche multimodaux. La licence Apache 2.0 autorise son intégration et son auto-hébergement dans des systèmes commerciaux. Sa perte sigmoid évite d’exiger une vue globale de toutes les similarités par paires lors de la normalisation.
Limites et points d’attention. Les performances chutent nettement sur ViDoRe V1&V2 et davantage sur ViDoRe V3, consacrés à la recherche dans des documents visuels complexes, notamment des documents d’entreprise. Le vecteur dense de 1 152 dimensions alourdit les index et augmente le coût de stockage et de recherche par rapport à des représentations plus compactes. Avec 878 millions de paramètres et environ trois ans d’ancienneté, le modèle est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré du catalogue de son éditeur. Usages pertinents : recherche image-texte, classification zero-shot, similarité visuelle et clustering d’images, plutôt que recherche documentaire multimodale complexe.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).