google/siglip-base-patch16-384

Publié par Google le 8 janvier 2024, google/siglip-base-patch16-384 est un modèle d’embedding multimodal de 203 millions de paramètres, tous actifs. Il transforme images et textes en vecteurs de 768 dimensions afin de rapprocher leurs contenus sémantiques.

Publié par Google le 8 janvier 2024, google/siglip-base-patch16-384 est un modèle d’embedding multimodal de 203 millions de paramètres, tous actifs. Il transforme images et textes en vecteurs de 768 dimensions afin de rapprocher leurs contenus sémantiques.

Préentraîné sur des paires image-texte en anglais de WebLI et des images de 384 × 384 pixels, ce modèle de type CLIP utilise une perte sigmoïde calculée par paire. Sous licence ouverte Apache 2.0, il sert à la recherche image-texte, à la classification zero-shot, au clustering et à des systèmes RAG multimodaux. Il ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 janvier 2024
Dimension du vecteur768
Représentationreprésentations multimodales image-texte
Paramètres203 millions
Paramètres actifs203 millions
Longueur de séquence max64 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only60,8 %13ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English57,8 %14ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual54,2 %10ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite50,5 %17ᵉ / 49mteb✅ Mesuré
MTEB: ViDoRe V311,6 %33ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur positionnement relatif apparaît sur MTEB Image-Text, Multilingual, où le modèle atteint le top 10. Il conserve également un classement solide sur les tâches Image only et Image-Text, English, qui couvrent notamment la recherche, la classification et le clustering. Ces résultats en font un encodeur adapté au rapprochement sémantique entre images et requêtes textuelles, y compris dans des évaluations couvrant plusieurs langues, malgré un préentraînement en anglais. La licence Apache 2.0 facilite l’exploitation, la modification et le déploiement dans une infrastructure maîtrisée.

Limites et points d'attention. Le résultat faible sur MTEB ViDoRe V3 indique une aptitude limitée à la recherche dans des documents visuels multimodaux d’entreprise, notamment financiers. Le classement plus en retrait sur Image-Text, Lite montre aussi une robustesse moins régulière selon les variantes d’évaluation. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, cette génération est probablement dépassée par des encodeurs plus récents et peut avoir quitté certains catalogues. Usages pertinents : recherche image-texte, classification zero-shot, clustering visuel et RAG multimodal hors recherche documentaire complexe.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).