google/siglip-large-patch16-256

Publié par Google le 8 janvier 2024 sous licence ouverte Apache 2.0, google/siglip-large-patch16-256 est un modèle d’embedding multimodal image-texte de 652 millions de paramètres. Il produit des vecteurs de 1 024 dimensions à partir d’images de 256 × 256 pixels et de textes limités à 64…

Publié par Google le 8 janvier 2024 sous licence ouverte Apache 2.0, google/siglip-large-patch16-256 est un modèle d’embedding multimodal image-texte de 652 millions de paramètres. Il produit des vecteurs de 1 024 dimensions à partir d’images de 256 × 256 pixels et de textes limités à 64 tokens.

Pré-entraîné sur des paires image-texte en anglais issues de WebLI, il repose sur une architecture de type CLIP avec une perte sigmoïde appliquée directement aux paires. Il sert à la recherche image-texte, à la classification d’images zero-shot, au clustering et à la récupération sémantique dans un système RAG multimodal.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 janvier 2024
Dimension du vecteur1 024
Représentationreprésentations multimodales image-texte
Paramètres652 millions
Paramètres actifs652 millions
Longueur de séquence max64 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only62,6 %9ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English57,9 %13ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual55,2 %6ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite51,4 %13ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. google/siglip-large-patch16-256 figure dans le top 10 de MTEB sur les représentations d’images seules et sur le track image-texte multilingue couvrant 39 langues. Ce positionnement souligne son intérêt pour la recherche visuelle, la classification, le clustering et l’association sémantique entre images et requêtes textuelles multilingues. Sa perte sigmoïde évite la normalisation globale des similarités entre toutes les paires. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Ses résultats sont moins distinctifs sur les tracks MTEB Image-Text English et Image-Text Lite, où il reste hors du top 10. Le pré-entraînement textuel repose sur l’anglais, malgré de bonnes performances multilingues mesurées. La limite de 64 tokens convient aux libellés et requêtes courtes, mais impose de découper les descriptions ou documents longs. Les vecteurs de 1 024 dimensions alourdissent davantage les index et les calculs de similarité que des représentations plus petites. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de sa période est probablement dépassé et souvent retiré des catalogues actuels. Usages pertinents : recherche image-texte, classification zero-shot, clustering visuel et RAG multimodal fondé sur des requêtes courtes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).