google/siglip-base-patch16-224

Publié par Google le 8 janvier 2024, google/siglip-base-patch16-224 est un modèle d’embedding multimodal image-texte de 203 millions de paramètres actifs. Il produit des vecteurs de 768 dimensions, traite des images de 224 × 224 pixels et des textes limités à 64 tokens.

Publié par Google le 8 janvier 2024, google/siglip-base-patch16-224 est un modèle d’embedding multimodal image-texte de 203 millions de paramètres actifs. Il produit des vecteurs de 768 dimensions, traite des images de 224 × 224 pixels et des textes limités à 64 tokens.

Préentraîné sur des paires image-texte en anglais de WebLI, il repose sur une architecture de type CLIP avec une perte sigmoïde calculée par paire. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement. Il sert notamment à la recherche image-texte, à la classification zero-shot, au clustering et à la récupération multimodale pour le RAG.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 janvier 2024
Dimension du vecteur768
Représentationreprésentation multimodale image-texte
Paramètres203 millions
Paramètres actifs203 millions
Longueur de séquence max64 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only58,6 %21ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English54,3 %20ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual50,9 %18ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite47,4 %27ᵉ / 49mteb✅ Mesuré
MTEB: ViDoRe V35,4 %37ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

▶ google/siglip-base-patc…59 %

MTEB: Image-Text, English

▶ google/siglip-base-patc…54 %
TIGER-Lab/VLM2Vec-LoRA53 %

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent la représentation d’images seules et les tâches image-texte, notamment multilingues, où le modèle se situe autour du milieu de tableau. Cette polyvalence permet d’indexer des images et des descriptions dans un espace vectoriel commun pour la recherche par similarité, la classification et le regroupement de contenus. La fonction de perte sigmoïde évite une normalisation globale des similarités entre toutes les paires. La licence Apache 2.0 constitue un atout pratique pour le déploiement et l’adaptation en infrastructure propre.

Limites et points d’attention. Le résultat très faible sur MTEB ViDoRe V3 place le modèle près du bas du classement pour la recherche dans des documents visuels multimodaux d’entreprise, notamment financiers. Le track Image-Text, Lite le situe également dans la moitié basse. Le préentraînement anglophone et la limite de 64 tokens réduisent son intérêt pour les requêtes textuelles longues, même si le benchmark multilingue montre une certaine transférabilité. Avec environ trois ans d’ancienneté, très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles plus récents. Usages pertinents : recherche image-texte généraliste, classification zero-shot et clustering visuel sur des textes courts.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).