google/siglip-base-patch16-256

Publié par Google le 8 janvier 2024, google/siglip-base-patch16-256 est un modèle d’embedding multimodal image-texte de 203 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et traite des images en 256 × 256. Son préentraînement repose sur des paires…

Publié par Google le 8 janvier 2024, google/siglip-base-patch16-256 est un modèle d’embedding multimodal image-texte de 203 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et traite des images en 256 × 256. Son préentraînement repose sur des paires image-texte en anglais issues de WebLI.

Ce modèle de type CLIP utilise une perte sigmoïde calculée sur chaque paire image-texte. Il sert à la recherche sémantique entre images et textes, à la classification zero-shot, au clustering et à la récupération multimodale pour le RAG. Sa licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 janvier 2024
Dimension du vecteur768
Représentationreprésentations multimodales image-texte
Paramètres203 millions
Paramètres actifs203 millions
Longueur de séquence max64 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only59,5 %19ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English55,5 %18ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual52,0 %17ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite48,4 %24ᵉ / 49mteb✅ Mesuré
MTEB: ViDoRe V36,7 %35ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat relatif apparaît sur MTEB Image only, où le modèle se situe dans la première moitié du classement pour des tâches mêlant retrieval, classification et clustering. Les tracks Image-Text English et Image-Text Multilingual le placent également dans la moitié supérieure, ce qui indique une aptitude correcte à rapprocher images et requêtes textuelles, y compris dans des évaluations couvrant 39 langues malgré un préentraînement en anglais. Les vecteurs de 768 dimensions offrent un compromis pratique pour construire des index moins lourds que ceux reposant sur des représentations de plus grande dimension. La licence Apache 2.0 facilite le déploiement auto-hébergé.

Limites et points d'attention. Les positions obtenues ne placent pas google/siglip-base-patch16-256 parmi les tout premiers modèles des tracks Image-Text. Le résultat Image-Text Lite reste en milieu de tableau, tandis que ViDoRe V3 constitue sa faiblesse majeure, avec un classement proche du bas pour la recherche dans des documents visuels multimodaux d’entreprise, notamment financiers. Son préentraînement anglophone appelle aussi à la prudence pour les corpus multilingues. Avec environ trois ans d’ancienneté, une durée très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles plus récents. Usages pertinents : recherche image-texte généraliste, classification zero-shot, clustering visuel et RAG multimodal hors documents d’entreprise complexes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).