google/siglip-large-patch16-384

Publié par Google le 8 janvier 2024, google/siglip-large-patch16-384 est un modèle d’embedding multimodal image-texte de 652 millions de paramètres, tous actifs. Il produit des vecteurs de 1 024 dimensions et traite des images en résolution 384 × 384. Distribué sous licence ouverte…

Publié par Google le 8 janvier 2024, google/siglip-large-patch16-384 est un modèle d’embedding multimodal image-texte de 652 millions de paramètres, tous actifs. Il produit des vecteurs de 1 024 dimensions et traite des images en résolution 384 × 384. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé.

Préentraîné sur les paires image-texte en anglais de WebLI, ce modèle de type CLIP emploie une fonction de perte sigmoïde appliquée aux paires image-texte. Il sert à la recherche sémantique entre images et textes, à la classification d’images zero-shot, au clustering et à l’indexation multimodale pour le RAG.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 janvier 2024
Dimension du vecteur1 024
Représentationreprésentations multimodales image-texte
Paramètres652 millions
Paramètres actifs652 millions
Longueur de séquence max64 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only63,5 %7ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English59,9 %5ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual57,0 %5ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite53,3 %11ᵉ / 49mteb✅ Mesuré
MTEB: ViDoRe V316,4 %28ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent google/siglip-large-patch16-384 dans le top 10 en représentation d’images seules ainsi qu’en association image-texte en anglais. Le modèle figure également parmi les meilleurs du track multilingue couvrant 39 langues, malgré un préentraînement effectué sur des données anglaises. Ce profil convient particulièrement à la recherche d’images à partir de requêtes textuelles, à la classification visuelle et au regroupement de contenus multimodaux. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes propriétaires ou ouverts.

Limites et points d'attention. Le résultat plus modeste sur MTEB Image-Text, Lite le situe hors du top 10, tandis que les performances sur ViDoRe V3 sont nettement plus faibles pour la recherche dans des documents visuels d’entreprise, notamment financiers. Les vecteurs de 1 024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec 652 millions de paramètres, le modèle exige aussi davantage de ressources d’inférence que de petits encodeurs. À près de trois ans, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents de son segment et souvent absent des catalogues actuels. Usages pertinents : recherche image-texte généraliste, classification zero-shot, clustering multimodal et RAG fondé sur des collections visuelles peu spécialisées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).