google/siglip-base-patch16-224
Publié par Google le 8 janvier 2024, google/siglip-base-patch16-224 est un modèle d’embedding multimodal image-texte de 203 millions de paramètres actifs. Il produit des vecteurs de 768 dimensions, traite des images de 224 × 224 pixels et des textes limités à 64 tokens.
Publié par Google le 8 janvier 2024, google/siglip-base-patch16-224 est un modèle d’embedding multimodal image-texte de 203 millions de paramètres actifs. Il produit des vecteurs de 768 dimensions, traite des images de 224 × 224 pixels et des textes limités à 64 tokens.
Préentraîné sur des paires image-texte en anglais de WebLI, il repose sur une architecture de type CLIP avec une perte sigmoïde calculée par paire. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement. Il sert notamment à la recherche image-texte, à la classification zero-shot, au clustering et à la récupération multimodale pour le RAG.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 janvier 2024 |
| Dimension du vecteur | 768 |
| Représentation | représentation multimodale image-texte |
| Paramètres | 203 millions |
| Paramètres actifs | 203 millions |
| Longueur de séquence max | 64 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 58,6 % | 21ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 54,3 % | 20ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 50,9 % | 18ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 47,4 % | 27ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 5,4 % | 37ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent la représentation d’images seules et les tâches image-texte, notamment multilingues, où le modèle se situe autour du milieu de tableau. Cette polyvalence permet d’indexer des images et des descriptions dans un espace vectoriel commun pour la recherche par similarité, la classification et le regroupement de contenus. La fonction de perte sigmoïde évite une normalisation globale des similarités entre toutes les paires. La licence Apache 2.0 constitue un atout pratique pour le déploiement et l’adaptation en infrastructure propre.
Limites et points d’attention. Le résultat très faible sur MTEB ViDoRe V3 place le modèle près du bas du classement pour la recherche dans des documents visuels multimodaux d’entreprise, notamment financiers. Le track Image-Text, Lite le situe également dans la moitié basse. Le préentraînement anglophone et la limite de 64 tokens réduisent son intérêt pour les requêtes textuelles longues, même si le benchmark multilingue montre une certaine transférabilité. Avec environ trois ans d’ancienneté, très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles plus récents. Usages pertinents : recherche image-texte généraliste, classification zero-shot et clustering visuel sur des textes courts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).