google/siglip-base-patch16-256-multilingual
google/siglip-base-patch16-256-multilingual est un modèle d’embedding multimodal de Google, publié le 8 janvier 2024 sous licence ouverte Apache 2.0. Ses 371 millions de paramètres produisent des vecteurs de 768 dimensions associant images et textes dans un espace de représentation commun.
google/siglip-base-patch16-256-multilingual est un modèle d’embedding multimodal de Google, publié le 8 janvier 2024 sous licence ouverte Apache 2.0. Ses 371 millions de paramètres produisent des vecteurs de 768 dimensions associant images et textes dans un espace de représentation commun.
Préentraîné sur WebLI sans filtre de langue et sur des images de 256 × 256 pixels, il repose sur une architecture de type CLIP avec une perte sigmoïde appliquée aux paires image-texte. Il sert à la recherche sémantique multimodale, au RAG avec contenu visuel, à la similarité, au clustering, à la recherche image-texte et à la classification d’images zero-shot.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 janvier 2024 |
| Dimension du vecteur | 768 |
| Représentation | représentations multimodales image-texte de type CLIP |
| Paramètres | 371 millions |
| Paramètres actifs | 371 millions |
| Longueur de séquence max | 64 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 59,9 % | 16ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 53,9 % | 21ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 53,1 % | 13ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 49,7 % | 21ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 6,2 % | 36ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB placent relativement mieux le modèle sur les représentations d’images seules et sur les tâches image-texte multilingues. Il convient donc surtout à la recherche d’images, au rapprochement entre requêtes textuelles et contenus visuels, ainsi qu’à la classification et au clustering multimodaux dans plusieurs langues. Sa couverture multilingue est évaluée sur 39 langues. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales, tandis que les vecteurs de 768 dimensions offrent un format maîtrisable pour l’indexation.
Limites et points d’attention. Les performances image-texte en anglais et sur le track Lite se situent dans la seconde moitié des classements indiqués. La faiblesse la plus nette concerne ViDoRe V3, où le modèle figure presque en fin de classement pour la recherche dans des documents visuels d’entreprise, notamment financiers. Ses 371 millions de paramètres actifs impliquent aussi davantage de calcul qu’un encodeur plus petit. Sorti en 2024 et âgé d’environ trois ans, il appartient à une génération désormais ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues actuels. Usages pertinents : recherche image-texte multilingue, classification zero-shot, similarité visuelle et clustering multimodal généraliste.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).