google/siglip-base-patch16-384
Publié par Google le 8 janvier 2024, google/siglip-base-patch16-384 est un modèle d’embedding multimodal de 203 millions de paramètres, tous actifs. Il transforme images et textes en vecteurs de 768 dimensions afin de rapprocher leurs contenus sémantiques.
Publié par Google le 8 janvier 2024, google/siglip-base-patch16-384 est un modèle d’embedding multimodal de 203 millions de paramètres, tous actifs. Il transforme images et textes en vecteurs de 768 dimensions afin de rapprocher leurs contenus sémantiques.
Préentraîné sur des paires image-texte en anglais de WebLI et des images de 384 × 384 pixels, ce modèle de type CLIP utilise une perte sigmoïde calculée par paire. Sous licence ouverte Apache 2.0, il sert à la recherche image-texte, à la classification zero-shot, au clustering et à des systèmes RAG multimodaux. Il ne génère pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 janvier 2024 |
| Dimension du vecteur | 768 |
| Représentation | représentations multimodales image-texte |
| Paramètres | 203 millions |
| Paramètres actifs | 203 millions |
| Longueur de séquence max | 64 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 60,8 % | 13ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 57,8 % | 14ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 54,2 % | 10ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 50,5 % | 17ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 11,6 % | 33ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Le meilleur positionnement relatif apparaît sur MTEB Image-Text, Multilingual, où le modèle atteint le top 10. Il conserve également un classement solide sur les tâches Image only et Image-Text, English, qui couvrent notamment la recherche, la classification et le clustering. Ces résultats en font un encodeur adapté au rapprochement sémantique entre images et requêtes textuelles, y compris dans des évaluations couvrant plusieurs langues, malgré un préentraînement en anglais. La licence Apache 2.0 facilite l’exploitation, la modification et le déploiement dans une infrastructure maîtrisée.
Limites et points d'attention. Le résultat faible sur MTEB ViDoRe V3 indique une aptitude limitée à la recherche dans des documents visuels multimodaux d’entreprise, notamment financiers. Le classement plus en retrait sur Image-Text, Lite montre aussi une robustesse moins régulière selon les variantes d’évaluation. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, cette génération est probablement dépassée par des encodeurs plus récents et peut avoir quitté certains catalogues. Usages pertinents : recherche image-texte, classification zero-shot, clustering visuel et RAG multimodal hors recherche documentaire complexe.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).