google/siglip-base-patch16-512
Publié par Google le 8 janvier 2024, google/siglip-base-patch16-512 est un modèle d’embedding multimodal de 204 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions représentant des images et des textes afin de rapprocher les deux modalités.
Publié par Google le 8 janvier 2024, google/siglip-base-patch16-512 est un modèle d’embedding multimodal de 204 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions représentant des images et des textes afin de rapprocher les deux modalités.
Préentraîné sur les paires image-texte en anglais de WebLI avec des images de 512 × 512 pixels, ce modèle de type CLIP emploie une perte sigmoïde appliquée aux paires. Sous licence ouverte Apache 2.0, il peut servir à la recherche image-texte, à la classification zero-shot, au clustering et à l’indexation de contenus multimodaux pour un RAG.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 janvier 2024 |
| Dimension du vecteur | 768 |
| Représentation | représentations d’images et de textes pour la recherche image-texte |
| Paramètres | 204 millions |
| Paramètres actifs | 204 millions |
| Longueur de séquence max | 64 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 60,9 % | 12ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 58,5 % | 10ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 55,0 % | 7ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 50,9 % | 15ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 14,7 % | 32ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. google/siglip-base-patch16-512 se distingue surtout sur les évaluations MTEB associant images et textes. Il figure dans le top 10 des tracks Image-Text en anglais et en multilingue, ce dernier couvrant 39 langues, malgré un préentraînement effectué sur des paires anglophones. Sa qualité reste également solide sur les tâches Image only, qui réunissent recherche, classification et clustering. Les vecteurs de 768 dimensions offrent une représentation commune exploitable pour construire des index image-texte. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d'attention. Le résultat nettement plus faible sur ViDoRe V3 place le modèle vers le bas du classement pour la recherche dans des documents visuels multimodaux d’entreprise, notamment financiers. Le track Image-Text Lite le situe aussi hors du groupe de tête. Avec environ trois ans d’ancienneté, il appartient à une génération très ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents de même catégorie. Ses 204 millions de paramètres et ses vecteurs de 768 dimensions imposent par ailleurs des ressources de calcul et de stockage à intégrer au dimensionnement d’un index. Usages pertinents : recherche image-texte, classification zero-shot, clustering multimodal et RAG fondé sur des collections d’images accompagnées de texte.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).