Salesforce/blip-itm-base-coco
Salesforce/blip-itm-base-coco est un modèle d’embedding vision-langage publié par Salesforce le 1 août 2023 sous licence ouverte BSD 3-Clause. Ses 224 millions de paramètres, tous actifs, produisent des représentations denses de 768 dimensions, comparées par similarité cosinus entre…
Salesforce/blip-itm-base-coco est un modèle d’embedding vision-langage publié par Salesforce le 1 août 2023 sous licence ouverte BSD 3-Clause. Ses 224 millions de paramètres, tous actifs, produisent des représentations denses de 768 dimensions, comparées par similarité cosinus entre images et textes. Il est évalué en anglais et dans un cadre multilingue couvrant 39 langues.
Fondé sur l’architecture BLIP avec un backbone ViT base et entraîné sur COCO, il cible l’appariement image-texte. Il peut servir à la recherche sémantique multimodale, à la récupération de contenus pour un RAG, au classement d’images par requête textuelle, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Salesforce |
| Poids | 🟢 Poids ouverts |
| Licence | BSD 3-Clause |
| Date de sortie | 1 août 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense avec similarité cosinus image-texte |
| Paramètres | 224 millions |
| Paramètres actifs | 224 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 55,7 % | 26ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 48,9 % | 32ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 44,7 % | 29ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 41,0 % | 38ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Son résultat MTEB le plus favorable concerne le track Image only, ce qui en fait surtout un outil de représentation et d’organisation d’images. L’association de BlipForImageTextRetrieval et de représentations denses permet de calculer directement des scores d’appariement image-texte ainsi que des similarités cosinus. Les vecteurs de 768 dimensions offrent un format standard pour construire des index de recherche multimodale. La licence BSD 3-Clause autorise l’auto-hébergement et l’intégration dans des applications commerciales, avec des contraintes limitées.
Limites et points d’attention. Les classements MTEB sont moins favorables sur Image-Text, English, Image-Text, Multilingual et surtout Image-Text, Lite, où le modèle se situe dans la partie basse des modèles évalués. La couverture multilingue existe dans l’évaluation, mais ne constitue donc pas un point fort comparatif. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de la génération 2023 est probablement dépassé par des solutions plus récentes et peut avoir été retiré de certains catalogues. Usages pertinents : recherche image-texte sur des corpus proches de COCO, classement multimodal, similarité et clustering d’images.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).