Salesforce/blip-itm-large-coco
Salesforce/blip-itm-large-coco est un modèle d’embedding vision-langage publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause. Ses 446 millions de paramètres, tous actifs, reposent sur une architecture BLIP large avec un backbone ViT large, entraînée sur COCO pour…
Salesforce/blip-itm-large-coco est un modèle d’embedding vision-langage publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause. Ses 446 millions de paramètres, tous actifs, reposent sur une architecture BLIP large avec un backbone ViT large, entraînée sur COCO pour l’appariement entre images et textes.
Le modèle produit des représentations denses de 768 dimensions, comparables par similarité cosinus, ainsi qu’un score d’appariement image-texte calculé par une tête ITM. Il sert principalement à la recherche multimodale, à la sélection d’images pour un pipeline RAG, au classement par pertinence et au clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Salesforce |
| Poids | 🟢 Poids ouverts |
| Licence | BSD 3-Clause |
| Date de sortie | 1 août 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense avec score de similarité cosinus, et score d’appariement image-texte via une tête ITM |
| Paramètres | 446 millions |
| Paramètres actifs | 446 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 56,3 % | 23ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 50,9 % | 26ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 45,9 % | 26ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 42,0 % | 34ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Son meilleur résultat MTEB concerne le track Image only, où il se situe au milieu du classement sur des tâches associant retrieval, classification et clustering. L’architecture combine deux modes utiles en pratique : des vecteurs denses pour indexer et comparer les contenus, et une tête ITM pour réévaluer directement la correspondance entre une image et un texte. La dimension de 768 reste adaptée aux bases vectorielles courantes. La licence BSD 3-Clause autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Les résultats MTEB Image-Text placent le modèle dans la seconde moitié des classements en anglais comme en multilingue. Le track Image-Text, Lite est encore moins favorable, ce qui limite son intérêt face à des solutions plus récentes pour la recherche multimodale généraliste. Ses 446 millions de paramètres représentent aussi une charge notable pour le déploiement, tandis que les vecteurs de 768 dimensions alourdissent davantage l’index qu’une représentation plus courte. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles ultérieurs. Usages pertinents : recherche image-texte sur COCO ou domaine proche, reclassement ITM, clustering visuel et RAG multimodal auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).