Salesforce/blip-itm-large-coco

Salesforce/blip-itm-large-coco est un modèle d’embedding vision-langage publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause. Ses 446 millions de paramètres, tous actifs, reposent sur une architecture BLIP large avec un backbone ViT large, entraînée sur COCO pour…

Salesforce/blip-itm-large-coco est un modèle d’embedding vision-langage publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause. Ses 446 millions de paramètres, tous actifs, reposent sur une architecture BLIP large avec un backbone ViT large, entraînée sur COCO pour l’appariement entre images et textes.

Le modèle produit des représentations denses de 768 dimensions, comparables par similarité cosinus, ainsi qu’un score d’appariement image-texte calculé par une tête ITM. Il sert principalement à la recherche multimodale, à la sélection d’images pour un pipeline RAG, au classement par pertinence et au clustering, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSalesforce
Poids🟢 Poids ouverts
LicenceBSD 3-Clause
Date de sortie1 août 2023
Dimension du vecteur768
Représentationdense avec score de similarité cosinus, et score d’appariement image-texte via une tête ITM
Paramètres446 millions
Paramètres actifs446 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only56,3 %23ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English50,9 %26ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual45,9 %26ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite42,0 %34ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

▶ Salesforce/blip-itm-lar…56 %
TIGER-Lab/VLM2Vec-LoRA56 %

MTEB: Image-Text, English

TIGER-Lab/VLM2Vec-LoRA53 %
▶ Salesforce/blip-itm-lar…51 %
kakaobrain/align-base49 %

Notre analyse

Forces. Son meilleur résultat MTEB concerne le track Image only, où il se situe au milieu du classement sur des tâches associant retrieval, classification et clustering. L’architecture combine deux modes utiles en pratique : des vecteurs denses pour indexer et comparer les contenus, et une tête ITM pour réévaluer directement la correspondance entre une image et un texte. La dimension de 768 reste adaptée aux bases vectorielles courantes. La licence BSD 3-Clause autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Les résultats MTEB Image-Text placent le modèle dans la seconde moitié des classements en anglais comme en multilingue. Le track Image-Text, Lite est encore moins favorable, ce qui limite son intérêt face à des solutions plus récentes pour la recherche multimodale généraliste. Ses 446 millions de paramètres représentent aussi une charge notable pour le déploiement, tandis que les vecteurs de 768 dimensions alourdissent davantage l’index qu’une représentation plus courte. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles ultérieurs. Usages pertinents : recherche image-texte sur COCO ou domaine proche, reclassement ITM, clustering visuel et RAG multimodal auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).