Salesforce/blip-image-captioning-base

Salesforce/blip-image-captioning-base est un modèle d’embedding vision-langage de Salesforce, publié le 1er août 2023 sous licence ouverte BSD 3-Clause. Il compte 225 millions de paramètres, tous actifs, et produit des représentations denses de 768 dimensions.

Salesforce/blip-image-captioning-base est un modèle d’embedding vision-langage de Salesforce, publié le 1er août 2023 sous licence ouverte BSD 3-Clause. Il compte 225 millions de paramètres, tous actifs, et produit des représentations denses de 768 dimensions.

Fondé sur un backbone ViT base et préentraîné sur COCO, il associe images et textes dans un espace numérique exploitable pour la recherche sémantique multimodale, la similarité, le clustering et la récupération d’images dans un système RAG. Son architecture BLIP provient toutefois d’un modèle également conçu pour la compréhension et le légendage d’images.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSalesforce
Poids🟢 Poids ouverts
LicenceBSD 3-Clause
Date de sortie1 août 2023
Dimension du vecteur768
Représentationdense
Paramètres225 millions
Paramètres actifs225 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image-Text, Lite27,6 %49ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image-Text, Lite

▶ Salesforce/blip-image-c…28 %

Notre analyse

Forces. Salesforce/blip-image-captioning-base apporte une représentation dense commune aux images et aux textes, utile pour rapprocher une requête textuelle de contenus visuels ou regrouper des éléments similaires. Ses 768 dimensions offrent un format d’indexation courant, tandis que ses 225 millions de paramètres restent compatibles avec une exécution sur CPU ou GPU. La prise en charge de la pleine précision et du float16 facilite différents compromis de déploiement. La licence BSD 3-Clause autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Sur le track MTEB Image-Text, Lite, le modèle occupe la dernière place du classement considéré, ce qui signale une qualité d’embedding multilingue image-texte faible face aux autres modèles évalués. Sa dimension de 768 implique aussi des index plus volumineux et une recherche plus coûteuse que pour des représentations plus petites. Avec environ trois ans d’ancienneté, il appartient à une génération désormais très ancienne à l’échelle de l’IA, probablement dépassée par des solutions plus récentes et souvent retirée des catalogues actuels. Usages pertinents : prototypes multimodaux, index image-texte auto-hébergés et systèmes existants nécessitant la compatibilité avec BLIP.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).