Salesforce/blip-itm-base-flickr

Salesforce/blip-itm-base-flickr est un modèle d’embedding image-texte publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause. Ses 224 millions de paramètres, tous actifs, reposent sur une architecture BLIP avec un backbone ViT base entraîné sur Flickr30k. Il produit des…

Salesforce/blip-itm-base-flickr est un modèle d’embedding image-texte publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause. Ses 224 millions de paramètres, tous actifs, reposent sur une architecture BLIP avec un backbone ViT base entraîné sur Flickr30k. Il produit des représentations denses de 768 dimensions comparables par similarité cosinus.

Le modèle sert à rapprocher images et textes, classer des contenus par similarité, effectuer du clustering et alimenter la recherche sémantique ou la récupération d’un système RAG multimodal. Une tête ITM fournit également des scores d’appariement image-texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSalesforce
Poids🟢 Poids ouverts
LicenceBSD 3-Clause
Date de sortie1 août 2023
Dimension du vecteur768
Représentationdense avec similarité cosinus
Paramètres224 millions
Paramètres actifs224 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only53,6 %32ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English47,3 %34ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual43,0 %34ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite39,9 %40ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

TIGER-Lab/VLM2Vec-LoRA56 %
▶ Salesforce/blip-itm-bas…54 %

MTEB: Image-Text, English

▶ Salesforce/blip-itm-bas…47 %

Notre analyse

Forces. Le meilleur résultat relatif apparaît sur le track MTEB Image only, ce qui fait du traitement et du rapprochement de contenus visuels son domaine le plus favorable parmi les évaluations disponibles. L’architecture BLIP associe une représentation visuelle ViT base à deux modes de comparaison complémentaires : une tête ITM pour l’appariement image-texte et un score cosinus sur les embeddings denses lorsque cette tête est désactivée. La licence BSD 3-Clause autorise une intégration et un auto-hébergement avec peu de contraintes.

Limites et points d'attention. Les classements MTEB restent modestes sur l’ensemble des tracks. Les performances sont plus faibles en Image-Text, English et en Image-Text, Multilingual, tandis que le track Image-Text, Lite constitue son résultat le moins favorable. Sorti en 2023, le modèle est très ancien à l’échelle de l’IA et se compare défavorablement à de nombreuses solutions plus récentes, avec un risque d’être dépassé ou retiré des catalogues actuels. Ses 224 millions de paramètres impliquent aussi davantage de ressources qu’un encodeur plus petit. Usages pertinents : appariement image-texte, recherche visuelle, similarité, clustering et récupération multimodale sur des corpus proches de Flickr30k.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).