Salesforce/blip-itm-base-flickr
Salesforce/blip-itm-base-flickr est un modèle d’embedding image-texte publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause. Ses 224 millions de paramètres, tous actifs, reposent sur une architecture BLIP avec un backbone ViT base entraîné sur Flickr30k. Il produit des…
Salesforce/blip-itm-base-flickr est un modèle d’embedding image-texte publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause. Ses 224 millions de paramètres, tous actifs, reposent sur une architecture BLIP avec un backbone ViT base entraîné sur Flickr30k. Il produit des représentations denses de 768 dimensions comparables par similarité cosinus.
Le modèle sert à rapprocher images et textes, classer des contenus par similarité, effectuer du clustering et alimenter la recherche sémantique ou la récupération d’un système RAG multimodal. Une tête ITM fournit également des scores d’appariement image-texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Salesforce |
| Poids | 🟢 Poids ouverts |
| Licence | BSD 3-Clause |
| Date de sortie | 1 août 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense avec similarité cosinus |
| Paramètres | 224 millions |
| Paramètres actifs | 224 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 53,6 % | 32ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 47,3 % | 34ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 43,0 % | 34ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 39,9 % | 40ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur le track MTEB Image only, ce qui fait du traitement et du rapprochement de contenus visuels son domaine le plus favorable parmi les évaluations disponibles. L’architecture BLIP associe une représentation visuelle ViT base à deux modes de comparaison complémentaires : une tête ITM pour l’appariement image-texte et un score cosinus sur les embeddings denses lorsque cette tête est désactivée. La licence BSD 3-Clause autorise une intégration et un auto-hébergement avec peu de contraintes.
Limites et points d'attention. Les classements MTEB restent modestes sur l’ensemble des tracks. Les performances sont plus faibles en Image-Text, English et en Image-Text, Multilingual, tandis que le track Image-Text, Lite constitue son résultat le moins favorable. Sorti en 2023, le modèle est très ancien à l’échelle de l’IA et se compare défavorablement à de nombreuses solutions plus récentes, avec un risque d’être dépassé ou retiré des catalogues actuels. Ses 224 millions de paramètres impliquent aussi davantage de ressources qu’un encodeur plus petit. Usages pertinents : appariement image-texte, recherche visuelle, similarité, clustering et récupération multimodale sur des corpus proches de Flickr30k.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).