Salesforce/blip-image-captioning-large
Salesforce/blip-image-captioning-large est un modèle d’embedding vision-langage publié par Salesforce le 7 décembre 2023. Ses 446 millions de paramètres, tous actifs, produisent une représentation dense de 768 dimensions. Distribué sous licence ouverte BSD 3-Clause, il peut être…
Salesforce/blip-image-captioning-large est un modèle d’embedding vision-langage publié par Salesforce le 7 décembre 2023. Ses 446 millions de paramètres, tous actifs, produisent une représentation dense de 768 dimensions. Distribué sous licence ouverte BSD 3-Clause, il peut être auto-hébergé et intégré à des systèmes indépendants.
Le modèle associe contenus visuels et textuels dans un espace vectoriel exploitable pour la recherche sémantique image-texte, la récupération de documents dans un pipeline RAG, la mesure de similarité et le clustering. Son architecture repose sur un backbone ViT large et sur un pré-entraînement vision-langage lié au jeu de données COCO.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Salesforce |
| Poids | 🟢 Poids ouverts |
| Licence | BSD 3-Clause |
| Date de sortie | 7 décembre 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 446 millions |
| Paramètres actifs | 446 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image-Text, Lite | 31,1 % | 48ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image-Text, Lite
Notre analyse
Forces. L’intérêt de Salesforce/blip-image-captioning-large réside dans sa spécialisation image-texte, adaptée au rapprochement vectoriel entre images et descriptions. Le cadre BLIP emploie des légendes synthétiques produites puis filtrées afin d’améliorer les données de pré-entraînement. Son architecture est conçue pour le transfert vers différentes tâches de compréhension vision-langage. La représentation dense de 768 dimensions fournit un format directement exploitable par un index vectoriel. La licence BSD 3-Clause constitue également un atout pratique pour l’auto-hébergement, la modification et l’intégration dans des applications commerciales.
Limites et points d'attention. Sur MTEB Image-Text, Lite, le modèle se situe presque au dernier rang, ce qui indique une faible compétitivité en embedding image-texte multilingue face aux modèles évalués. Ses 446 millions de paramètres actifs imposent par ailleurs une empreinte d’exécution non négligeable, tandis que les vecteurs de 768 dimensions déterminent le volume de stockage de l’index et le coût des recherches de similarité. Son ancienneté d’environ trois ans est très importante à l’échelle de l’IA, ce qui le rend probablement dépassé par des solutions plus récentes et comparable à des modèles désormais souvent retirés des catalogues. Usages pertinents : prototypes auto-hébergés de recherche image-texte, de similarité et de clustering lorsque la licence ouverte prime sur les performances de classement.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).