Salesforce/blip-itm-large-flickr
Publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause, Salesforce/blip-itm-large-flickr est un modèle d’embedding vision-langage de 446 millions de paramètres actifs. Son architecture large repose sur un backbone ViT large et produit des représentations image-texte de…
Publié par Salesforce le 1er août 2023 sous licence ouverte BSD 3-Clause, Salesforce/blip-itm-large-flickr est un modèle d’embedding vision-langage de 446 millions de paramètres actifs. Son architecture large repose sur un backbone ViT large et produit des représentations image-texte de 768 dimensions, comparables par similarité cosinus.
Entraîné sur Flickr30k pour l’appariement image-texte, il sert à la recherche sémantique multimodale, à la récupération d’images pour un pipeline RAG, au classement par similarité et au clustering. BlipForImageTextRetrieval peut aussi calculer un score d’appariement au moyen d’une tête ITM.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Salesforce |
| Poids | 🟢 Poids ouverts |
| Licence | BSD 3-Clause |
| Date de sortie | 1 août 2023 |
| Dimension du vecteur | 768 |
| Représentation | représentation image-texte avec score cosinus |
| Paramètres | 446 millions |
| Paramètres actifs | 446 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 54,5 % | 29ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 49,5 % | 30ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 44,4 % | 30ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 40,5 % | 39ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Son meilleur résultat MTEB concerne le track Image only, ce qui en fait surtout un outil de représentation et de rapprochement d’images. Les évaluations Image-Text couvrent également l’anglais et 39 langues, avec une qualité permettant d’envisager la recherche croisée entre requêtes textuelles et contenus visuels. La sortie de 768 dimensions offre un format courant pour construire des index vectoriels, tandis que le score cosinus facilite le classement par proximité. La licence BSD 3-Clause autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Les classements MTEB restent dans la seconde moitié des modèles évalués sur Image only, Image-Text English et Image-Text Multilingual. Le track Image-Text Lite est le plus faible relativement, avec un rang proche du bas du classement. Les 446 millions de paramètres imposent par ailleurs une infrastructure plus lourde que celle d’encodeurs plus petits, et les vecteurs de 768 dimensions augmentent le stockage ainsi que le calcul de similarité par rapport à des représentations plus courtes. Sorti en 2023, ce modèle est ancien à l’échelle de l’IA et probablement dépassé par des solutions plus récentes. Usages pertinents : recherche image-texte, RAG multimodal, déduplication visuelle et clustering d’images sur des corpus proches de Flickr30k.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).