Salesforce/blip2-opt-6.7b-coco

Publié par Salesforce le 31 mars 2024, Salesforce/blip2-opt-6.7b-coco est un modèle multimodal de 8 milliards de paramètres, tous actifs. Son Q-Former produit des embeddings de requête de 768 dimensions reliant les représentations visuelles et textuelles. Il associe un encodeur d’images…

Publié par Salesforce le 31 mars 2024, Salesforce/blip2-opt-6.7b-coco est un modèle multimodal de 8 milliards de paramètres, tous actifs. Son Q-Former produit des embeddings de requête de 768 dimensions reliant les représentations visuelles et textuelles. Il associe un encodeur d’images de type CLIP, un Q-Former de type BERT et OPT-6.7b, l’encodeur d’images et OPT restant gelés.

Ces vecteurs servent à la recherche sémantique image-texte, à la récupération de contenus pour un système RAG, à la mesure de similarité et au clustering. Distribué sous licence ouverte MIT, le modèle peut être auto-hébergé et intégré à des applications commerciales.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSalesforce
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie31 mars 2024
Dimension du vecteur768
Représentationembeddings de requête produits par le Q-Former
Paramètres8 milliards
Paramètres actifs8 milliards
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only47,6 %39ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English45,1 %40ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual39,6 %39ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite33,4 %47ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

kakaobrain/align-base51 %
▶ Salesforce/blip2-opt-6.…48 %

MTEB: Image-Text, English

▶ Salesforce/blip2-opt-6.…45 %

Notre analyse

Forces. Le meilleur résultat relatif apparaît sur le track MTEB Image only, qui évalue notamment la récupération, la classification et le clustering à partir d’images. L’architecture relie les espaces visuel et textuel grâce aux jetons de requête transformés par le Q-Former, ce qui convient aux index multimodaux et au rapprochement entre images et textes. Les embeddings de 768 dimensions offrent un format plus compact qu’une représentation de plusieurs milliers de dimensions, avec des index plus légers. La licence MIT facilite par ailleurs l’auto-hébergement, l’adaptation et l’exploitation commerciale.

Limites et points d'attention. Les classements MTEB placent le modèle dans le bas du tableau sur l’ensemble des tracks communiqués. Il arrive dernier sur Image-Text, English, avant-dernier sur Image-Text, Multilingual et près de la fin sur Image-Text, Lite. Même son meilleur track, Image only, reste classé dans la partie basse. Ses 8 milliards de paramètres actifs impliquent en outre un déploiement substantiel malgré des vecteurs de sortie relativement compacts. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles multimodaux plus récents. Usages pertinents : prototypes auto-hébergés de recherche image-texte, clustering visuel et RAG multimodal lorsque la licence MIT prime sur le niveau de performance MTEB.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).