Salesforce/blip2-opt-2.7b

Salesforce/blip2-opt-2.7b est un modèle multimodal d’embedding publié par Salesforce le 22 mars 2024 sous licence ouverte MIT. Ses 4 milliards de paramètres, tous actifs, associent un encodeur d’image de type CLIP, un Q-Former de type BERT et OPT-2.7b, les deux premiers composants…

Salesforce/blip2-opt-2.7b est un modèle multimodal d’embedding publié par Salesforce le 22 mars 2024 sous licence ouverte MIT. Ses 4 milliards de paramètres, tous actifs, associent un encodeur d’image de type CLIP, un Q-Former de type BERT et OPT-2.7b, les deux premiers composants préentraînés externes au Q-Former étant gelés.

Le Q-Former transforme des « query tokens » en vecteurs de 768 dimensions reliant les représentations visuelles et textuelles. Ces embeddings servent à la recherche sémantique image-texte, à la récupération de contenus pour un RAG multimodal, à la mesure de similarité et au clustering. Le modèle a été évalué en anglais ainsi que dans un cadre multilingue couvrant 39 langues.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSalesforce
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie22 mars 2024
Dimension du vecteur768
Représentationembeddings de requête produits par le Q-Former à partir de « query tokens »
Paramètres4 milliards
Paramètres actifs4 milliards
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only48,5 %37ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English45,2 %39ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual39,7 %38ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite34,6 %46ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

kakaobrain/align-base51 %
▶ Salesforce/blip2-opt-2.…49 %

MTEB: Image-Text, English

▶ Salesforce/blip2-opt-2.…45 %

Notre analyse

Forces. Le meilleur résultat relatif de Salesforce/blip2-opt-2.7b sur MTEB concerne le track Image only, ce qui en fait surtout un outil d’extraction de représentations visuelles pour la recherche, la classification et le regroupement d’images. Son architecture relie explicitement les espaces de représentation d’un encodeur visuel et d’OPT-2.7b grâce aux embeddings de requête du Q-Former. Les vecteurs de 768 dimensions offrent un format relativement compact pour l’indexation. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d'attention. Les classements MTEB placent le modèle dans le bas du tableau sur Image only et près des dernières positions sur Image-Text en anglais, en multilingue et dans le track Lite. La couverture multilingue mesurée sur 39 langues ne se traduit donc pas par une forte compétitivité. Les 4 milliards de paramètres actifs alourdissent aussi l’inférence par rapport à des encodeurs plus petits. Sorti en mars 2024, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Usages pertinents : prototypage auto-hébergé de recherche image-texte, indexation visuelle, similarité multimodale et clustering lorsque la licence MIT prime sur les performances de référence.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).