Salesforce/blip2-opt-2.7b
Salesforce/blip2-opt-2.7b est un modèle multimodal d’embedding publié par Salesforce le 22 mars 2024 sous licence ouverte MIT. Ses 4 milliards de paramètres, tous actifs, associent un encodeur d’image de type CLIP, un Q-Former de type BERT et OPT-2.7b, les deux premiers composants…
Salesforce/blip2-opt-2.7b est un modèle multimodal d’embedding publié par Salesforce le 22 mars 2024 sous licence ouverte MIT. Ses 4 milliards de paramètres, tous actifs, associent un encodeur d’image de type CLIP, un Q-Former de type BERT et OPT-2.7b, les deux premiers composants préentraînés externes au Q-Former étant gelés.
Le Q-Former transforme des « query tokens » en vecteurs de 768 dimensions reliant les représentations visuelles et textuelles. Ces embeddings servent à la recherche sémantique image-texte, à la récupération de contenus pour un RAG multimodal, à la mesure de similarité et au clustering. Le modèle a été évalué en anglais ainsi que dans un cadre multilingue couvrant 39 langues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Salesforce |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 22 mars 2024 |
| Dimension du vecteur | 768 |
| Représentation | embeddings de requête produits par le Q-Former à partir de « query tokens » |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 48,5 % | 37ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 45,2 % | 39ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 39,7 % | 38ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 34,6 % | 46ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Le meilleur résultat relatif de Salesforce/blip2-opt-2.7b sur MTEB concerne le track Image only, ce qui en fait surtout un outil d’extraction de représentations visuelles pour la recherche, la classification et le regroupement d’images. Son architecture relie explicitement les espaces de représentation d’un encodeur visuel et d’OPT-2.7b grâce aux embeddings de requête du Q-Former. Les vecteurs de 768 dimensions offrent un format relativement compact pour l’indexation. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.
Limites et points d'attention. Les classements MTEB placent le modèle dans le bas du tableau sur Image only et près des dernières positions sur Image-Text en anglais, en multilingue et dans le track Lite. La couverture multilingue mesurée sur 39 langues ne se traduit donc pas par une forte compétitivité. Les 4 milliards de paramètres actifs alourdissent aussi l’inférence par rapport à des encodeurs plus petits. Sorti en mars 2024, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Usages pertinents : prototypage auto-hébergé de recherche image-texte, indexation visuelle, similarité multimodale et clustering lorsque la licence MIT prime sur les performances de référence.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).