Salesforce/blip2-opt-6.7b-coco
Publié par Salesforce le 31 mars 2024, Salesforce/blip2-opt-6.7b-coco est un modèle multimodal de 8 milliards de paramètres, tous actifs. Son Q-Former produit des embeddings de requête de 768 dimensions reliant les représentations visuelles et textuelles. Il associe un encodeur d’images…
Publié par Salesforce le 31 mars 2024, Salesforce/blip2-opt-6.7b-coco est un modèle multimodal de 8 milliards de paramètres, tous actifs. Son Q-Former produit des embeddings de requête de 768 dimensions reliant les représentations visuelles et textuelles. Il associe un encodeur d’images de type CLIP, un Q-Former de type BERT et OPT-6.7b, l’encodeur d’images et OPT restant gelés.
Ces vecteurs servent à la recherche sémantique image-texte, à la récupération de contenus pour un système RAG, à la mesure de similarité et au clustering. Distribué sous licence ouverte MIT, le modèle peut être auto-hébergé et intégré à des applications commerciales.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Salesforce |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 31 mars 2024 |
| Dimension du vecteur | 768 |
| Représentation | embeddings de requête produits par le Q-Former |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 47,6 % | 39ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 45,1 % | 40ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 39,6 % | 39ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 33,4 % | 47ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur le track MTEB Image only, qui évalue notamment la récupération, la classification et le clustering à partir d’images. L’architecture relie les espaces visuel et textuel grâce aux jetons de requête transformés par le Q-Former, ce qui convient aux index multimodaux et au rapprochement entre images et textes. Les embeddings de 768 dimensions offrent un format plus compact qu’une représentation de plusieurs milliers de dimensions, avec des index plus légers. La licence MIT facilite par ailleurs l’auto-hébergement, l’adaptation et l’exploitation commerciale.
Limites et points d'attention. Les classements MTEB placent le modèle dans le bas du tableau sur l’ensemble des tracks communiqués. Il arrive dernier sur Image-Text, English, avant-dernier sur Image-Text, Multilingual et près de la fin sur Image-Text, Lite. Même son meilleur track, Image only, reste classé dans la partie basse. Ses 8 milliards de paramètres actifs impliquent en outre un déploiement substantiel malgré des vecteurs de sortie relativement compacts. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des modèles multimodaux plus récents. Usages pertinents : prototypes auto-hébergés de recherche image-texte, clustering visuel et RAG multimodal lorsque la licence MIT prime sur le niveau de performance MTEB.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).