laion/CLIP-ViT-B-32-laion2B-s34B-b79K
Publié par laion le 15 septembre 2022, laion/CLIP-ViT-B-32-laion2B-s34B-b79K est un modèle d’embedding CLIP ViT-B/32 de 151 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions représentant conjointement des images et des textes.
Publié par laion le 15 septembre 2022, laion/CLIP-ViT-B-32-laion2B-s34B-b79K est un modèle d’embedding CLIP ViT-B/32 de 151 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions représentant conjointement des images et des textes.
Entraîné avec OpenCLIP sur le sous-ensemble anglais de LAION-5B, il vise principalement les usages anglophones. Il sert à la recherche sémantique entre images et textes, à la classification d’images zero-shot, au clustering et à la récupération de contenus pour des systèmes de RAG multimodaux. Sa licence MIT ouverte autorise des intégrations souples.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 15 septembre 2022 |
| Dimension du vecteur | 512 |
| Représentation | représentations d’images et de textes |
| Paramètres | 151 millions |
| Paramètres actifs | 151 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 55,2 % | 27ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 50,7 % | 27ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 45,2 % | 27ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 42,6 % | 33ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Son meilleur résultat relatif dans MTEB concerne le track Image only, qui couvre notamment la recherche, la classification et le clustering d’images, même si son classement reste éloigné des premières places. L’espace commun aux images et aux textes permet la recherche croisée, par exemple retrouver une image à partir d’une requête textuelle anglophone. Le modèle prend aussi en charge la classification zero-shot, la sonde linéaire, le réglage fin de tâches visuelles ainsi que le guidage et le conditionnement de systèmes de génération d’images. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations plus larges, tandis que la licence MIT facilite l’exploitation et l’adaptation du modèle.
Limites et points d'attention. Les résultats MTEB placent le modèle dans la seconde moitié des classements sur Image only, Image-Text English et Image-Text Multilingual. Le track Image-Text Lite est encore moins favorable. Malgré une évaluation multilingue couvrant plusieurs langues, l’entraînement a porté spécifiquement sur des données anglaises, ce qui conduit à limiter son usage à l’anglais. Sorti en 2022, il appartient à une génération désormais ancienne à l’échelle de l’IA et apparaît probablement dépassé par des modèles plus récents. Usages pertinents : recherche image-texte en anglais, classification visuelle zero-shot, clustering d’images et RAG multimodal lorsque la compacité des vecteurs et la licence MIT sont prioritaires.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).