laion/CLIP-ViT-B-32-laion2B-s34B-b79K

Publié par laion le 15 septembre 2022, laion/CLIP-ViT-B-32-laion2B-s34B-b79K est un modèle d’embedding CLIP ViT-B/32 de 151 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions représentant conjointement des images et des textes.

Publié par laion le 15 septembre 2022, laion/CLIP-ViT-B-32-laion2B-s34B-b79K est un modèle d’embedding CLIP ViT-B/32 de 151 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions représentant conjointement des images et des textes.

Entraîné avec OpenCLIP sur le sous-ensemble anglais de LAION-5B, il vise principalement les usages anglophones. Il sert à la recherche sémantique entre images et textes, à la classification d’images zero-shot, au clustering et à la récupération de contenus pour des systèmes de RAG multimodaux. Sa licence MIT ouverte autorise des intégrations souples.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie15 septembre 2022
Dimension du vecteur512
Représentationreprésentations d’images et de textes
Paramètres151 millions
Paramètres actifs151 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only55,2 %27ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English50,7 %27ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual45,2 %27ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite42,6 %33ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

TIGER-Lab/VLM2Vec-LoRA56 %
▶ laion/CLIP-ViT-B-32-lai…55 %

MTEB: Image-Text, English

▶ laion/CLIP-ViT-B-32-lai…51 %
kakaobrain/align-base49 %

Notre analyse

Forces. Son meilleur résultat relatif dans MTEB concerne le track Image only, qui couvre notamment la recherche, la classification et le clustering d’images, même si son classement reste éloigné des premières places. L’espace commun aux images et aux textes permet la recherche croisée, par exemple retrouver une image à partir d’une requête textuelle anglophone. Le modèle prend aussi en charge la classification zero-shot, la sonde linéaire, le réglage fin de tâches visuelles ainsi que le guidage et le conditionnement de systèmes de génération d’images. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations plus larges, tandis que la licence MIT facilite l’exploitation et l’adaptation du modèle.

Limites et points d'attention. Les résultats MTEB placent le modèle dans la seconde moitié des classements sur Image only, Image-Text English et Image-Text Multilingual. Le track Image-Text Lite est encore moins favorable. Malgré une évaluation multilingue couvrant plusieurs langues, l’entraînement a porté spécifiquement sur des données anglaises, ce qui conduit à limiter son usage à l’anglais. Sorti en 2022, il appartient à une génération désormais ancienne à l’échelle de l’IA et apparaît probablement dépassé par des modèles plus récents. Usages pertinents : recherche image-texte en anglais, classification visuelle zero-shot, clustering d’images et RAG multimodal lorsque la compacité des vecteurs et la licence MIT sont prioritaires.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).