laion/CLIP-ViT-L-14-laion2B-s32B-b82K

Publié par laion le 15 septembre 2022, laion/CLIP-ViT-L-14-laion2B-s32B-b82K est un modèle d’embedding multimodal dense de 428 millions de paramètres, tous actifs. Son architecture CLIP ViT-L/14 produit des vecteurs de 768 dimensions associant images et textes. Distribué sous licence…

Publié par laion le 15 septembre 2022, laion/CLIP-ViT-L-14-laion2B-s32B-b82K est un modèle d’embedding multimodal dense de 428 millions de paramètres, tous actifs. Son architecture CLIP ViT-L/14 produit des vecteurs de 768 dimensions associant images et textes. Distribué sous licence ouverte MIT, il peut être auto-hébergé.

Entraîné avec OpenCLIP sur le sous-ensemble anglais de LAION-5B, il cible principalement la classification d’images zero-shot et la recherche image-texte. Ses représentations servent aussi à la recherche sémantique multimodale, au RAG fondé sur des contenus visuels, au calcul de similarité et au clustering. Son usage linguistique de référence reste l’anglais.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie15 septembre 2022
Dimension du vecteur768
Représentationdense multimodale image-texte
Paramètres428 millions
Paramètres actifs428 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only59,9 %15ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English57,2 %15ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual50,6 %19ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite47,6 %25ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les meilleurs résultats MTEB du modèle concernent les tâches centrées sur l’image et l’association image-texte en anglais, avec des classements proches du premier tiers des modèles évalués. Il convient donc surtout au retrieval multimodal, à la classification d’images et au regroupement de contenus visuels selon leur proximité sémantique. Il peut également servir au fine-tuning de tâches d’image, aux sondes linéaires de classification ainsi qu’au guidage ou au conditionnement de génération d’images. La licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales.

Limites et points d'attention. Les performances relatives reculent sur le track MTEB Image-Text, Multilingual et davantage sur Image-Text, Lite, où le modèle se situe en milieu de tableau. Malgré cette évaluation multilingue, l’entraînement a porté spécifiquement sur des données anglaises, ce qui impose de limiter les usages linguistiques de référence à l’anglais. Avec environ quatre ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de 2022 est probablement dépassé par des solutions plus récentes et peut avoir été retiré de certains catalogues. Usages pertinents : recherche image-texte en anglais, classification zero-shot, similarité visuelle, clustering et RAG multimodal auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).