laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K

Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K est un modèle d’embedding CLIP de 428 millions de paramètres actifs. Fondé sur l’architecture ViT-L/14 et entraîné avec OpenCLIP sur DataComp-1B, il produit des représentations denses de…

Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K est un modèle d’embedding CLIP de 428 millions de paramètres actifs. Fondé sur l’architecture ViT-L/14 et entraîné avec OpenCLIP sur DataComp-1B, il produit des représentations denses de 768 dimensions.

Le modèle rapproche images et textes dans un même espace vectoriel. Il sert à la recherche sémantique multimodale, au retrieval pour le RAG, à la mesure de similarité, au clustering et à la classification d’images zero-shot. Il peut également être adapté à des tâches d’image ou servir au conditionnement d’une génération d’images.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie26 avril 2023
Dimension du vecteur768
Représentationdense
Paramètres428 millions
Paramètres actifs428 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only63,6 %6ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English59,4 %7ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual53,4 %12ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite50,4 %18ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent le modèle dans le top 10 sur les évaluations Image only et Image-Text, English. Son principal point fort réside donc dans la représentation d’images et dans l’association entre images et requêtes textuelles en anglais, pour la recherche, la classification et le clustering. Le track Image-Text, Multilingual montre aussi une capacité exploitable sur 39 langues, même si elle est moins bien classée. La licence MIT autorise l’auto-hébergement et l’adaptation, tandis que les vecteurs denses de 768 dimensions offrent un format directement exploitable dans un index vectoriel.

Limites et points d'attention. Les performances relatives reculent sur les tracks Image-Text, Multilingual et surtout Image-Text, Lite, où le modèle se situe davantage dans le milieu du classement. Avec 428 millions de paramètres, son déploiement reste plus exigeant que celui d’un encodeur plus petit, et chaque vecteur de 768 dimensions entraîne un coût de stockage et de recherche à prendre en compte à grande échelle. Sorti en 2023, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré des catalogues actuels. Usages pertinents : recherche image-texte, classification zero-shot, clustering visuel et RAG multimodal, notamment en anglais.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).