laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K

Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K est un modèle CLIP de 150 millions de paramètres fondé sur une architecture ViT-B/16. Il produit des vecteurs denses de 512 dimensions et a été entraîné avec OpenCLIP sur les 1,4…

Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K est un modèle CLIP de 150 millions de paramètres fondé sur une architecture ViT-B/16. Il produit des vecteurs denses de 512 dimensions et a été entraîné avec OpenCLIP sur les 1,4 milliard d’échantillons de DataComp-1B.

Le modèle rapproche images et textes dans un même espace vectoriel. Il sert à la recherche sémantique image-texte, au retrieval pour des systèmes RAG multimodaux, à la mesure de similarité, au clustering et à la classification d’images zero-shot. Son évaluation couvre notamment l’anglais et 39 langues.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie26 avril 2023
Dimension du vecteur512
Représentationdense
Paramètres150 millions
Paramètres actifs150 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only59,7 %18ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English55,8 %17ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual49,6 %23ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite46,6 %28ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB montrent son meilleur niveau relatif sur les tâches centrées sur l’image, couvrant retrieval, classification et clustering. Le track Image-Text, English reste mieux placé que ses évaluations multilingues allégées, ce qui rend le modèle surtout pertinent pour l’alignement sémantique entre images et textes anglais. Les vecteurs de 512 dimensions offrent un compromis compact pour limiter la taille des index et le coût de la recherche. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration commerciale. Le modèle peut également servir au réglage fin de tâches visuelles, à la classification par sonde linéaire ainsi qu’au guidage ou au conditionnement de générateurs d’images, sans générer lui-même de contenu.

Limites et points d'attention. Les tracks MTEB multilingues sont moins bien classés, particulièrement Image-Text, Lite, tandis que Image-Text, Multilingual se situe dans la seconde moitié de son classement. La qualité hors anglais apparaît donc moins compétitive. Sorti il y a environ trois ans, un âge très long à l’échelle de l’IA, ce modèle appartient à une génération probablement dépassée par des embeddings image-texte plus récents et souvent retirée des catalogues actuels. Usages pertinents : recherche image-texte, indexation visuelle, déduplication sémantique, clustering d’images et RAG multimodal, surtout en anglais.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).