laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K
Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K est un modèle d’embedding CLIP de 428 millions de paramètres actifs. Fondé sur l’architecture ViT-L/14 et entraîné avec OpenCLIP sur DataComp-1B, il produit des représentations denses de…
Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-L-14-DataComp.XL-s13B-b90K est un modèle d’embedding CLIP de 428 millions de paramètres actifs. Fondé sur l’architecture ViT-L/14 et entraîné avec OpenCLIP sur DataComp-1B, il produit des représentations denses de 768 dimensions.
Le modèle rapproche images et textes dans un même espace vectoriel. Il sert à la recherche sémantique multimodale, au retrieval pour le RAG, à la mesure de similarité, au clustering et à la classification d’images zero-shot. Il peut également être adapté à des tâches d’image ou servir au conditionnement d’une génération d’images.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 26 avril 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 428 millions |
| Paramètres actifs | 428 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 63,6 % | 6ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 59,4 % | 7ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 53,4 % | 12ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 50,4 % | 18ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB placent le modèle dans le top 10 sur les évaluations Image only et Image-Text, English. Son principal point fort réside donc dans la représentation d’images et dans l’association entre images et requêtes textuelles en anglais, pour la recherche, la classification et le clustering. Le track Image-Text, Multilingual montre aussi une capacité exploitable sur 39 langues, même si elle est moins bien classée. La licence MIT autorise l’auto-hébergement et l’adaptation, tandis que les vecteurs denses de 768 dimensions offrent un format directement exploitable dans un index vectoriel.
Limites et points d'attention. Les performances relatives reculent sur les tracks Image-Text, Multilingual et surtout Image-Text, Lite, où le modèle se situe davantage dans le milieu du classement. Avec 428 millions de paramètres, son déploiement reste plus exigeant que celui d’un encodeur plus petit, et chaque vecteur de 768 dimensions entraîne un coût de stockage et de recherche à prendre en compte à grande échelle. Sorti en 2023, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré des catalogues actuels. Usages pertinents : recherche image-texte, classification zero-shot, clustering visuel et RAG multimodal, notamment en anglais.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).