laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K
Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K est un modèle CLIP de 150 millions de paramètres fondé sur une architecture ViT-B/16. Il produit des vecteurs denses de 512 dimensions et a été entraîné avec OpenCLIP sur les 1,4…
Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-B-16-DataComp.XL-s13B-b90K est un modèle CLIP de 150 millions de paramètres fondé sur une architecture ViT-B/16. Il produit des vecteurs denses de 512 dimensions et a été entraîné avec OpenCLIP sur les 1,4 milliard d’échantillons de DataComp-1B.
Le modèle rapproche images et textes dans un même espace vectoriel. Il sert à la recherche sémantique image-texte, au retrieval pour des systèmes RAG multimodaux, à la mesure de similarité, au clustering et à la classification d’images zero-shot. Son évaluation couvre notamment l’anglais et 39 langues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 26 avril 2023 |
| Dimension du vecteur | 512 |
| Représentation | dense |
| Paramètres | 150 millions |
| Paramètres actifs | 150 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 59,7 % | 18ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 55,8 % | 17ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 49,6 % | 23ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 46,6 % | 28ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB montrent son meilleur niveau relatif sur les tâches centrées sur l’image, couvrant retrieval, classification et clustering. Le track Image-Text, English reste mieux placé que ses évaluations multilingues allégées, ce qui rend le modèle surtout pertinent pour l’alignement sémantique entre images et textes anglais. Les vecteurs de 512 dimensions offrent un compromis compact pour limiter la taille des index et le coût de la recherche. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration commerciale. Le modèle peut également servir au réglage fin de tâches visuelles, à la classification par sonde linéaire ainsi qu’au guidage ou au conditionnement de générateurs d’images, sans générer lui-même de contenu.
Limites et points d'attention. Les tracks MTEB multilingues sont moins bien classés, particulièrement Image-Text, Lite, tandis que Image-Text, Multilingual se situe dans la seconde moitié de son classement. La qualité hors anglais apparaît donc moins compétitive. Sorti il y a environ trois ans, un âge très long à l’échelle de l’IA, ce modèle appartient à une génération probablement dépassée par des embeddings image-texte plus récents et souvent retirée des catalogues actuels. Usages pertinents : recherche image-texte, indexation visuelle, déduplication sémantique, clustering d’images et RAG multimodal, surtout en anglais.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).