laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90K
Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90K est un modèle d’embedding multimodal de 151 millions de paramètres actifs. Son architecture CLIP ViT-B/32 produit des vecteurs de 512 dimensions représentant conjointement images et…
Publié par laion le 26 avril 2023 sous licence ouverte MIT, laion/CLIP-ViT-B-32-DataComp.XL-s13B-b90K est un modèle d’embedding multimodal de 151 millions de paramètres actifs. Son architecture CLIP ViT-B/32 produit des vecteurs de 512 dimensions représentant conjointement images et textes.
Entraîné avec OpenCLIP sur les 1,4 milliard d’échantillons non filtrés de DataComp-1B, il sert à la recherche sémantique image-texte, au RAG multimodal, au calcul de similarité et au clustering. Il prend aussi en charge la classification d’images zero-shot et les sondes linéaires de classification.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 26 avril 2023 |
| Dimension du vecteur | 512 |
| Représentation | représentations d’images et de textes pour la recherche multimodale |
| Paramètres | 151 millions |
| Paramètres actifs | 151 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 53,9 % | 31ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 49,9 % | 28ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 44,3 % | 31ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 41,5 % | 36ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Son meilleur résultat MTEB concerne les embeddings d’images seuls, évalués sur des tâches de retrieval, de classification et de clustering. Le modèle rapproche également textes et images en anglais, tout en couvrant des évaluations multilingues réparties sur 39 langues. Ses vecteurs de 512 dimensions offrent une représentation relativement compacte, favorable à des index plus légers qu’avec des dimensions nettement supérieures. La licence MIT facilite l’auto-hébergement, l’adaptation à des tâches d’image et l’intégration dans des systèmes commerciaux. Il peut aussi servir au guidage ou au conditionnement d’un générateur d’images, sans produire lui-même de contenu.
Limites et points d’attention. Les classements MTEB restent modestes sur l’ensemble des tracks disponibles. Le modèle se situe dans la partie basse des évaluations Image only et Image-Text English, et recule davantage sur Image-Text Multilingual ainsi que sur Image-Text Lite. La qualité multilingue apparaît donc moins convaincante que la prise en charge nominale de plusieurs langues. Sorti il y a environ trois ans, un âge très long à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : recherche image-texte, classement zero-shot, clustering visuel et RAG multimodal lorsque la licence ouverte et des vecteurs compacts priment sur les performances récentes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).