laion/CLIP-ViT-L-14-laion2B-s32B-b82K
Publié par laion le 15 septembre 2022, laion/CLIP-ViT-L-14-laion2B-s32B-b82K est un modèle d’embedding multimodal dense de 428 millions de paramètres, tous actifs. Son architecture CLIP ViT-L/14 produit des vecteurs de 768 dimensions associant images et textes. Distribué sous licence…
Publié par laion le 15 septembre 2022, laion/CLIP-ViT-L-14-laion2B-s32B-b82K est un modèle d’embedding multimodal dense de 428 millions de paramètres, tous actifs. Son architecture CLIP ViT-L/14 produit des vecteurs de 768 dimensions associant images et textes. Distribué sous licence ouverte MIT, il peut être auto-hébergé.
Entraîné avec OpenCLIP sur le sous-ensemble anglais de LAION-5B, il cible principalement la classification d’images zero-shot et la recherche image-texte. Ses représentations servent aussi à la recherche sémantique multimodale, au RAG fondé sur des contenus visuels, au calcul de similarité et au clustering. Son usage linguistique de référence reste l’anglais.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 15 septembre 2022 |
| Dimension du vecteur | 768 |
| Représentation | dense multimodale image-texte |
| Paramètres | 428 millions |
| Paramètres actifs | 428 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 59,9 % | 15ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 57,2 % | 15ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 50,6 % | 19ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 47,6 % | 25ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les meilleurs résultats MTEB du modèle concernent les tâches centrées sur l’image et l’association image-texte en anglais, avec des classements proches du premier tiers des modèles évalués. Il convient donc surtout au retrieval multimodal, à la classification d’images et au regroupement de contenus visuels selon leur proximité sémantique. Il peut également servir au fine-tuning de tâches d’image, aux sondes linéaires de classification ainsi qu’au guidage ou au conditionnement de génération d’images. La licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales.
Limites et points d'attention. Les performances relatives reculent sur le track MTEB Image-Text, Multilingual et davantage sur Image-Text, Lite, où le modèle se situe en milieu de tableau. Malgré cette évaluation multilingue, l’entraînement a porté spécifiquement sur des données anglaises, ce qui impose de limiter les usages linguistiques de référence à l’anglais. Avec environ quatre ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de 2022 est probablement dépassé par des solutions plus récentes et peut avoir été retiré de certains catalogues. Usages pertinents : recherche image-texte en anglais, classification zero-shot, similarité visuelle, clustering et RAG multimodal auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).