laion/CLIP-ViT-g-14-laion2B-s34B-b88K
Publié par LAION le 6 mars 2023, laion/CLIP-ViT-g-14-laion2B-s34B-b88K est un modèle d’embedding multimodal sous licence ouverte MIT. Son architecture CLIP ViT-g/14 compte 1 milliard de paramètres actifs et produit des vecteurs de 1 024 dimensions. Entraîné avec OpenCLIP sur le…
Publié par LAION le 6 mars 2023, laion/CLIP-ViT-g-14-laion2B-s34B-b88K est un modèle d’embedding multimodal sous licence ouverte MIT. Son architecture CLIP ViT-g/14 compte 1 milliard de paramètres actifs et produit des vecteurs de 1 024 dimensions. Entraîné avec OpenCLIP sur le sous-ensemble anglais de LAION-5B, il doit être considéré comme anglophone.
Le modèle rapproche images et textes dans un même espace vectoriel. Il sert à la recherche sémantique multimodale, à la recherche d’images par texte, au RAG intégrant des contenus visuels, au calcul de similarité et au clustering. Il prend également en charge la classification d’images zero-shot et l’adaptation à des tâches visuelles.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 6 mars 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | représentations d’images et de textes pour la recherche multimodale |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 61,9 % | 11ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 58,3 % | 12ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 52,4 % | 15ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 49,4 % | 22ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB placent son meilleur profil sur les tâches reposant uniquement sur les images, avec une position proche du premier quart du classement. La piste Image-Text en anglais reste également bien classée, ce qui correspond à sa spécialisation dans l’association sémantique entre descriptions anglaises et contenus visuels. Il convient ainsi au retrieval multimodal, à la classification d’images zero-shot et à la classification par sonde linéaire. Sa licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales. Il peut aussi assurer le guidage ou le conditionnement de systèmes de génération d’images, sans générer lui-même de contenu.
Limites et points d'attention. La piste MTEB Image-Text Multilingual se situe derrière les évaluations centrées sur l’anglais, tandis que la piste Lite atteint seulement le milieu du classement. Malgré cette évaluation multilingue, l’entraînement n’a ciblé que l’anglais et l’usage doit rester limité à cette langue. Les vecteurs de 1 024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Sorti il y a environ trois ans, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des solutions plus récentes. Usages pertinents : recherche image-texte en anglais, catalogues visuels, déduplication, clustering d’images et RAG multimodal anglophone.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).