laion/CLIP-ViT-g-14-laion2B-s34B-b88K

Publié par LAION le 6 mars 2023, laion/CLIP-ViT-g-14-laion2B-s34B-b88K est un modèle d’embedding multimodal sous licence ouverte MIT. Son architecture CLIP ViT-g/14 compte 1 milliard de paramètres actifs et produit des vecteurs de 1 024 dimensions. Entraîné avec OpenCLIP sur le…

Publié par LAION le 6 mars 2023, laion/CLIP-ViT-g-14-laion2B-s34B-b88K est un modèle d’embedding multimodal sous licence ouverte MIT. Son architecture CLIP ViT-g/14 compte 1 milliard de paramètres actifs et produit des vecteurs de 1 024 dimensions. Entraîné avec OpenCLIP sur le sous-ensemble anglais de LAION-5B, il doit être considéré comme anglophone.

Le modèle rapproche images et textes dans un même espace vectoriel. Il sert à la recherche sémantique multimodale, à la recherche d’images par texte, au RAG intégrant des contenus visuels, au calcul de similarité et au clustering. Il prend également en charge la classification d’images zero-shot et l’adaptation à des tâches visuelles.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie6 mars 2023
Dimension du vecteur1 024
Représentationreprésentations d’images et de textes pour la recherche multimodale
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only61,9 %11ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English58,3 %12ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual52,4 %15ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite49,4 %22ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent son meilleur profil sur les tâches reposant uniquement sur les images, avec une position proche du premier quart du classement. La piste Image-Text en anglais reste également bien classée, ce qui correspond à sa spécialisation dans l’association sémantique entre descriptions anglaises et contenus visuels. Il convient ainsi au retrieval multimodal, à la classification d’images zero-shot et à la classification par sonde linéaire. Sa licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales. Il peut aussi assurer le guidage ou le conditionnement de systèmes de génération d’images, sans générer lui-même de contenu.

Limites et points d'attention. La piste MTEB Image-Text Multilingual se situe derrière les évaluations centrées sur l’anglais, tandis que la piste Lite atteint seulement le milieu du classement. Malgré cette évaluation multilingue, l’entraînement n’a ciblé que l’anglais et l’usage doit rester limité à cette langue. Les vecteurs de 1 024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Sorti il y a environ trois ans, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des solutions plus récentes. Usages pertinents : recherche image-texte en anglais, catalogues visuels, déduplication, clustering d’images et RAG multimodal anglophone.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).