laion/CLIP-ViT-bigG-14-laion2B-39B-b160k

Publié par LAION le 23 janvier 2023, laion/CLIP-ViT-bigG-14-laion2B-39B-b160k est un modèle d’embedding CLIP de 3 milliards de paramètres, tous actifs. Il produit des représentations denses de 1 280 dimensions et associe images et textes dans un même espace vectoriel.

Publié par LAION le 23 janvier 2023, laion/CLIP-ViT-bigG-14-laion2B-39B-b160k est un modèle d’embedding CLIP de 3 milliards de paramètres, tous actifs. Il produit des représentations denses de 1 280 dimensions et associe images et textes dans un même espace vectoriel.

Entraîné avec OpenCLIP sur le sous-ensemble anglais de LAION-5B, puis partiellement affiné sur LAION-A, il cible principalement les usages anglophones. Sa licence MIT ouverte facilite l’auto-hébergement. Il sert à la recherche image-texte, à la classification d’images zero-shot, au clustering et à la récupération sémantique alimentant un système RAG multimodal, sans générer lui-même de contenu.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie23 janvier 2023
Dimension du vecteur1 280
Représentationdense
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only64,0 %5ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English60,0 %4ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual54,2 %9ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite51,3 %14ᵉ / 49mteb✅ Mesuré
MTEB: ViDoRe (V1&V2)36,4 %46ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les meilleurs résultats MTEB placent le modèle dans le top 10 pour les embeddings d’images seules, les tâches image-texte en anglais et l’évaluation image-texte multilingue. Son intérêt principal réside donc dans la recherche croisée entre requêtes textuelles et contenus visuels, ainsi que dans la classification et le regroupement d’images. Il peut aussi servir de base à une sonde linéaire, à un affinage sur des tâches visuelles ou au conditionnement d’un générateur d’images. La licence MIT autorise des déploiements ouverts et auto-hébergés.

Limites et points d’attention. Malgré son classement multilingue favorable, le modèle n’a été ni entraîné ni évalué intentionnellement hors de l’anglais, ce qui impose de limiter son emploi aux cas anglophones. Ses performances sont nettement moins convaincantes sur ViDoRe, consacré à la recherche dans des documents visuels variés, et plus modestes sur le track Image-Text Lite. Les vecteurs de 1 280 dimensions alourdissent les index et le coût de recherche par rapport à des représentations plus compactes. Sorti il y a environ trois ans, il appartient à une génération ancienne, probablement dépassée par des modèles plus récents. Usages pertinents : recherche image-texte anglophone, classification zero-shot, clustering visuel et récupération multimodale pour RAG.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).