laion/CLIP-ViT-H-14-laion2B-s32B-b79K

Publié par LAION le 15 septembre 2022 sous licence ouverte MIT, laion/CLIP-ViT-H-14-laion2B-s32B-b79K est un modèle d’embedding CLIP fondé sur une architecture ViT-H/14. Ses 986 millions de paramètres produisent des vecteurs de 1 024 dimensions représentant conjointement des images et…

Publié par LAION le 15 septembre 2022 sous licence ouverte MIT, laion/CLIP-ViT-H-14-laion2B-s32B-b79K est un modèle d’embedding CLIP fondé sur une architecture ViT-H/14. Ses 986 millions de paramètres produisent des vecteurs de 1 024 dimensions représentant conjointement des images et des textes.

Entraîné avec OpenCLIP sur le sous-ensemble anglais de LAION-5B, il sert à la recherche sémantique image-texte, à la classification d’images zero-shot, au clustering et à l’indexation multimodale pour le RAG. Il ne génère pas de texte, son rôle consiste à rapprocher des contenus selon leur similarité vectorielle.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie15 septembre 2022
Dimension du vecteur1 024
Représentationreprésentations d’images et de textes pour la recherche image-texte
Paramètres986 millions
Paramètres actifs986 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only61,9 %10ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English58,4 %11ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual52,7 %14ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite50,0 %19ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat relatif du modèle dans MTEB concerne les représentations d’images seules, où il figure dans le top 10. Il reste également bien placé sur les évaluations image-texte en anglais, ce qui correspond directement à son entraînement anglophone et à sa fonction de recherche croisée entre descriptions et images. Son espace commun permet aussi la classification zero-shot et le regroupement de contenus visuellement ou sémantiquement proches. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires ou ouverts.

Limites et points d’attention. Les résultats MTEB sont moins favorables sur le track multilingue et reculent encore sur Image-Text, Lite. Les usages doivent donc rester centrés sur l’anglais, les autres langues n’ayant pas été spécifiquement employées pour l’entraînement ou l’évaluation. Les vecteurs de 1 024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations de dimension inférieure, tandis que les 986 millions de paramètres imposent un modèle relativement volumineux. Sorti en 2022, il est très ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents, voire retiré de certains catalogues. Usages pertinents : recherche image-texte anglophone, classification zero-shot, clustering visuel et RAG multimodal auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).