openai/clip-vit-base-patch32

Publié par OpenAI le 26 février 2021, openai/clip-vit-base-patch32 est un modèle d’embedding multimodal de 151 millions de paramètres. Il associe un encodeur d’images ViT-B/32 et un encodeur de texte Transformer pour produire des représentations conjointes de 512 dimensions, comparables…

Publié par OpenAI le 26 février 2021, openai/clip-vit-base-patch32 est un modèle d’embedding multimodal de 151 millions de paramètres. Il associe un encodeur d’images ViT-B/32 et un encodeur de texte Transformer pour produire des représentations conjointes de 512 dimensions, comparables par similarité image-texte.

Le modèle sert à la recherche sémantique entre textes et images, au classement de contenus visuels, au clustering et à la récupération d’éléments dans un système RAG multimodal. Son entraînement linguistique est centré sur l’anglais. Âgé d’environ cinq ans, il appartient à une génération ancienne de modèles CLIP, désormais probablement dépassée par des solutions plus récentes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOpenAI
Poids🟢 Poids ouverts
Date de sortie26 février 2021
Dimension du vecteur512
Représentationreprésentations conjointes d’images et de textes produites par deux encodeurs, avec comparaison par similarité image-texte
Paramètres151 millions
Paramètres actifs151 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only49,0 %36ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English47,0 %35ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual41,4 %37ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite38,6 %43ᵉ / 49mteb✅ Mesuré
MTEB: ViDoRe V32,2 %39ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

kakaobrain/align-base51 %
▶ openai/clip-vit-base-pa…49 %

MTEB: Image-Text, English

▶ openai/clip-vit-base-pa…47 %

Notre analyse

Forces. Son résultat MTEB le plus favorable concerne les embeddings d’images seuls, devant ses évaluations conjointes image-texte. L’entraînement contrastif rapproche les images et leurs descriptions textuelles, ce qui permet de calculer directement des scores de similarité et d’effectuer une classification d’images zero-shot avec des catégories formulées en texte. Les vecteurs de 512 dimensions offrent une représentation relativement compacte, favorable à des index moins lourds que ceux reposant sur des dimensions nettement supérieures.

Limites et points d'attention. Les classements MTEB placent le modèle dans le bas du tableau sur les évaluations Image only et Image-Text. Les performances reculent encore sur les parcours multilingues et allégés. ViDoRe V3 constitue sa faiblesse la plus nette, avec la dernière place en recherche de documents visuels d’entreprise, notamment dans des contenus financiers. Le modèle n’a été spécifiquement entraîné ni évalué dans aucune langue autre que l’anglais, ce qui limite sa pertinence pour les corpus multilingues. Usages pertinents : recherche image-texte en anglais, classification visuelle zero-shot, clustering multimodal et prototypes de RAG visuel ne nécessitant pas les performances des modèles récents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).