openai/clip-vit-base-patch16

Publié par OpenAI le 26 février 2021, openai/clip-vit-base-patch16 est un modèle d’embedding multimodal de 150 millions de paramètres actifs. Il associe un encodeur d’images ViT-B/16 à un encodeur de texte Transformer et produit des vecteurs de 512 dimensions, conçus pour mesurer la…

Publié par OpenAI le 26 février 2021, openai/clip-vit-base-patch16 est un modèle d’embedding multimodal de 150 millions de paramètres actifs. Il associe un encodeur d’images ViT-B/16 à un encodeur de texte Transformer et produit des vecteurs de 512 dimensions, conçus pour mesurer la similarité entre images et textes.

Son entraînement contrastif rapproche les représentations des paires image-texte, notamment pour la classification d’images en zero-shot. Il peut servir à la recherche sémantique multimodale, à la récupération de contenus pour un RAG visuel, au classement par similarité et au clustering. Son entraînement et son évaluation d’origine sont exclusivement anglophones.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOpenAI
Poids🟢 Poids ouverts
Date de sortie26 février 2021
Dimension du vecteur512
Représentationreprésentations d’images et de textes avec calcul de similarité image-texte
Paramètres150 millions
Paramètres actifs150 millions
Longueur de séquence max77 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image only55,1 %28ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, English51,8 %25ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual46,2 %25ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite43,5 %32ᵉ / 49mteb✅ Mesuré
MTEB: ViDoRe (V1&V2)21,4 %47ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V34,4 %38ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image only

TIGER-Lab/VLM2Vec-LoRA56 %
▶ openai/clip-vit-base-pa…55 %

MTEB: Image-Text, English

TIGER-Lab/VLM2Vec-LoRA53 %
▶ openai/clip-vit-base-pa…52 %

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent les embeddings d’images seuls et les tâches image-texte en anglais, couvrant notamment la recherche, la classification et le clustering. Cette spécialisation rend le modèle pertinent pour rapprocher une requête textuelle anglaise d’un catalogue d’images ou regrouper des contenus visuels selon leur sens. Les vecteurs de 512 dimensions permettent aussi de contenir la taille de l’index et le coût de comparaison par rapport à des représentations de plus grande dimension.

Limites et points d’attention. Les classements MTEB placent néanmoins le modèle dans la seconde moitié des participants sur ses principaux tracks image et image-texte. Les performances multilingues restent modestes, ce qui concorde avec un entraînement volontairement limité à l’anglais. Les résultats deviennent particulièrement faibles sur ViDoRe, consacré à la recherche dans des documents visuels variés, puis sur ViDoRe V3 et ses documents multimodaux d’entreprise. Sorti en 2021, ce modèle est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche image-texte en anglais, similarité visuelle, classification zero-shot et clustering d’images dans des systèmes existants.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).