openai/clip-vit-base-patch16
Publié par OpenAI le 26 février 2021, openai/clip-vit-base-patch16 est un modèle d’embedding multimodal de 150 millions de paramètres actifs. Il associe un encodeur d’images ViT-B/16 à un encodeur de texte Transformer et produit des vecteurs de 512 dimensions, conçus pour mesurer la…
Publié par OpenAI le 26 février 2021, openai/clip-vit-base-patch16 est un modèle d’embedding multimodal de 150 millions de paramètres actifs. Il associe un encodeur d’images ViT-B/16 à un encodeur de texte Transformer et produit des vecteurs de 512 dimensions, conçus pour mesurer la similarité entre images et textes.
Son entraînement contrastif rapproche les représentations des paires image-texte, notamment pour la classification d’images en zero-shot. Il peut servir à la recherche sémantique multimodale, à la récupération de contenus pour un RAG visuel, au classement par similarité et au clustering. Son entraînement et son évaluation d’origine sont exclusivement anglophones.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | OpenAI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 26 février 2021 |
| Dimension du vecteur | 512 |
| Représentation | représentations d’images et de textes avec calcul de similarité image-texte |
| Paramètres | 150 millions |
| Paramètres actifs | 150 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 55,1 % | 28ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 51,8 % | 25ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 46,2 % | 25ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 43,5 % | 32ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: ViDoRe (V1&V2) | 21,4 % | 47ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 4,4 % | 38ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent les embeddings d’images seuls et les tâches image-texte en anglais, couvrant notamment la recherche, la classification et le clustering. Cette spécialisation rend le modèle pertinent pour rapprocher une requête textuelle anglaise d’un catalogue d’images ou regrouper des contenus visuels selon leur sens. Les vecteurs de 512 dimensions permettent aussi de contenir la taille de l’index et le coût de comparaison par rapport à des représentations de plus grande dimension.
Limites et points d’attention. Les classements MTEB placent néanmoins le modèle dans la seconde moitié des participants sur ses principaux tracks image et image-texte. Les performances multilingues restent modestes, ce qui concorde avec un entraînement volontairement limité à l’anglais. Les résultats deviennent particulièrement faibles sur ViDoRe, consacré à la recherche dans des documents visuels variés, puis sur ViDoRe V3 et ses documents multimodaux d’entreprise. Sorti en 2021, ce modèle est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche image-texte en anglais, similarité visuelle, classification zero-shot et clustering d’images dans des systèmes existants.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).