openai/clip-vit-large-patch14
Publié par OpenAI le 26 février 2021, openai/clip-vit-large-patch14 est un modèle d’embedding de 428 millions de paramètres, tous actifs. Il associe un encodeur d’images ViT-L/14 à un encodeur de texte Transformer et produit des vecteurs de 768 dimensions dans un espace commun…
Publié par OpenAI le 26 février 2021, openai/clip-vit-large-patch14 est un modèle d’embedding de 428 millions de paramètres, tous actifs. Il associe un encodeur d’images ViT-L/14 à un encodeur de texte Transformer et produit des vecteurs de 768 dimensions dans un espace commun image-texte. Son usage est limité à l’anglais.
Son entraînement contrastif rapproche les images de leurs légendes. Le modèle sert à la recherche sémantique multimodale, au calcul de similarité image-texte, à la classification d’images zero-shot, au clustering et à la sélection de contenus visuels pour des systèmes de RAG multimodal.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | OpenAI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 26 février 2021 |
| Dimension du vecteur | 768 |
| Représentation | représentations conjointes image-texte |
| Paramètres | 428 millions |
| Paramètres actifs | 428 millions |
| Longueur de séquence max | 77 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 59,2 % | 20ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 55,4 % | 19ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 49,9 % | 22ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 47,4 % | 26ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 8,0 % | 34ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent l’encodage d’images seules et les tâches image-texte en anglais, où le modèle se situe près du milieu du classement. Son espace conjoint permet de comparer directement une requête textuelle et une image, ou de regrouper des contenus visuels selon leur proximité sémantique. L’association d’un ViT-L/14 et d’un encodeur textuel entraînés par perte contrastive répond particulièrement aux scénarios de retrieval multimodal et de classification zero-shot.
Limites et points d'attention. Les performances reculent sur le track MTEB Image-Text Multilingual et davantage sur Image-Text Lite. ViDoRe V3 constitue sa faiblesse principale, avec un classement proche du bas du tableau pour la recherche dans des documents visuels multimodaux d’entreprise. Malgré une évaluation multilingue, l’usage du modèle doit rester limité à l’anglais. Sorti il y a environ cinq ans, il appartient à une génération très ancienne à l’échelle de l’IA et est probablement dépassé par des modèles plus récents. Usages pertinents : recherche image-texte en anglais, similarité multimodale, classification zero-shot et clustering d’images, plutôt que retrieval documentaire complexe ou multilingue.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).