jinaai/jina-clip-v1
Publié par Jina AI le 30 mai 2024, jinaai/jina-clip-v1 est un modèle d'embedding multimodal anglophone de 223 millions de paramètres. Il produit des vecteurs denses de 768 dimensions pour placer textes et images dans un espace commun. Sa licence ouverte Apache 2.0 autorise notamment…
Publié par Jina AI le 30 mai 2024, jinaai/jina-clip-v1 est un modèle d'embedding multimodal anglophone de 223 millions de paramètres. Il produit des vecteurs denses de 768 dimensions pour placer textes et images dans un espace commun. Sa licence ouverte Apache 2.0 autorise notamment l'auto-hébergement.
Le modèle calcule des similarités texte-texte et texte-image. Il cible la recherche sémantique et intermodale, le clustering ainsi que la récupération de contenus pour le RAG multimodal. Il peut être exploité avec l'API Embeddings de Jina AI, Transformers, Sentence Transformers ou Transformers.js.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Jina AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 30 mai 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense multimodale (texte + image) |
| Paramètres | 223 millions |
| Paramètres actifs | 223 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image only | 54,1 % | 30ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 49,5 % | 29ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 44,9 % | 28ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 41,6 % | 35ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: ViDoRe (V1&V2) | 15,4 % | 48ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image only
MTEB: Image-Text, English
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent les tâches Image only et Image-Text Multilingual, même si le modèle reste dans la seconde moitié des classements correspondants. Cette polyvalence permet d'indexer conjointement des descriptions textuelles et des images, puis de retrouver un visuel à partir d'une requête en anglais. La représentation dense de 768 dimensions offre un format courant pour les bases vectorielles, tandis que la licence Apache 2.0 facilite l'intégration, la modification et l'auto-hébergement.
Limites et points d'attention. Les performances Image-Text, English et Image-Text, Lite demeurent également dans la seconde moitié des classements MTEB. Le résultat ViDoRe (V1&V2), dernier parmi les modèles évalués, rend ce modèle peu adapté à la recherche dans des documents visuels complexes. Son orientation textuelle anglophone limite aussi la recherche fondée sur des requêtes dans d'autres langues. Sorti il y a environ deux ans, un âge très long à l'échelle de l'IA, il est probablement dépassé par des modèles plus récents et peut avoir été retiré des catalogues actuels. Usages pertinents : recherche sémantique en anglais, similarité texte-image, clustering multimodal et prototypes de RAG multimodal.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).