nomic-ai/nomic-embed-vision-v1.5
Publié par Nomic AI le 8 juin 2024, nomic-ai/nomic-embed-vision-v1.5 est un modèle d’embeddings visuels de 93 millions de paramètres, tous actifs. Il produit des représentations denses de 768 dimensions dans le même espace vectoriel que nomic-embed-text-v1.5.
Publié par Nomic AI le 8 juin 2024, nomic-ai/nomic-embed-vision-v1.5 est un modèle d’embeddings visuels de 93 millions de paramètres, tous actifs. Il produit des représentations denses de 768 dimensions dans le même espace vectoriel que nomic-embed-text-v1.5.
Distribué sous licence ouverte Apache 2.0, il sert à la recherche sémantique entre textes et images, au RAG multimodal, à la mesure de similarité et au clustering d’images. Son encodeur visuel est aligné sur l’encodeur textuel verrouillé selon une méthode proche de LiT. Les requêtes textuelles doivent porter le préfixe « search_query: ».
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Nomic AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 93 millions |
| Paramètres actifs | 93 millions |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image-Text, English | 45,5 % | 38ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image only | 45,4 % | 43ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 39,3 % | 40ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 36,4 % | 45ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image-Text, English
MTEB: Image only
Notre analyse
Forces. Le meilleur résultat relatif du modèle sur MTEB concerne le track Image-Text, English, ce qui correspond à son usage central : rapprocher des images et des requêtes textuelles en anglais dans un espace commun. L’architecture permet notamment la recherche d’images à partir de texte et la constitution d’index multimodaux. Les vecteurs denses de 768 dimensions offrent un format relativement compact pour le stockage et la recherche, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Les classements MTEB placent le modèle près du bas de tableau sur l’ensemble des tracks évalués. Les résultats sont particulièrement faibles sur Image-Text, Multilingual, où il arrive dernier, ainsi que sur Image only et Image-Text, Lite. Sa prise en charge évaluée sur 39 langues ne se traduit donc pas par une forte qualité multilingue. Sorti il y a près de deux ans, il appartient à une génération ancienne à l’échelle de l’IA et est probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche texte-image en anglais, prototypage de RAG multimodal et clustering d’images lorsque l’ouverture de la licence prime sur le niveau de performance MTEB.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).