nomic-ai/nomic-embed-vision-v1.5

Publié par Nomic AI le 8 juin 2024, nomic-ai/nomic-embed-vision-v1.5 est un modèle d’embeddings visuels de 93 millions de paramètres, tous actifs. Il produit des représentations denses de 768 dimensions dans le même espace vectoriel que nomic-embed-text-v1.5.

Publié par Nomic AI le 8 juin 2024, nomic-ai/nomic-embed-vision-v1.5 est un modèle d’embeddings visuels de 93 millions de paramètres, tous actifs. Il produit des représentations denses de 768 dimensions dans le même espace vectoriel que nomic-embed-text-v1.5.

Distribué sous licence ouverte Apache 2.0, il sert à la recherche sémantique entre textes et images, au RAG multimodal, à la mesure de similarité et au clustering d’images. Son encodeur visuel est aligné sur l’encodeur textuel verrouillé selon une méthode proche de LiT. Les requêtes textuelles doivent porter le préfixe « search_query: ».

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNomic AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 juin 2024
Dimension du vecteur768
Représentationdense
Paramètres93 millions
Paramètres actifs93 millions
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image-Text, English45,5 %38ᵉ / 40mteb✅ Mesuré
MTEB: Image only45,4 %43ᵉ / 45mteb✅ Mesuré
MTEB: Image-Text, Multilingual39,3 %40ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Lite36,4 %45ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image-Text, English

▶ nomic-ai/nomic-embed-vi…46 %

MTEB: Image only

▶ nomic-ai/nomic-embed-vi…45 %
nyu-visionx/moco-v3-vit…38 %

Notre analyse

Forces. Le meilleur résultat relatif du modèle sur MTEB concerne le track Image-Text, English, ce qui correspond à son usage central : rapprocher des images et des requêtes textuelles en anglais dans un espace commun. L’architecture permet notamment la recherche d’images à partir de texte et la constitution d’index multimodaux. Les vecteurs denses de 768 dimensions offrent un format relativement compact pour le stockage et la recherche, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Les classements MTEB placent le modèle près du bas de tableau sur l’ensemble des tracks évalués. Les résultats sont particulièrement faibles sur Image-Text, Multilingual, où il arrive dernier, ainsi que sur Image only et Image-Text, Lite. Sa prise en charge évaluée sur 39 langues ne se traduit donc pas par une forte qualité multilingue. Sorti il y a près de deux ans, il appartient à une génération ancienne à l’échelle de l’IA et est probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche texte-image en anglais, prototypage de RAG multimodal et clustering d’images lorsque l’ouverture de la licence prime sur le niveau de performance MTEB.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).