nomic-ai/colnomic-embed-multimodal-3b

Publié par Nomic AI le 31 mars 2025, nomic-ai/colnomic-embed-multimodal-3b est un modèle d’embedding multimodal de 3 milliards de paramètres actifs, affiné à partir de Qwen2.5-VL 3B Instruct. Son architecture vision-langage traite du texte, des images entrelacées et des images de pages…

Publié par Nomic AI le 31 mars 2025, nomic-ai/colnomic-embed-multimodal-3b est un modèle d’embedding multimodal de 3 milliards de paramètres actifs, affiné à partir de Qwen2.5-VL 3B Instruct. Son architecture vision-langage traite du texte, des images entrelacées et des images de pages de documents.

Le modèle produit des représentations multi-vecteurs de dimension 128, destinées à la recherche sémantique et visuelle, au RAG, à la mesure de similarité et au clustering. Il prend en charge plusieurs langues, avec une efficacité annoncée comme supérieure en anglais. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNomic AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie31 mars 2025
Dimension du vecteur128
Représentationmulti-vecteur
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max128 000 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)80,1 %29ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V355,8 %18ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

▶ nomic-ai/colnomic-embed…80 %

MTEB: ViDoRe V3

Verm1ion/ColTurk-VDR-Qw…56 %
▶ nomic-ai/colnomic-embed…56 %

Notre analyse

Forces. La spécialité de nomic-ai/colnomic-embed-multimodal-3b est la recherche visuelle dans des documents variés, notamment des contenus d’entreprise associant texte, images et pages numérisées. Ses résultats sur ViDoRe et ViDoRe V3 le situent dans le milieu du classement pour ce type de retrieval multimodal. La représentation multi-vecteurs permet de conserver plusieurs signaux par document, ce qui convient aux pipelines RAG fondés sur des pages visuellement complexes. La dimension 128 est compacte et peut alléger chaque vecteur stocké. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d'attention. Les classements ViDoRe ne placent pas le modèle parmi les références dominantes de la recherche visuelle, avec un positionnement moins favorable sur les versions V1 et V2 que sur V3. Le format multi-vecteurs peut aussi multiplier le nombre de représentations conservées par contenu, ce qui réduit en pratique le bénéfice d’une dimension unitaire compacte sur la taille de l’index et le coût de recherche. Le multilinguisme reste orienté vers l’anglais. Sorti il y a environ un an, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche multimodale de documents, RAG visuel, similarité et clustering de contenus textuels et imagés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).