nomic-ai/colnomic-embed-multimodal-7b

Publié par Nomic AI le 31 mars 2025, nomic-ai/colnomic-embed-multimodal-7b est un modèle d’embedding multimodal de 7 milliards de paramètres, dérivé de Qwen2.5-VL 7B Instruct. Il produit des représentations multi-vecteurs de dimension 128, avec une variante dense également mentionnée.

Publié par Nomic AI le 31 mars 2025, nomic-ai/colnomic-embed-multimodal-7b est un modèle d’embedding multimodal de 7 milliards de paramètres, dérivé de Qwen2.5-VL 7B Instruct. Il produit des représentations multi-vecteurs de dimension 128, avec une variante dense également mentionnée.

Le modèle traite de manière unifiée le texte, les images entrelacées et les images de pages. Multilingue, mais plus performant en anglais, il cible la recherche sémantique et documentaire visuelle, le RAG, la similarité et le clustering. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNomic AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie31 mars 2025
Dimension du vecteur128
Représentationmulti-vecteur ; une variante dense est également mentionnée
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max128 000 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)81,3 %24ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V357,3 %14ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

▶ nomic-ai/colnomic-embed…81 %

MTEB: ViDoRe V3

▶ nomic-ai/colnomic-embed…57 %
Verm1ion/ColTurk-VDR-Qw…56 %

Notre analyse

Forces. Son principal atout réside dans la recherche au sein de documents visuels et multimodaux, notamment lorsque les informations sont réparties entre texte, images et pages numérisées. Sur ViDoRe V3, consacré à des documents d’entreprise multimodaux couvrant notamment la finance, il se place dans la première moitié des modèles évalués. La représentation multi-vecteur convient aux mécanismes de retrieval fin, tandis que la sortie de dimension 128 peut limiter la taille de chaque vecteur. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement.

Limites et points d’attention. Sur ViDoRe V1&V2, qui couvre différents types et domaines documentaires, le modèle se situe au milieu du classement. Son avantage multilingue doit être nuancé par une efficacité annoncée comme supérieure sur les contenus anglais. Malgré la dimension compacte, l’approche multi-vecteur peut multiplier les représentations par document, alourdir l’index et rendre la recherche plus coûteuse qu’avec une unique représentation dense. Sorti il y a environ un an, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche documentaire visuelle, RAG multimodal, similarité et clustering de corpus mêlant textes et images.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).