nvidia/llama-nemoretriever-colembed-3b-v1

Publié par NVIDIA le 27 juin 2025, nvidia/llama-nemoretriever-colembed-3b-v1 est un modèle d’embedding multimodal de 4 milliards de paramètres. Il associe SigLIP2 et Llama 3.2 3B dans une architecture à interaction tardive de style ColBERT, avec des représentations de 3 072 dimensions…

Publié par NVIDIA le 27 juin 2025, nvidia/llama-nemoretriever-colembed-3b-v1 est un modèle d’embedding multimodal de 4 milliards de paramètres. Il associe SigLIP2 et Llama 3.2 3B dans une architecture à interaction tardive de style ColBERT, avec des représentations de 3 072 dimensions produites pour chaque token.

Le modèle rapproche des requêtes textuelles de documents textuels ou visuels. Il cible la recherche sémantique, la similarité, le clustering, la recherche visuelle de documents et la sélection de contenus dans des systèmes RAG multimodaux, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNVIDIA
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/nvidia/llama-nemoretriever-colembed-1b-v1/blob/main/LICENSE
Date de sortie27 juin 2025
Dimension du vecteur3 072
Représentationmulti-vecteur à interaction tardive (style ColBERT)
Paramètres4 milliards
Paramètres actifs4 milliards
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)83,1 %16ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V357,3 %15ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

ApsaraStackMaaS/EvoQwen…83 %
▶ nvidia/llama-nemoretrie…83 %

MTEB: ViDoRe V3

▶ nvidia/llama-nemoretrie…57 %
Verm1ion/ColTurk-VDR-Qw…56 %

Notre analyse

Forces. Les résultats MTEB placent le modèle dans la première moitié des classements ViDoRe V1, V2 et V3. Son principal domaine de compétence est donc la recherche visuelle dans des documents variés, y compris des documents multimodaux d’entreprise. La représentation multi-vecteurs par token permet une interaction fine entre les éléments d’une requête et ceux d’un document, plutôt qu’une comparaison reposant sur un unique vecteur global. L’acceptation conjointe de textes et d’images facilite la recherche dans des corpus mêlant pages numérisées, contenu visuel et texte.

Limites et points d'attention. Le recul observé sur ViDoRe V3 indique une efficacité moins marquée sur les documents multimodaux d’entreprise que sur les versions antérieures du benchmark. Les vecteurs de 3 072 dimensions et l’approche multi-vecteurs alourdissent les index et rendent la recherche plus coûteuse qu’avec un embedding compact à vecteur unique. Avec environ un an d’ancienneté, durée très longue à l’échelle de l’IA, le modèle appartient à une génération probablement dépassée par des solutions plus récentes et souvent retirée des catalogues éditeurs. Usages pertinents : recherche visuelle de documents, RAG multimodal, similarité et clustering de corpus textuels ou illustrés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).