nvidia/llama-nemotron-colembed-vl-3b-v2

Publié par NVIDIA le 21 janvier 2026, nvidia/llama-nemotron-colembed-vl-3b-v2 est un modèle d’embedding multimodal de 4 milliards de paramètres, tous actifs. Son architecture Transformer associe SigLIP2 et Llama 3.2 3B. Elle produit des représentations multi-vecteurs ColBERT de dimension…

Publié par NVIDIA le 21 janvier 2026, nvidia/llama-nemotron-colembed-vl-3b-v2 est un modèle d’embedding multimodal de 4 milliards de paramètres, tous actifs. Son architecture Transformer associe SigLIP2 et Llama 3.2 3B. Elle produit des représentations multi-vecteurs ColBERT de dimension 3 072.

Le modèle rapproche des requêtes textuelles et des documents présentés comme des images de pages. Son entraînement inclut des données synthétiques multilingues destinées à renforcer l’alignement entre langues et la recherche cross-lingue. Il cible la recherche sémantique, la récupération documentaire pour le RAG, la mesure de similarité et le clustering, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNVIDIA
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/nvidia/llama-nemotron-colembed-vl-3b-v2/blob/main/LICENSE
Date de sortie21 janvier 2026
Dimension du vecteur3 072
Représentationmulti-vecteur (ColBERT)
Paramètres4 milliards
Paramètres actifs4 milliards
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)83,6 %12ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V359,8 %11ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le principal atout de nvidia/llama-nemotron-colembed-vl-3b-v2 réside dans la recherche visuelle de documents. Ses résultats sur ViDoRe V1&V2 le placent dans le premier tiers des modèles évalués sur des types de documents et des domaines variés. L’interaction tardive de style ColBERT conserve plusieurs vecteurs par requête et par document, ce qui permet des correspondances plus fines qu’une représentation réduite à un seul vecteur. Le traitement de pages sous forme d’images convient aux documents complexes, tandis que l’enrichissement multilingue vise les recherches dans une langue vers des contenus rédigés dans une autre.

Limites et points d’attention. Les résultats sur ViDoRe V3 restent moins élevés que sur ViDoRe V1&V2, malgré un classement encore situé dans le premier tiers. Cette différence signale une robustesse plus limitée sur les documents d’entreprise multimodaux couverts par cette version du benchmark. La dimension de 3 072 et la représentation multi-vecteurs alourdissent les index par document et rendent la recherche plus coûteuse qu’avec des embeddings uniques de faible dimension. Avec 4 milliards de paramètres actifs, l’inférence exige également davantage de ressources qu’un petit encodeur. Usages pertinents : recherche sémantique de pages numérisées, RAG documentaire multimodal, recherche cross-lingue, similarité et clustering de documents visuels.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).