nvidia/nemotron-colembed-vl-4b-v2

Publié par NVIDIA le 7 janvier 2026, nvidia/nemotron-colembed-vl-4b-v2 est un modèle d’embedding multimodal de 5 milliards de paramètres actifs. Fondé sur Qwen3-VL-4B-Instruct et un encodeur visuel SigLIP-2, il associe vision et langage afin de représenter des requêtes textuelles et des…

Publié par NVIDIA le 7 janvier 2026, nvidia/nemotron-colembed-vl-4b-v2 est un modèle d’embedding multimodal de 5 milliards de paramètres actifs. Fondé sur Qwen3-VL-4B-Instruct et un encodeur visuel SigLIP-2, il associe vision et langage afin de représenter des requêtes textuelles et des images de pages.

Le modèle produit des représentations multi-vecteurs ColBERT de 2 560 dimensions pour chaque jeton. Entraîné avec des données synthétiques multilingues, il cible la recherche sémantique, la similarité, le regroupement de contenus, la recherche intermodale et le RAG multimodal sur des documents comprenant texte, tableaux, graphiques ou infographies.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNVIDIA
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/nvidia/nemotron-colembed-vl-4b-v2/blob/main/LICENSE
Date de sortie7 janvier 2026
Dimension du vecteur2 560
Représentationmulti-vecteur (ColBERT, interaction tardive)
Paramètres5 milliards
Paramètres actifs5 milliards
Longueur de séquence max262 144 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)83,9 %10ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V361,5 %7ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. nvidia/nemotron-colembed-vl-4b-v2 se classe dans le top 10 de ViDoRe V1&V2 et de ViDoRe V3. Ces résultats le situent parmi les modèles performants pour retrouver des documents visuels de formats et de domaines variés, y compris des documents multimodaux d’entreprise. L’interaction tardive de type ColBERT conserve une représentation par jeton, ce qui permet de comparer finement les éléments d’une requête avec le texte et les composants visuels d’une page. L’entraînement synthétique multilingue élargit son intérêt aux corpus composés de plusieurs langues.

Limites et points d'attention. Ses résultats MTEB concernent la recherche visuelle de documents, avec un classement légèrement meilleur sur ViDoRe V3 que sur ViDoRe V1&V2. L’architecture mobilise 5 milliards de paramètres actifs. Les vecteurs de 2 560 dimensions produits pour chaque jeton, combinés à une représentation multi-vecteur, peuvent alourdir les index et rendre la recherche plus coûteuse qu’avec un embedding dense unique. Les usages pertinents sont la recherche de pages multimodales, le RAG sur documents visuels, la recherche intermodale et la similarité entre requêtes textuelles et contenus documentaires.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).