nvidia/nemotron-colembed-vl-4b-v2
Publié par NVIDIA le 7 janvier 2026, nvidia/nemotron-colembed-vl-4b-v2 est un modèle d’embedding multimodal de 5 milliards de paramètres actifs. Fondé sur Qwen3-VL-4B-Instruct et un encodeur visuel SigLIP-2, il associe vision et langage afin de représenter des requêtes textuelles et des…
Publié par NVIDIA le 7 janvier 2026, nvidia/nemotron-colembed-vl-4b-v2 est un modèle d’embedding multimodal de 5 milliards de paramètres actifs. Fondé sur Qwen3-VL-4B-Instruct et un encodeur visuel SigLIP-2, il associe vision et langage afin de représenter des requêtes textuelles et des images de pages.
Le modèle produit des représentations multi-vecteurs ColBERT de 2 560 dimensions pour chaque jeton. Entraîné avec des données synthétiques multilingues, il cible la recherche sémantique, la similarité, le regroupement de contenus, la recherche intermodale et le RAG multimodal sur des documents comprenant texte, tableaux, graphiques ou infographies.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts |
| Licence | https://huggingface.co/nvidia/nemotron-colembed-vl-4b-v2/blob/main/LICENSE |
| Date de sortie | 7 janvier 2026 |
| Dimension du vecteur | 2 560 |
| Représentation | multi-vecteur (ColBERT, interaction tardive) |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 83,9 % | 10ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 61,5 % | 7ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. nvidia/nemotron-colembed-vl-4b-v2 se classe dans le top 10 de ViDoRe V1&V2 et de ViDoRe V3. Ces résultats le situent parmi les modèles performants pour retrouver des documents visuels de formats et de domaines variés, y compris des documents multimodaux d’entreprise. L’interaction tardive de type ColBERT conserve une représentation par jeton, ce qui permet de comparer finement les éléments d’une requête avec le texte et les composants visuels d’une page. L’entraînement synthétique multilingue élargit son intérêt aux corpus composés de plusieurs langues.
Limites et points d'attention. Ses résultats MTEB concernent la recherche visuelle de documents, avec un classement légèrement meilleur sur ViDoRe V3 que sur ViDoRe V1&V2. L’architecture mobilise 5 milliards de paramètres actifs. Les vecteurs de 2 560 dimensions produits pour chaque jeton, combinés à une représentation multi-vecteur, peuvent alourdir les index et rendre la recherche plus coûteuse qu’avec un embedding dense unique. Les usages pertinents sont la recherche de pages multimodales, le RAG sur documents visuels, la recherche intermodale et la similarité entre requêtes textuelles et contenus documentaires.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).