nvidia/nemotron-colembed-vl-8b-v2
Publié par NVIDIA le 7 janvier 2026, nvidia/nemotron-colembed-vl-8b-v2 est un modèle d’embedding multimodal de 9 milliards de paramètres, tous actifs. Construit à partir de Qwen3-VL-8B-Instruct, il associe un encodeur visuel, un module de fusion vision-langage basé sur un MLP et un…
Publié par NVIDIA le 7 janvier 2026, nvidia/nemotron-colembed-vl-8b-v2 est un modèle d’embedding multimodal de 9 milliards de paramètres, tous actifs. Construit à partir de Qwen3-VL-8B-Instruct, il associe un encodeur visuel, un module de fusion vision-langage basé sur un MLP et un Transformer.
Le modèle encode des requêtes textuelles et des images RGB de pages en représentations multi-vecteurs de style ColBERT, avec une dimension de 4096. Enrichi par des données synthétiques multilingues, il cible la recherche sémantique de documents visuels et peut alimenter la récupération d’un système RAG, la mesure de similarité ou le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts |
| Licence | https://huggingface.co/nvidia/nemotron-colembed-vl-8b-v2/blob/main/LICENSE |
| Date de sortie | 7 janvier 2026 |
| Dimension du vecteur | 4 096 |
| Représentation | multi-vecteur de style ColBERT (late interaction) |
| Paramètres | 9 milliards |
| Paramètres actifs | 9 milliards |
| Longueur de séquence max | 262 144 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 84,8 % | 5ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 63,4 % | 3ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. nvidia/nemotron-colembed-vl-8b-v2 se classe parmi les meilleurs modèles évalués sur les deux versions de ViDoRe couvertes. Ses résultats indiquent une forte aptitude à la récupération visuelle de documents variés, notamment des pages mêlant texte et éléments graphiques, ainsi que des documents multimodaux d’entreprise. Son entraînement multilingue renforce son intérêt pour des corpus couvrant plusieurs langues et domaines. La représentation multi-vecteurs avec late interaction permet de comparer finement les composantes d’une requête textuelle avec celles d’une page, plutôt que de réduire chaque entrée à un unique vecteur global.
Limites et points d'attention. Les résultats sur ViDoRe V3 restent inférieurs à ceux obtenus sur ViDoRe V1&V2, ce qui signale une difficulté accrue sur cette évaluation de documents d’entreprise multimodaux. Les 9 milliards de paramètres rendent par ailleurs l’encodage plus exigeant qu’avec un petit modèle. La dimension de 4096 et l’approche multi-vecteurs alourdissent les index, la mémoire nécessaire et le coût de la recherche par rapport à une représentation compacte à vecteur unique. Usages pertinents : recherche de pages numérisées, récupération multimodale pour le RAG, similarité et regroupement de documents visuels multilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).