nvidia/llama-nemotron-colembed-vl-3b-v2
Publié par NVIDIA le 21 janvier 2026, nvidia/llama-nemotron-colembed-vl-3b-v2 est un modèle d’embedding multimodal de 4 milliards de paramètres, tous actifs. Son architecture Transformer associe SigLIP2 et Llama 3.2 3B. Elle produit des représentations multi-vecteurs ColBERT de dimension…
Publié par NVIDIA le 21 janvier 2026, nvidia/llama-nemotron-colembed-vl-3b-v2 est un modèle d’embedding multimodal de 4 milliards de paramètres, tous actifs. Son architecture Transformer associe SigLIP2 et Llama 3.2 3B. Elle produit des représentations multi-vecteurs ColBERT de dimension 3 072.
Le modèle rapproche des requêtes textuelles et des documents présentés comme des images de pages. Son entraînement inclut des données synthétiques multilingues destinées à renforcer l’alignement entre langues et la recherche cross-lingue. Il cible la recherche sémantique, la récupération documentaire pour le RAG, la mesure de similarité et le clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts |
| Licence | https://huggingface.co/nvidia/llama-nemotron-colembed-vl-3b-v2/blob/main/LICENSE |
| Date de sortie | 21 janvier 2026 |
| Dimension du vecteur | 3 072 |
| Représentation | multi-vecteur (ColBERT) |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 83,6 % | 12ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 59,8 % | 11ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: ViDoRe V3
Notre analyse
Forces. Le principal atout de nvidia/llama-nemotron-colembed-vl-3b-v2 réside dans la recherche visuelle de documents. Ses résultats sur ViDoRe V1&V2 le placent dans le premier tiers des modèles évalués sur des types de documents et des domaines variés. L’interaction tardive de style ColBERT conserve plusieurs vecteurs par requête et par document, ce qui permet des correspondances plus fines qu’une représentation réduite à un seul vecteur. Le traitement de pages sous forme d’images convient aux documents complexes, tandis que l’enrichissement multilingue vise les recherches dans une langue vers des contenus rédigés dans une autre.
Limites et points d’attention. Les résultats sur ViDoRe V3 restent moins élevés que sur ViDoRe V1&V2, malgré un classement encore situé dans le premier tiers. Cette différence signale une robustesse plus limitée sur les documents d’entreprise multimodaux couverts par cette version du benchmark. La dimension de 3 072 et la représentation multi-vecteurs alourdissent les index par document et rendent la recherche plus coûteuse qu’avec des embeddings uniques de faible dimension. Avec 4 milliards de paramètres actifs, l’inférence exige également davantage de ressources qu’un petit encodeur. Usages pertinents : recherche sémantique de pages numérisées, RAG documentaire multimodal, recherche cross-lingue, similarité et clustering de documents visuels.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).