nvidia/llama-nemoretriever-colembed-1b-v1

Publié par NVIDIA le 27 juin 2025, nvidia/llama-nemoretriever-colembed-1b-v1 est un modèle d’embedding multimodal de 2 milliards de paramètres. Il associe SigLIP 2 et Llama 3.2, avec une représentation multi-vecteur à interaction tardive de style ColBERT. Les vecteurs produits ont une…

Publié par NVIDIA le 27 juin 2025, nvidia/llama-nemoretriever-colembed-1b-v1 est un modèle d’embedding multimodal de 2 milliards de paramètres. Il associe SigLIP 2 et Llama 3.2, avec une représentation multi-vecteur à interaction tardive de style ColBERT. Les vecteurs produits ont une dimension de 2048.

Le modèle encode des requêtes textuelles ainsi que des documents textuels ou des images de pages contenant du texte, des tableaux, des graphiques et des infographies. Ces représentations servent à la recherche sémantique et intermodale, au RAG multimodal, à la mesure de similarité et au clustering, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNVIDIA
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/nvidia/llama-nemoretriever-colembed-1b-v1/blob/main/LICENSE
Date de sortie27 juin 2025
Dimension du vecteur2 048
Représentationmulti-vecteur à interaction tardive (style ColBERT)
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)82,6 %22ᵉ / 48mteb✅ Mesuré
MTEB: ViDoRe V355,6 %19ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

▶ nvidia/llama-nemoretrie…83 %

MTEB: ViDoRe V3

Verm1ion/ColTurk-VDR-Qw…56 %
▶ nvidia/llama-nemoretrie…56 %

Notre analyse

Forces. La spécialisation principale concerne la recherche dans des documents visuels hétérogènes. Les évaluations ViDoRe montrent un positionnement de milieu de classement sur des corpus mêlant plusieurs types de documents et domaines, notamment des documents multimodaux d’entreprise et financiers. L’encodage au niveau des tokens préserve des correspondances fines entre une requête et les éléments d’une page. L’acceptation conjointe du texte et des images facilite l’indexation de contenus dans lesquels l’information est répartie entre paragraphes, tableaux, graphiques et infographies.

Limites et points d’attention. Les résultats ViDoRe ne placent pas le modèle parmi les tout premiers systèmes évalués, avec un positionnement intermédiaire sur les différentes versions. La dimension de 2048 s’applique à une représentation multi-vecteur par tokens, ce qui peut alourdir les index et rendre la recherche plus coûteuse qu’avec un embedding à vecteur unique. Avec environ un an d’ancienneté, durée très longue à l’échelle de l’IA, il appartient à une génération susceptible d’être dépassée par des modèles plus récents de sa catégorie et comparable à des références parfois retirées des catalogues. Usages pertinents : recherche intermodale dans des pages complexes et RAG multimodal fondé sur des documents visuels.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).