nvidia/llama-embed-nemotron-8b

Publié par NVIDIA le 23 octobre 2025, nvidia/llama-embed-nemotron-8b est un modèle d’embedding dense de 8 milliards de paramètres, tous actifs. Fondé sur Llama-3.1-8B, il associe un décodeur Transformer à attention bidirectionnelle à un entraînement de type bi-encodeur. Chaque texte est…

Publié par NVIDIA le 23 octobre 2025, nvidia/llama-embed-nemotron-8b est un modèle d’embedding dense de 8 milliards de paramètres, tous actifs. Fondé sur Llama-3.1-8B, il associe un décodeur Transformer à attention bidirectionnelle à un entraînement de type bi-encodeur. Chaque texte est converti en un vecteur unique de 4 096 dimensions.

Le modèle cible la recherche sémantique, le reranking, la similarité, la classification, le clustering et l’indexation de contenus pour les systèmes RAG textuels. Son orientation multilingue et interlingue facilite le rapprochement de textes entre plusieurs langues. Les requêtes peuvent recevoir des instructions personnalisées, tandis que les documents sont encodés sans traitement particulier.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNVIDIA
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/nvidia/llama-embed-nemotron-8b/blob/main/LICENSE
Date de sortie23 octobre 2025
Dimension du vecteur4 096
Représentationdense (un vecteur unique de 4 096 dimensions par texte)
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Dutch66,2 %2ᵉ / 113mteb✅ Mesuré
MTEB: Instruction Following10,8 %3ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Dutch

▶ nvidia/llama-embed-nemo…66 %

MTEB: Instruction Following

▶ nvidia/llama-embed-nemo…11 %

Notre analyse

Forces. Les résultats MTEB placent le modèle parmi les meilleurs sur Dutch, un ensemble couvrant notamment la classification, le clustering et la comparaison de paires en néerlandais. Il figure également dans le groupe de tête sur Instruction Following, consacré à la capacité de retrouver des contenus en respectant une consigne associée à la requête. Cette combinaison correspond bien aux moteurs de recherche multilingues, interlingues ou pilotés par des instructions. Le fonctionnement en bi-encodeur permet d’encoder séparément requêtes et documents, puis de réutiliser les vecteurs de documents dans un index.

Limites et points d'attention. Malgré son rang élevé sur Instruction Following, le niveau absolu mesuré sur ce track reste faible, ce qui invite à valider précisément les formulations de consignes et les corpus visés. Les vecteurs denses de 4 096 dimensions alourdissent le stockage des index et augmentent le coût des calculs de similarité par rapport à des représentations plus compactes. Les 8 milliards de paramètres impliquent aussi une empreinte d’exécution conséquente pour la seule phase d’encodage. Usages pertinents : recherche sémantique multilingue, RAG textuel, rapprochement interlingue, clustering, classification et reranking fondés sur la similarité vectorielle.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).