nvidia/llama-embed-nemotron-8b
Publié par NVIDIA le 23 octobre 2025, nvidia/llama-embed-nemotron-8b est un modèle d’embedding dense de 8 milliards de paramètres, tous actifs. Fondé sur Llama-3.1-8B, il associe un décodeur Transformer à attention bidirectionnelle à un entraînement de type bi-encodeur. Chaque texte est…
Publié par NVIDIA le 23 octobre 2025, nvidia/llama-embed-nemotron-8b est un modèle d’embedding dense de 8 milliards de paramètres, tous actifs. Fondé sur Llama-3.1-8B, il associe un décodeur Transformer à attention bidirectionnelle à un entraînement de type bi-encodeur. Chaque texte est converti en un vecteur unique de 4 096 dimensions.
Le modèle cible la recherche sémantique, le reranking, la similarité, la classification, le clustering et l’indexation de contenus pour les systèmes RAG textuels. Son orientation multilingue et interlingue facilite le rapprochement de textes entre plusieurs langues. Les requêtes peuvent recevoir des instructions personnalisées, tandis que les documents sont encodés sans traitement particulier.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts |
| Licence | https://huggingface.co/nvidia/llama-embed-nemotron-8b/blob/main/LICENSE |
| Date de sortie | 23 octobre 2025 |
| Dimension du vecteur | 4 096 |
| Représentation | dense (un vecteur unique de 4 096 dimensions par texte) |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Dutch | 66,2 % | 2ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 10,8 % | 3ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Dutch
MTEB: Instruction Following
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les meilleurs sur Dutch, un ensemble couvrant notamment la classification, le clustering et la comparaison de paires en néerlandais. Il figure également dans le groupe de tête sur Instruction Following, consacré à la capacité de retrouver des contenus en respectant une consigne associée à la requête. Cette combinaison correspond bien aux moteurs de recherche multilingues, interlingues ou pilotés par des instructions. Le fonctionnement en bi-encodeur permet d’encoder séparément requêtes et documents, puis de réutiliser les vecteurs de documents dans un index.
Limites et points d'attention. Malgré son rang élevé sur Instruction Following, le niveau absolu mesuré sur ce track reste faible, ce qui invite à valider précisément les formulations de consignes et les corpus visés. Les vecteurs denses de 4 096 dimensions alourdissent le stockage des index et augmentent le coût des calculs de similarité par rapport à des représentations plus compactes. Les 8 milliards de paramètres impliquent aussi une empreinte d’exécution conséquente pour la seule phase d’encodage. Usages pertinents : recherche sémantique multilingue, RAG textuel, rapprochement interlingue, clustering, classification et reranking fondés sur la similarité vectorielle.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).